Transcrição de Arquivos
Transcreva arquivos de áudio e vídeo
O Speakly transcreve arquivos de áudio e vídeo que você já tem: reuniões gravadas, entrevistas, memorandos de voz, vídeos de aula.

Como usar
- Abra Transcribe Media (Transcrever Mídia) na barra lateral — esse é o nome real da aba
- Clique em New Transcription (Nova Transcrição) — abre a janela Transcribe Media File
- Solte o arquivo na área pontilhada ("Drop audio or video file here") ou clique em Choose File (Escolher Arquivo)
- Defina Media Language (Idioma da Mídia) — "Select the language spoken in the media for better accuracy"
- Clique em Start Transcription (Iniciar Transcrição)
Formatos aceitos
- Áudio:
.mp3,.wav,.m4a,.ogg,.webm,.flac,.aac,.wma - Vídeo:
.mp4,.mov,.avi,.mkv
Aqui o .webm conta como áudio, não como vídeo. Outras extensões são ignoradas ao arrastar e recusadas com o erro Unsupported media format se chegarem à transcrição.
Limites
- Duração máxima: 2 horas. Acima disso o arquivo é recusado com
Audio too long (… min). Maximum is 120 minutes. - Qualquer arquivo acima de 8 minutos é dividido automaticamente em pedaços de 9 minutos com uma pequena sobreposição, transcritos um a um e depois unidos em um só texto
- A própria janela informa o limite: "Audio and video files up to 2 hours. Long files are automatically split into chunks."
- A divisão em blocos não custa mais os timestamps: os segmentos de cada bloco são deslocados para a linha de tempo completa, então a transcrição unida tem horários reais em todo o arquivo, e não um único 00:00
O progresso enquanto roda
Transcrever um arquivo não mostra mais só um spinner. A janela diz em que fase está e desenha uma barra com porcentagem, então um vídeo longo anda visivelmente em vez de deixar você na dúvida se travou.
- Preparing the audio… (preparando o áudio) — o Speakly lê o arquivo e, quando ele é longo o bastante para ser dividido, o recodifica em partes. Num vídeo longo isso tudo acontece antes de sair a primeira palavra.
- Transcribing media… (transcrevendo a mídia) — as partes são transcritas uma após a outra. Num arquivo longo o bastante para ser dividido aparece também Part x of y (parte x de y) abaixo da fase.
- Putting it together… (juntando tudo) — as partes são unidas em uma única transcrição.
Com o motor Local Model (On-Device) a porcentagem também anda *dentro* de cada parte, porque esse motor informa o próprio progresso de decodificação enquanto trabalha. Um motor na nuvem responde a uma parte inteira em uma única requisição e não tem nada a informar no meio do caminho: com um provedor BYOK, portanto, a barra avança parte por parte.
Onde o arquivo é processado
Uma instalação nova começa no modelo local; no Windows o onboarding pré-seleciona um provedor de nuvem. Em qualquer caso, a transcrição final fica guardada somente no seu dispositivo.
Timestamps
A transcrição aparece em linhas com timestamp, agrupadas para que a linha termine no fim da frase, e não a cada poucos segundos; onde a fala não tem ponto final, a linha é cortada depois de 320 caracteres ou 30 segundos. Engines que não devolvem timestamp nenhum continuam produzindo uma linha só, cobrindo o arquivo inteiro.
Aqui os timestamps são rótulos, não botões. Para navegar é preciso um player, e só as transcrições do YouTube incorporam um — veja YouTube Transcription. Para um arquivo local, você lê o horário e usa no seu próprio player.