Transcrição de Arquivos

Transcreva arquivos de áudio e vídeo

O Speakly transcreve arquivos de áudio e vídeo que você já tem: reuniões gravadas, entrevistas, memorandos de voz, vídeos de aula.

Transcribe Media
A página Transcribe Media, aberta pela barra lateral

Como usar

  1. Abra Transcribe Media (Transcrever Mídia) na barra lateral — esse é o nome real da aba
  2. Clique em New Transcription (Nova Transcrição) — abre a janela Transcribe Media File
  3. Solte o arquivo na área pontilhada ("Drop audio or video file here") ou clique em Choose File (Escolher Arquivo)
  4. Defina Media Language (Idioma da Mídia) — "Select the language spoken in the media for better accuracy"
  5. Clique em Start Transcription (Iniciar Transcrição)

Formatos aceitos

  • Áudio: .mp3, .wav, .m4a, .ogg, .webm, .flac, .aac, .wma
  • Vídeo: .mp4, .mov, .avi, .mkv

Aqui o .webm conta como áudio, não como vídeo. Outras extensões são ignoradas ao arrastar e recusadas com o erro Unsupported media format se chegarem à transcrição.

Limites

  • Duração máxima: 2 horas. Acima disso o arquivo é recusado com Audio too long (… min). Maximum is 120 minutes.
  • Qualquer arquivo acima de 8 minutos é dividido automaticamente em pedaços de 9 minutos com uma pequena sobreposição, transcritos um a um e depois unidos em um só texto
  • A própria janela informa o limite: "Audio and video files up to 2 hours. Long files are automatically split into chunks."
  • A divisão em blocos não custa mais os timestamps: os segmentos de cada bloco são deslocados para a linha de tempo completa, então a transcrição unida tem horários reais em todo o arquivo, e não um único 00:00

O progresso enquanto roda

Transcrever um arquivo não mostra mais só um spinner. A janela diz em que fase está e desenha uma barra com porcentagem, então um vídeo longo anda visivelmente em vez de deixar você na dúvida se travou.

  • Preparing the audio… (preparando o áudio) — o Speakly lê o arquivo e, quando ele é longo o bastante para ser dividido, o recodifica em partes. Num vídeo longo isso tudo acontece antes de sair a primeira palavra.
  • Transcribing media… (transcrevendo a mídia) — as partes são transcritas uma após a outra. Num arquivo longo o bastante para ser dividido aparece também Part x of y (parte x de y) abaixo da fase.
  • Putting it together… (juntando tudo) — as partes são unidas em uma única transcrição.

Com o motor Local Model (On-Device) a porcentagem também anda *dentro* de cada parte, porque esse motor informa o próprio progresso de decodificação enquanto trabalha. Um motor na nuvem responde a uma parte inteira em uma única requisição e não tem nada a informar no meio do caminho: com um provedor BYOK, portanto, a barra avança parte por parte.

Onde o arquivo é processado

Local só com o modelo local
O arquivo é processado na sua máquina apenas quando o motor é Local Model (On-Device). Com qualquer provedor Your API Key (BYOK) — OpenAI, Groq, ElevenLabs, Google, Deepgram, Mistral ou um endpoint próprio — o áudio é enviado para esse provedor. Confira ou troque o motor em Settings → Transcription (Configurações → Transcrição).

Uma instalação nova começa no modelo local; no Windows o onboarding pré-seleciona um provedor de nuvem. Em qualquer caso, a transcrição final fica guardada somente no seu dispositivo.

Timestamps

A transcrição aparece em linhas com timestamp, agrupadas para que a linha termine no fim da frase, e não a cada poucos segundos; onde a fala não tem ponto final, a linha é cortada depois de 320 caracteres ou 30 segundos. Engines que não devolvem timestamp nenhum continuam produzindo uma linha só, cobrindo o arquivo inteiro.

Aqui os timestamps são rótulos, não botões. Para navegar é preciso um player, e só as transcrições do YouTube incorporam um — veja YouTube Transcription. Para um arquivo local, você lê o horário e usa no seu próprio player.

Transcrições antigas mostram um único 00:00
Arquivos com mais de nove minutos eram divididos em blocos cujos timestamps eram jogados fora, deixando um segmento em 00:00. Esses dados nunca foram armazenados, então uma transcrição existente não ganha timestamps — transcreva o arquivo de novo.
Transcrição de Arquivos — Speakly