Modelos Locais

Transcrição 100% offline com Whisper

O motor local roda o Whisper na sua própria máquina via whisper.cpp: sem chave de API, sem envio de áudio, e funciona offline depois que o arquivo do modelo é baixado.

Gerenciando modelos

Abra Settings → Transcription (Configurações → Transcrição) e selecione o motor Local Model (On-Device) (Modelo Local, no dispositivo). A lista Available Models (Modelos Disponíveis) tem as abas de filtro All / English / Multilingual. Cada linha tem um botão Download, um botão de opção que ativa o modelo depois de baixado e um ícone de lixeira ("Delete model") para liberar espaço. Os arquivos vêm do repositório whisper.cpp no Hugging Face.

Modelos disponíveis

Somente inglês

  • Medium (English)medium.en, 1464 MB

Multilíngues (99 idiomas)

  • Medium (Multilingual)medium, 1464 MB
  • Large V3 (Multilingual)large-v3, 2953 MB
  • Large V3 Turbo (Multilingual)large-v3-turbo, 1617 MB

Quantizados

  • Large V3 Turbo Q5 (Quantized)large-v3-turbo-q5_0, 574 MB
  • Large V3 Turbo Q8 (Quantized)large-v3-turbo-q8_0, 874 MB — o modelo com que uma instalação nova começa

Não existe large-v3-turbo-en: os modelos large e turbo só existem na versão multilíngue.

Aceleração por GPU

Aceleração por GPU aqui significa Metal, em Apple Silicon, e em nenhum outro lugar. O Speakly a habilita quando a plataforma é macOS em arm64. Em Macs Intel, Windows e Linux a transcrição local roda na CPU — não há build com Vulkan nem com CUDA.

  • Apple Silicon (M1 ou mais novo): o painel mostra "Apple Metal detected! Local transcription will be 3x faster on your device." ao lado de uma caixa Enable (Ativar), marcada por padrão
  • Todo o resto: o painel mostra "CPU-only mode. Consider using API for faster transcription." e não há interruptor
Escolhendo um modelo
large-v3-turbo-q8_0 é o padrão — multilíngue, rápido e preciso. Se você quer um download mais leve, o large-v3-turbo-q5_0 (574 MB) mantém quase toda a precisão; para precisão máxima com 3 GB em disco, use o large-v3.
Modelos Locais — Speakly