Modelli locali

Trascrizione 100% offline con Whisper

Il motore locale esegue Whisper sulla tua macchina tramite whisper.cpp: nessuna chiave API, nessun caricamento, e funziona offline una volta scaricato il file del modello.

Gestire i modelli

Apri Settings → Transcription (Impostazioni → Trascrizione) e seleziona il motore Local Model (On-Device) (Modello locale, sul dispositivo). L'elenco Available Models (Modelli disponibili) ha le schede di filtro All / English / Multilingual. Ogni riga ha un pulsante Download (Scarica), un pulsante di opzione che rende attivo il modello una volta scaricato e un'icona cestino ("Delete model") per liberare spazio. I file arrivano dal repository whisper.cpp su Hugging Face.

Modelli disponibili

Solo inglese

  • Medium (English)medium.en, 1464 MB

Multilingue (99 lingue)

  • Medium (Multilingual)medium, 1464 MB
  • Large V3 (Multilingual)large-v3, 2953 MB
  • Large V3 Turbo (Multilingual)large-v3-turbo, 1617 MB

Quantizzati

  • Large V3 Turbo Q5 (Quantized)large-v3-turbo-q5_0, 574 MB
  • Large V3 Turbo Q8 (Quantized)large-v3-turbo-q8_0, 874 MB — il modello con cui parte un'installazione nuova

Non esiste large-v3-turbo-en: i modelli large e turbo esistono solo in versione multilingue.

Accelerazione GPU

Qui accelerazione GPU significa Metal, su Apple Silicon, e da nessun'altra parte. Speakly la abilita quando la piattaforma è macOS su arm64. Su Mac Intel, Windows e Linux la trascrizione locale gira sulla CPU — non esiste una build Vulkan né CUDA.

  • Apple Silicon (M1 e successivi): il pannello mostra "Apple Metal detected! Local transcription will be 3x faster on your device." accanto a una casella Enable (Abilita), attiva per impostazione predefinita
  • Tutto il resto: il pannello mostra "CPU-only mode. Consider using API for faster transcription." e non compare alcun interruttore
Scegliere un modello
large-v3-turbo-q8_0 è il predefinito — multilingue, veloce e preciso. Se vuoi un download più leggero, large-v3-turbo-q5_0 (574 MB) mantiene quasi tutta la precisione; per la massima precisione con 3 GB su disco usa large-v3.
Modelli locali — Speakly