Trascrizione file
Trascrivi file audio e video
Speakly trascrive i file audio e video che hai già: riunioni registrate, interviste, memo vocali, video di lezioni.

Come usare
- Apri Transcribe Media (Trascrivi Media) nella barra laterale — è il nome reale della scheda
- Clicca New Transcription (Nuova trascrizione) — si apre la finestra Transcribe Media File
- Trascina il file sull'area tratteggiata ("Drop audio or video file here") oppure clicca Choose File (Scegli file)
- Imposta Media Language (Lingua del media) — "Select the language spoken in the media for better accuracy"
- Clicca Start Transcription (Avvia trascrizione)
Formati supportati
- Audio:
.mp3,.wav,.m4a,.ogg,.webm,.flac,.aac,.wma - Video:
.mp4,.mov,.avi,.mkv
Qui .webm conta come audio, non come video. Le altre estensioni vengono ignorate al drop e rifiutate con l'errore Unsupported media format se arrivano alla trascrizione.
Limiti
- Durata massima: 2 ore. Oltre, il file viene rifiutato con
Audio too long (… min). Maximum is 120 minutes. - Qualsiasi file oltre 8 minuti viene diviso automaticamente in blocchi da 9 minuti con una breve sovrapposizione, trascritti uno per uno e poi uniti in un unico testo
- La finestra riporta lo stesso limite: "Audio and video files up to 2 hours. Long files are automatically split into chunks."
- La divisione in blocchi non costa più i timestamp: i segmenti di ogni blocco vengono spostati sulla linea temporale completa, così la trascrizione unita ha orari reali su tutto il file invece di un solo 00:00
L'avanzamento durante l'elaborazione
Una trascrizione da file non mostra più solo uno spinner. La finestra nomina la fase in corso e disegna una barra con la percentuale, così un video lungo si vede avanzare invece di lasciarti nel dubbio se sia bloccato.
- Preparing the audio… (preparazione dell'audio) — Speakly legge il file e, se è abbastanza lungo da essere diviso, lo ricodifica in parti. Su un video lungo tutto questo accade prima che venga prodotta una sola parola.
- Transcribing media… (trascrizione del media) — le parti vengono trascritte una dopo l'altra. Per un file abbastanza lungo da essere diviso compare anche Part x of y (parte x di y) sotto la fase.
- Putting it together… (unione delle parti) — le parti vengono unite in un'unica trascrizione.
Con il motore Local Model (On-Device) la percentuale si muove anche *dentro* ogni parte, perché quel motore riporta il proprio avanzamento di decodifica mentre lavora. Un motore cloud risponde a un'intera parte con una sola richiesta e non ha nulla da riportare nel frattempo: con un provider BYOK, quindi, la barra avanza parte per parte.
Dove viene elaborato il file
Un'installazione nuova parte dal modello locale; su Windows l'onboarding preseleziona un provider cloud. In ogni caso la trascrizione finale resta salvata solo sul tuo dispositivo.
Timestamp
La trascrizione è mostrata in righe con timestamp, raggruppate perché la riga finisca alla fine di una frase e non ogni pochi secondi; dove il parlato non ha punto, la riga viene tagliata dopo 320 caratteri o 30 secondi. Gli engine che non restituiscono alcun timestamp producono comunque una riga sola che copre tutto il file.
Qui i timestamp sono etichette, non pulsanti. Per spostarsi serve un player da comandare, e solo le trascrizioni da YouTube ne incorporano uno — vedi Trascrizione YouTube. Per un file locale leggi l'orario e lo usi nel tuo player.