Transcription de fichiers
Transcrire des fichiers audio et vidéo
Speakly transcrit les fichiers audio et vidéo que vous avez déjà : réunions enregistrées, entretiens, mémos vocaux, vidéos de cours.

Comment utiliser
- Ouvrez Transcribe Media (Transcrire Média) dans la barre latérale — c'est le vrai nom de l'onglet
- Cliquez sur New Transcription (Nouvelle transcription) — la fenêtre Transcribe Media File s'ouvre
- Déposez le fichier sur la zone en pointillés ("Drop audio or video file here") ou cliquez sur Choose File (Choisir un fichier)
- Réglez Media Language (Langue du média) — "Select the language spoken in the media for better accuracy"
- Cliquez sur Start Transcription (Démarrer la transcription)
Formats pris en charge
- Audio :
.mp3,.wav,.m4a,.ogg,.webm,.flac,.aac,.wma - Vidéo :
.mp4,.mov,.avi,.mkv
Ici .webm compte comme de l'audio, pas comme de la vidéo. Les autres extensions sont ignorées au dépôt et refusées avec l'erreur Unsupported media format si elles arrivent jusqu'à la transcription.
Limites
- Durée maximale : 2 heures. Au-delà, le fichier est refusé avec
Audio too long (… min). Maximum is 120 minutes. - Tout fichier de plus de 8 minutes est découpé automatiquement en tranches de 9 minutes avec un léger chevauchement, transcrites une par une puis fusionnées en un seul texte
- La fenêtre indique la même limite : "Audio and video files up to 2 hours. Long files are automatically split into chunks."
- Le découpage ne coûte plus les horodatages : les segments de chaque tranche sont replacés sur la ligne de temps complète, donc la transcription fusionnée porte de vraies heures sur tout le fichier au lieu d'un unique 00:00
La progression pendant le traitement
Une transcription de fichier ne se résume plus à un indicateur qui tourne. La fenêtre nomme la phase en cours et trace une barre avec un pourcentage : une longue vidéo avance visiblement au lieu de vous laisser deviner si elle est bloquée.
- Preparing the audio… (préparation de l'audio) — Speakly lit le fichier et, s'il est assez long pour être découpé, le réencode en parties. Sur une longue vidéo, tout cela se produit avant le moindre mot.
- Transcribing media… (transcription du média) — les parties sont transcrites l'une après l'autre. Pour un fichier assez long pour être découpé, Part x of y (partie x sur y) s'affiche sous la phase.
- Putting it together… (assemblage) — les parties sont fusionnées en une seule transcription.
Avec le moteur Local Model (On-Device), le pourcentage bouge aussi *à l'intérieur* de chaque partie, parce que ce moteur rend compte de sa propre progression de décodage. Un moteur cloud répond à une partie entière en une seule requête et n'a rien à signaler entre-temps : avec un fournisseur BYOK, la barre avance donc partie par partie.
Où le fichier est traité
Une installation neuve démarre sur le modèle local ; sous Windows, l'onboarding présélectionne un fournisseur cloud. Dans les deux cas, la transcription finale n'est stockée que sur votre appareil.
Horodatages
La transcription s'affiche en lignes horodatées, regroupées pour qu'une ligne s'arrête à la fin d'une phrase plutôt que toutes les quelques secondes ; là où la parole n'a pas de point, la ligne est coupée après 320 caractères ou 30 secondes. Les moteurs qui ne renvoient aucun horodatage produisent toujours une seule ligne couvrant tout le fichier.
Ici les horodatages sont des étiquettes, pas des boutons. Se déplacer demande un lecteur à piloter, et seules les transcriptions YouTube en intègrent un — voir Transcription YouTube. Pour un fichier local, vous lisez l'heure et l'utilisez dans votre propre lecteur.