Transcription YouTube
Transcrire des vidéos YouTube
Collez une URL YouTube : Speakly télécharge l'audio et le transcrit.
Comment utiliser
- Cliquez sur YouTube dans la barre latérale — c'est un élément à part, sous Transcribe Media (Transcrire Média), et non une partie de celui-ci
- Cliquez sur New Transcription (Nouvelle transcription) pour ouvrir Transcribe YouTube Video
- Collez le lien dans le champ ("Paste YouTube URL here...")
- Réglez Video Language (Langue de la vidéo) sur la langue parlée dans la vidéo
- Cliquez sur Transcribe Video (Transcrire la vidéo)
Limites
- Vidéos jusqu'à 2 heures ; au-delà, l'opération échoue avec
Video is too long (… min). Maximum duration is 120 minutes for transcription. - Au-delà de 8 minutes, l'audio est découpé en tranches de 9 minutes puis fusionné en un seul texte — la fenêtre indique "Supports videos up to 2 hours. Long videos are automatically split into chunks."
- Les vidéos découpées conservent leurs horodatages : les segments de chaque tranche sont replacés sur la ligne de temps complète et les dix secondes de chevauchement sont retirées, si bien qu'une vidéo de deux heures a de vraies heures de bout en bout
La progression pendant le traitement
La fenêtre nomme l'étape en cours et, dès que la transcription démarre, trace une vraie barre avec un pourcentage : Downloading audio... (téléchargement de l'audio), puis Converting format... (conversion du format), puis Transcribing (may take a while for long videos)... (transcription en cours).
- Preparing the audio… (préparation de l'audio) — une deuxième ligne sous l'étape, pendant que l'audio est lu et, pour une vidéo assez longue pour être découpée, réencodé en parties. Sur une vidéo de deux heures, cela se passe avant l'apparition du moindre mot.
- Part x of y (partie x sur y) — affiché pendant la transcription de chaque partie, le pourcentage grimpant à côté de l'étape.
- Complete! (terminé) — les parties ont été fusionnées en transcription finale.
Avec le moteur Local Model (On-Device), le pourcentage bouge aussi à l'intérieur de chaque partie, parce que le moteur local rend compte de sa propre progression de décodage. Les moteurs cloud répondent à une partie en une seule requête et ne peuvent rien signaler entre-temps : là, la barre avance partie par partie.
Le résultat

- Le titre et la durée de la vidéo dans l'en-tête de la fenêtre, ainsi que le nombre de mots
- La transcription en lignes horodatées, regroupées pour qu'une ligne s'arrête là où la phrase s'arrête
- Actions IA : Flashcards, FAQ, Ask (Demander), Translate (Traduire)
- Copy All (Tout copier) copie toute la transcription ; Close (Fermer) ferme la fenêtre
Horodatages et lecteur
La vidéo est intégrée au-dessus de la transcription et chaque horodatage est un bouton — son infobulle est "Jump to this moment" — qui déplace le lecteur à cette seconde et lit à partir de là. Le lecteur n'apparaît que sur la vue transcription ; il est masqué sur Flashcards, FAQ, Ask et Translate, où il continuerait à jouer derrière le texte.
- Les lignes sont regroupées en fin de phrase au lieu d'une ligne par segment du moteur. La parole sans ponctuation est coupée quand même : un groupe s'arrête après 320 caractères ou 30 secondes.
- Un groupe garde le début de son premier segment : le clic tombe donc là où la phrase commence.
- Si le lecteur intégré ne répond pas encore, le clic recharge l'embed à cette seconde — plus lent, mais toujours efficace.