Transcription en direct

Transcription en temps réel pendant que vous parlez

La transcription en direct remplit le texte pendant que les gens parlent encore, au lieu d'attendre la fin de l'enregistrement.

Live Transcription
La page Live Transcription avec la transcription en temps réel

Comment utiliser

  1. Ouvrez Live Transcription (Transcription en direct) dans la barre latérale et cliquez sur New Recording (Nouvel enregistrement)
  2. Réglez Speech Language (Langue parlée)
  3. Cliquez sur Start Recording (Démarrer l'enregistrement)
  4. Pause suspend la capture, Resume (Reprendre) la relance, Stop & Save (Arrêter et enregistrer) termine la session
  5. Dans la fenêtre Save Transcription, renseignez Title (Titre) et enregistrez. L'application indique "Tip: Configure post-processing in Settings to auto-generate titles" — avec le post-traitement configuré, un titre est proposé automatiquement
Aucune clé API nécessaire
La transcription en direct n'est pas réservée à ElevenLabs et rien ici n'exige de clé BYOK. Speakly choisit le chemin selon le moteur défini dans Settings → Transcription (Paramètres → Transcription). Avec ElevenLabs, il ouvre un flux temps réel : le texte partiel se met à jour pendant que vous parlez et est validé aux pauses. Avec tous les autres moteurs — Groq, OpenAI, Deepgram, Mistral, Google, un point de terminaison personnalisé, ou le Local Model sur l'appareil — il utilise un chemin par tranches : la détection d'activité vocale découpe chaque phrase à vos pauses et la transcrit juste après. Avec le modèle local, cela donne de la transcription en direct sans clé et sans réseau.

Deux pistes : votre micro et l'audio du système

Speakly peut transcrire ce que votre ordinateur joue — les autres participants d'une réunion, une vidéo — comme une seconde piste totalement indépendante. C'est ainsi que vous obtenez les deux côtés d'un appel : votre microphone est une piste, tout ce qui sort de vos haut-parleurs est l'autre. Chaque piste a sa propre détection d'activité vocale et ses propres requêtes de transcription, en parallèle : un interlocuteur fort ne peut donc pas couvrir votre micro.

Activation

  1. Ouvrez Live TranscriptionNew Recording, sans encore cliquer sur Start Recording
  2. Activez Also capture system audio (Capturer aussi l'audio du système) — "What your computer plays (participants, videos) is transcribed as its own track"
  3. Cliquez sur Start Recording. L'interrupteur est désactivé pendant qu'une session tourne ou est en pause : il doit donc être réglé avant
  4. Le choix est mémorisé d'une session à l'autre (paramètre liveCaptureSystemAudio)

La ligne n'apparaît que si la capture de l'audio système est disponible sur votre plateforme et si le moteur n'est pas le flux temps réel ElevenLabs.

Plateformes et autorisations

  • macOS : un utilitaire ScreenCaptureKit fourni avec l'app capture la sortie système, donc macOS demande l'autorisation Screen Recording (Enregistrement de l'écran) la première fois. Si elle est refusée, la session continue avec le microphone seul et Speakly affiche "System audio unavailable (…) — recording microphone only. Check Screen Recording permission in System Settings → Privacy & Security."
  • Windows : loopback WASAPI via le gestionnaire display-media de l'app — aucun utilitaire séparé, aucune demande d'autorisation supplémentaire
  • Linux : non pris en charge ; l'interrupteur n'apparaît pas

À quoi ressemble la transcription

  • Dans une session à deux pistes, une ligne par phrase, préfixée par l'heure à laquelle elle a été prononcée, par exemple [14:32:07]. Une session micro seul reste un paragraphe continu, sans préfixes.
  • À l'écran, l'horodatage est coloré selon la source : violet pour votre microphone, bleu pour l'audio du système — comme l'indique le pied de page : "purple timestamps are your mic, blue ones are the system audio"
  • Une ligne s'affiche en dès que la parole commence et se remplit quand son texte arrive : les lignes ne changent donc jamais d'ordre si une piste répond plus lentement
  • La transcription enregistrée d'une session à deux pistes nomme le locuteur dans le texte lui-même : [14:32:07] You: … pour votre microphone, [14:32:07] Them: … pour l'audio du système. La couleur n'existe qu'à l'écran : écrire le locuteur dans la ligne est ce qui fait survivre l'attribution à l'enregistrement et à la copie.

Couper une piste

Pendant une session à deux pistes, l'en-tête affiche un vumètre par piste. Cliquez sur l'icône du micro pour couper votre microphone, ou sur l'icône du haut-parleur pour couper l'audio système : la capture continue, mais rien de cette piste n'est transcrit — ni facturé — jusqu'à réactivation. Pratique pour ne garder que les autres participants, ou que vous.

Meeting notes

Ouvrez une session à deux pistes déjà enregistrée : le pied de page propose Meeting notes (Notes de réunion), dont l'infobulle indique "Summary, decisions and action items, attributed to each side". Comme la transcription dit qui a parlé, le résultat peut le dire aussi.

  • Summary — trois à six phrases sur le sujet réel de la réunion et sur ce qu'elle a produit
  • Decisions — une puce par décision, en disant qui a décidé ; "Nothing was decided." s'il n'y en a eu aucune
  • Action items — une puce chacune, sous la forme You — … ou Them — …, avec l'échéance si elle a été dite ; "No action items." s'il n'y en a pas
  • Open questions — ce qui a été soulevé et laissé sans réponse ; "None." s'il n'y a rien
Le bouton n'apparaît que là où l'attribution existe
Meeting notes n'est proposé que pour les transcriptions dont les lignes portent You: ou Them:, et seulement avec un fournisseur de post-processing configuré (les actions IA exigent aussi Pro — sinon elles sont désactivées avec "Upgrade to Pro to use AI features"). Les sessions enregistrées avant que le locuteur soit écrit dans le texte ont des heures mais pas de noms : elles ne peuvent pas être attribuées après coup et n'obtiennent pas le bouton.

Ce que vous obtenez

  • Texte en direct : mises à jour partielles avec le flux ElevenLabs, phrase par phrase avec le chemin par tranches
  • Des vumètres alimentés par le signal réellement capturé, un par piste
  • Coupure par piste dans les sessions à deux pistes
  • Copie dans le presse-papiers et enregistrement dans l'historique
  • Actions IA sur une transcription enregistrée : Flashcards, FAQ, Ask, Translate
  • Meeting notes sur une session à deux pistes enregistrée : résumé, décisions, actions par camp, questions ouvertes
Transcription en direct — Speakly