Lokale Modelle

100% Offline-Transkription mit Whisper

Die lokale Engine führt Whisper über whisper.cpp auf Ihrem Rechner aus: kein API-Schlüssel, kein Upload, und offline nutzbar, sobald die Modelldatei heruntergeladen ist.

Modelle verwalten

Öffnen Sie Settings → Transcription (Einstellungen → Transkription) und wählen Sie die Engine Local Model (On-Device) (Lokales Modell, auf dem Gerät). Die Liste Available Models (Verfügbare Modelle) hat die Filter-Tabs All / English / Multilingual. Jede Zeile hat eine Schaltfläche Download (Herunterladen), einen Radiobutton, der das heruntergeladene Modell aktiv setzt, und ein Papierkorbsymbol ("Delete model"), um Speicherplatz freizugeben. Die Dateien kommen aus dem whisper.cpp-Repository auf Hugging Face.

Verfügbare Modelle

Nur Englisch

  • Medium (English)medium.en, 1464 MB

Mehrsprachig (99 Sprachen)

  • Medium (Multilingual)medium, 1464 MB
  • Large V3 (Multilingual)large-v3, 2953 MB
  • Large V3 Turbo (Multilingual)large-v3-turbo, 1617 MB

Quantisiert

  • Large V3 Turbo Q5 (Quantized)large-v3-turbo-q5_0, 574 MB
  • Large V3 Turbo Q8 (Quantized)large-v3-turbo-q8_0, 874 MB — das Modell, mit dem eine Neuinstallation startet

Es gibt kein large-v3-turbo-en: Die Large- und Turbo-Modelle existieren nur mehrsprachig.

GPU-Beschleunigung

GPU-Beschleunigung heißt hier Metal, auf Apple Silicon, und sonst nirgends. Speakly aktiviert sie, wenn die Plattform macOS auf arm64 ist. Auf Intel-Macs, Windows und Linux läuft die lokale Transkription auf der CPU — es gibt keinen Vulkan- und keinen CUDA-Build.

  • Apple Silicon (M1 und neuer): Das Panel zeigt "Apple Metal detected! Local transcription will be 3x faster on your device." neben einem Kontrollkästchen Enable (Aktivieren), standardmäßig gesetzt
  • Alles andere: Das Panel zeigt "CPU-only mode. Consider using API for faster transcription." und es erscheint kein Schalter
Modellwahl
large-v3-turbo-q8_0 ist der Standard — mehrsprachig, schnell und präzise. Wer einen leichteren Download will, nimmt large-v3-turbo-q5_0 (574 MB) mit fast gleicher Genauigkeit; für maximale Präzision mit 3 GB auf der Platte gibt es large-v3.
Lokale Modelle — Speakly