💬Audio to Text
Sprache zu Text transkribieren + SRT-Untertitel. Gratis, privat, ohne Anmeldung — Dateien verlassen deinen Browser nie.
First run downloads the AI speech model once (~40MB), then it’s fast. 100% private — on-device.
Gesprochene Worte zu Text, mit Zeitstempeln.
KI auf dem Gerät hört dein Audio oder Video und schreibt jedes Wort auf – mit Zeiten, die du in Untertitel verwandeln kannst. Nichts wird hochgeladen.
So benutzt du Audio to Text
Verwandle Gesprochenes in geschriebenen Text. Lege eine Audio- oder Videodatei ab und KI auf dem Gerät schreibt auf, was gesagt wird – mit Zeitstempeln. Lade das Transkript als Text oder als SRT-Untertitel für deine Videos. Nichts wird hochgeladen.
- 1Audio- oder Videodatei hierher ziehen (MP3, WAV, M4A, MP4).
- 2Auf Transkribieren klicken und die KI zuhören lassen (ein, zwei Minuten).
- 3Text kopieren oder als .txt / .srt-Untertitel laden.
Anwendungsfälle
Was Audio to Text kann
- ✓Wortgenaue Transkription mit Satz-Zeitstempeln, bereit für Untertitel.
- ✓.txt- und .srt-Downloads mit einem Klick, plus Kopieren in Zwischenablage.
- ✓Sprache wird automatisch erkannt – 99 Sprachen, darunter Deutsch und Englisch.
- ✓Modell wird einmal geladen (~40MB) und zwischengespeichert – Transkription läuft danach komplett offline.
- ✓Privat von Natur aus: Deine Aufnahmen verlassen das Gerät nie.
Details
- Speed
- Etwa Echtzeit bei kurzen Clips, auf dem Gerät
- Input
- MP3, WAV, M4A, MP4
- Output
- Reiner Text, .txt, .srt mit Zeitstempeln
- Privacy
- KI auf dem Gerät, null Uploads
- Cost
- Kostenlos, unbegrenzt, ohne Anmeldung
Häufige Fragen
Wird mein Audio irgendwo hochgeladen?
Nein. Das Whisper-Sprachmodell läuft komplett in deinem Browser. Deine Aufnahme verlässt dein Gerät nie.
Welche Sprachen werden unterstützt?
Dutzende, darunter Deutsch, Englisch, Spanisch, Französisch und Hindi – das Modell erkennt die Sprache automatisch.
Was erhalte ich am Ende?
Reinen Transkripttext plus Segmente mit Zeitstempeln, die du als .txt- oder .srt-Untertiteldatei laden kannst.
Warum dauert der erste Durchlauf länger?
Das KI-Modell (~40MB) wird einmal geladen und zwischengespeichert. Die Transkription selbst läuft lokal und dauert bei kurzen Clips etwa so lang wie der Clip.