Audio in Text umwandeln
Kostenlos, ohne Registrierung, und Ihre Dateien verlassen nie Ihr Gerät.
Legen Sie Ihre Dateien hier ab
Dateien auswählenNichts wird hochgeladen: Alles geschieht in Ihrem Browser
Die erste Transkription lädt das Spracherkennungsmodell einmalig herunter, anschließend speichert Ihr Browser es: etwa 75 MB bei Standardgenauigkeit, 240 MB bei hoher Genauigkeit. Das Video selbst verlässt Ihr Gerät nie.
Eine Sprachmemo, eine WhatsApp-Nachricht, ein Podcast, eine am Telefon aufgezeichnete Besprechung: Ziehen Sie die Datei hinein, die Spracherkennung wandelt sie in Text um, mit einem neuen Absatz bei jeder Pause. Die Aufnahme bleibt auf Ihrem Gerät, was bei einem privaten Gespräch oder einem beruflichen Vorstellungsgespräch wichtig ist.
So transkribieren Sie
- 1Ziehen Sie Ihr Video oder Ihre Aufnahme in das Feld oder klicken Sie, um es auszuwählen.
- 2Wählen Sie das Format: Fließtext (TXT), Untertitel im SRT- oder VTT-Format. Die gesprochene Sprache wird automatisch erkannt, Sie können sie aber auch in den Einstellungen festlegen.
- 3Beim ersten Mal wird das Spracherkennungsmodell einmalig heruntergeladen. Danach läuft alles auf Ihrem Gerät: Laden Sie den Text oder die Untertitel herunter.
Die Formate
MP3
Das universelle Audioformat. Es komprimiert verlustbehaftet, bei 192 kbit/s fast unhörbar, und läuft auf jedem Gerät, Player und Programm. Es ist das richtige Format, um einen Ton zu teilen.
M4A
Das Audioformat von Apple, genutzt von den Sprachmemos des iPhones und von iTunes. Es handelt sich um AAC in einem MP4-Container: gute Qualität bei geringer Größe, aber manche Player und Websites akzeptieren es nicht.
WAV
Das unkomprimierte Audioformat der Studios und Schnittprogramme. Es behält die volle Qualität, aber eine Minute Ton wiegt etwa zehn Megabyte, zehnmal mehr als ein MP3.
OGG
Ein offenes Audioformat, in Vorbis oder Opus. Es ist das Format der Sprachnachrichten von WhatsApp und Telegram. Es ist leicht und klingt gut, aber viele Player, Schnitttools und Geräte können es nicht abspielen.
TXT
Reiner Text, überall lesbar: der Inhalt der Aufnahme, in Absätzen, ohne Formatierung. Fügen Sie ihn in ein Dokument, eine E-Mail, einen Artikel oder ein KI-Tool ein.
Ihre Dateien bleiben bei Ihnen
Die Umwandlung erfolgt in Ihrem Browser, mit den Decodern Ihres Geräts. Keine Datei wird hochgeladen, keine Kopie wird aufbewahrt, und niemand außer Ihnen sieht Ihre Fotos oder Videos. Sie können das im Netzwerk-Tab der Entwicklertools Ihres Browsers überprüfen: Keine Ihrer Dateien verlässt das Gerät.
Häufige Fragen
Welche Dateien werden akzeptiert?
MP3, M4A (Sprachmemos des iPhones), WAV, OGG und Opus (Sprachnachrichten von WhatsApp und Telegram), FLAC sowie auch MP4-, MOV- und WebM-Videos.
Werden die verschiedenen Sprecher getrennt?
Nein, der Text folgt dem Gesprächsverlauf, ohne zu nennen, wer spricht. Pausen markieren die Absätze, was hilft, Sprecherwechsel zu erkennen.
Ist der Konverter wirklich kostenlos?
Ja, ohne Registrierung, ohne Wasserzeichen und ohne Begrenzung der Dateianzahl. Die Umwandlung läuft auf Ihrem Gerät und kostet uns nichts, also gibt es auch nichts, wofür wir Sie bezahlen lassen müssten.
Werden meine Dateien irgendwohin gesendet?
Nein. Sie werden in Ihrem Browser gelesen und umgewandelt und anschließend direkt auf Ihrem Gerät gespeichert. Kein Server erhält sie.
Gibt es eine maximale Größe?
Die Grenze ist der Arbeitsspeicher Ihres Geräts. Fotos und Audiodateien funktionieren problemlos; bei einem Video von mehreren Gigabyte ist ein Computer einem Smartphone überlegen.
Funktioniert es auf dem Smartphone?
Ja, auf iPhone wie auf Android, in Safari, Chrome oder Firefox. Für Video wird ein aktueller Browser benötigt: Er stellt die verwendeten Decoder bereit.
Und danach, mit KI
KI-Voice-over: derselbe Text, gelesen von drei Engines
Dasselbe Skript, gelesen von drei Sprachsynthese-Engines, ElevenLabs v3, MiniMax Speech 2.8 HD und OpenAI TTS HD, um das Voice-over nach Gehör zu wählen. Der vollständige Workflow, ohne Konto.
Tool öffnen