Audio in Text
umwandeln kostenlos
Wandeln Sie MP3, WAV, M4A und MP4 kostenlos in Text um. Die Datei bleibt im Browser und wird nicht hochgeladen.
Audiodatei hier ablegen
oder klicken zum Auswählen — MP3, WAV, M4A, OGG, WEBM, MP4 · nichts verlässt Ihr Gerät
Audio in Text umwandeln kostenlos, ohne Anmeldung und ohne Upload
Mit diesem kostenlosen Tool können Sie Audio in Text umwandeln: Sprachmemos, Interviews, Meetings und Aufnahmen werden zu kopierbarem Text. Fügen Sie eine MP3-, WAV-, M4A-, OGG-, WEBM- oder MP4-Datei hinzu, wählen Sie die Sprache und lassen Sie Whisper Tiny lokal im Browser transkribieren. Im Gegensatz zu vielen Online-Diensten wird Ihre Audiodatei nicht auf einen Server hochgeladen.
Audio hinzufügen
Ziehen Sie eine MP3-, WAV-, M4A-, OGG-, WEBM- oder MP4-Datei in das Ablagefeld oder klicken Sie, um eine Datei auszuwählen. Die Audiodatei wird direkt in die Seite geladen und niemals an einen Server gesendet.
Sprache wählen und transkribieren
Wählen Sie die gesprochene Sprache oder belassen Sie die automatische Erkennung, und klicken Sie dann auf „Transkribieren“. Das Modell Whisper Tiny wird einmalig heruntergeladen (rund 40 MB) und wandelt Ihre Sprache anschließend auf Ihrer eigenen CPU in Text um.
Transkript kopieren oder herunterladen
Lesen Sie das Transkript, kopieren Sie es in die Zwischenablage oder laden Sie es als .txt-Datei herunter — oder als .srt- bzw. .vtt-Untertitel mit Zeitstempeln für die Videountertitelung.
Audio kostenlos in Text umwandeln
Geben Sie dem Tool eine beliebige Aufnahme mit Sprache und erhalten Sie bearbeitbaren Text zurück. Kein manuelles Abtippen, kein Durchspulen der Zeitleiste, kein teurer Transkriptionsdienst.
Audio in Text umwandeln mit Whisper AI
Die Erkennung läuft mit dem Whisper-Tiny-Modell von OpenAI, einem echten neuronalen Sprache-zu-Text-Netzwerk, das lokal über WebAssembly läuft statt auf einem Server.
MP3, WAV, M4A und mehr
Sprachnotizen liegen meist als M4A vor, Podcasts und Musik meist als MP3, und Aufnahmen sind oft WAV. Alle funktionieren, ebenso OGG, WEBM und die Tonspur von MP4-Videos.
Untertitel mit Zeitstempeln
Neben reinem Text können Sie SRT- und VTT-Untertiteldateien mit Zeitcodes exportieren, die sich direkt für Videountertitel verwenden lassen — alles direkt in Ihrem Browser erzeugt.
Kostenlos und unbegrenzt
Ein wirklich kostenloser Audio-zu-Text-Konverter: kein Konto, keine Credits, kein Wasserzeichen und kein Minutenlimit. Transkribieren Sie so viele Dateien, wie Sie möchten.
Funktioniert nach dem ersten Durchlauf offline
Sobald das Modell im Browser zwischengespeichert ist, braucht die Transkription überhaupt kein Netzwerk mehr. Die Seite wandelt Audio auch im Flugzeug oder hinter einer Firewall weiter in Text um.
Interviews und Meetings
Verwandeln Sie ein aufgezeichnetes Interview, Meeting oder eine Vorlesung in durchsuchbaren Text, den Sie zitieren, zusammenfassen oder in Notizen einfügen können — ohne vertrauliche Gespräche an einen Cloud-Dienst zu senden.
Sprachnotizen und Diktate
Wandeln Sie eine schnelle Sprachnotiz, eine diktierte Idee oder eine Telefonaufnahme in bearbeitbaren Text um, damit Sie nie erneut abtippen müssen, was Sie bereits laut gesagt haben.
Untertitel und Beschriftungen
Erzeugen Sie SRT- oder VTT-Untertitel aus der Tonspur eines Videos, um Podcasts, Tutorials oder Social-Clips zu untertiteln und zugänglicher zu machen.
MP3 zu Text
Das gängigste Audioformat für Podcasts, Musik und Downloads. Wandeln Sie eine MP3-Datei in Text um, ohne die Datei vorher zu konvertieren.
WAV zu Text
Das unkomprimierte Format, das die meisten Recorder und DAWs erzeugen. WAV ist verlustfrei und liefert deshalb in der Regel die sauberste und genaueste Transkription.
M4A zu Text
Das Format, in dem iPhone-Sprachmemos und die meisten Handy-Recorder speichern. Transkribieren Sie eine M4A-Sprachnotiz direkt von Ihrem Gerät.
OGG, WEBM und MP4
Browser- und App-Aufnahmen liegen oft als OGG oder WEBM vor, und MP4-Videos enthalten eine Tonspur. Alle werden dekodiert und transkribiert, ohne dass ein separater Konvertierungsschritt nötig ist.
Ein bewusst winziges Modell
Die Transkription läuft mit Whisper Tiny, dem kleinsten Modell aus OpenAIs Whisper-Familie: rund 40 MB quantisierte Gewichte. Genau diese Größe macht Transkription im Browser überhaupt erst realistisch — ein großes Whisper-Modell wäre mehrere Gigabyte groß und ließe sich niemals an den Browser eines Besuchers ausliefern. Das Modell läuft über ONNX Runtime Web auf WebAssembly, sodass dasselbe neuronale Netz, das sonst auf einem Server laufen würde, stattdessen auf Ihrer eigenen CPU arbeitet. Whisper Tiny opfert etwas Genauigkeit für Geschwindigkeit und Größe; klare Sprache wird gut transkribiert, während starke Akzente, Hintergrundgeräusche oder überlappende Stimmen für jedes winzige Modell schwieriger sind.
Mehrsprachig von Grund auf
Whisper Tiny ist ein mehrsprachiges Modell (nicht das rein englische tiny.en). Es erkennt Sprache in Dutzenden Sprachen, darunter Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Russisch, Arabisch, Hindi und viele mehr. Wählen Sie für die besten Ergebnisse die gesprochene Sprache aus der Auswahl, oder lassen Sie Whisper sie automatisch erkennen.
Kein Upload, kein Server
Es gibt keinen Upload-Endpunkt und keinen API-Aufruf, der Ihre Audiodatei überträgt. Die Datei wird von der Seite dekodiert und an ein Modell übergeben, das im selben Browser-Tab läuft.
Nichts wird gespeichert
Weil die Audiodatei nie einen Server erreicht, gibt es nichts aufzubewahren, zu protokollieren oder zu löschen. Schließen Sie den Tab, und jede Spur der Aufnahme und ihres Transkripts ist verschwunden.
Sicher für vertrauliche Aufnahmen
Interviews, Therapiesitzungen, juristische Telefonate und private Meetings lassen sich transkribieren, ohne jemals ein Netzwerk zu durchqueren — was die meisten Online-Transkriptionstools ehrlicherweise nicht von sich behaupten können.
Nur das Modell wird heruntergeladen
Das Einzige, was durch das Netzwerk geht, ist das Modell selbst, das in Ihren Browser geladen wird. Daten fließen zu Ihnen hin, niemals von Ihnen weg.
Die meisten Audio-zu-Text-Tools laden Ihre Datei hoch
Der übliche Online-Transkriptionsdienst schickt Ihre Aufnahme an einen Server, führt dort die Spracherkennung aus und sendet den Text zurück. Ihre Audiodatei liegt damit auf einer fremden Festplatte und unterliegt fremden Aufbewahrungsregeln. Hier bleibt die Aufnahme auf Ihrem Gerät.
Keine Anmeldung, keine Minutenlimits
Cloud-Transkriptionsdienste bremsen die kostenlose Nutzung mit Minutenlimits, Monatskontingenten oder einer Anmeldepflicht aus, weil jede Minute sie Rechenleistung kostet. Transkription im Browser verbraucht Ihre eigene CPU — es gibt also nichts abzurechnen.
Ehrlich bei der Genauigkeit
Ein winziges Modell opfert etwas Genauigkeit, um überhaupt lokal laufen zu können. Bei klarer Sprache ist es gut nutzbar; bei verrauschtem Audio, starken Akzenten oder überlappenden Sprechern müssen Sie mit ein paar Korrekturen rechnen. Für studiotaugliche Genauigkeit möchten Sie eventuell dennoch ein größeres Modell verwenden.
01Wie wandle ich Audio in Text um?+
Legen Sie Ihre Audiodatei in das Feld oben auf dieser Seite, wählen Sie die gesprochene Sprache (oder belassen Sie die automatische Erkennung) und klicken Sie auf „Transkribieren“. Das Spracherkennungsmodell liest die Audiodatei und erstellt ein Transkript, das Sie kopieren oder als .txt, .srt oder .vtt herunterladen können. Ein Konto oder eine Installation ist nicht nötig.
02Ist dieser Audio-zu-Text-Konverter kostenlos?+
Ja, vollständig kostenlos und unbegrenzt. Es gibt kein Konto, kein Credit-System, kein Wasserzeichen und keine Obergrenze für die Zahl der Dateien oder Minuten. Die Transkription läuft auf Ihrem eigenen Rechner, es entstehen also keine Serverkosten, die wir weitergeben müssten.
03Laden Sie meine Audiodatei auf einen Server hoch?+
Nein. Das ist der wesentliche Unterschied zu den meisten Online-Audio-zu-Text-Konvertern. Ihre Datei wird direkt von der Seite eingelesen und von einem Modell verarbeitet, das in Ihrem Browser-Tab läuft. Die Audiodatei wird nie über das Netzwerk übertragen — es gibt also nichts, was wir speichern oder hören könnten.
04Welche Audioformate kann ich transkribieren?+
MP3, WAV, M4A, OGG, WEBM und MP4 sowie AAC und FLAC. Damit sind Sprachnotizen, Podcasts, Recorder-Ausgaben, Browser-Aufnahmen und die Tonspur von Videos abgedeckt. Dateien bis 200 MB werden akzeptiert.
05Welche Sprachen unterstützt es?+
Whisper Tiny ist mehrsprachig und erkennt Sprache in Dutzenden Sprachen, darunter Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Niederländisch, Russisch, Polnisch, Ukrainisch, Indonesisch, Vietnamesisch, Thailändisch, Malaiisch, Hindi, Arabisch, Türkisch, Hebräisch, Griechisch, Tschechisch, Schwedisch, Dänisch, Finnisch und Norwegisch. Wählen Sie eine Sprache aus der Auswahl oder lassen Sie sie automatisch erkennen.
06Welches Spracherkennungsmodell wird verwendet?+
Whisper Tiny, das kleinste mehrsprachige Modell aus OpenAIs Whisper-Familie — rund 40 MB quantisierte Gewichte. Es läuft über ONNX Runtime Web auf WebAssembly, vollständig in Ihrem Browser. Wir verwenden den mehrsprachigen Checkpoint, nicht das rein englische tiny.en.
07Kann ich Untertitel mit Zeitstempeln erhalten?+
Ja. Neben reinem Text können Sie das Transkript als .srt- oder .vtt-Untertiteldatei mit Zeitcodes herunterladen, die sich direkt an ein Video für Untertitel anhängen lässt. Die Zeitstempel werden vom Modell während der Transkription erzeugt.
08Warum dauert die erste Transkription länger als die folgenden?+
Beim ersten Durchlauf wird das Whisper-Modell heruntergeladen (rund 40 MB) und die WebAssembly-Laufzeit kompiliert. Danach ist das Modell im Browser zwischengespeichert, sodass jede weitere Datei sofort und ganz ohne Download transkribiert wird.
09Wie genau ist es?+
Whisper Tiny ist das kleinste Modell und bevorzugt daher Geschwindigkeit und Größe gegenüber maximaler Genauigkeit. Bei klarer Sprache mit einem einzelnen Sprecher ist es gut nutzbar; bei verrauschtem Audio, starken Akzenten oder überlappenden Stimmen müssen Sie einzelne Wörter korrigieren. Die genaue gesprochene Sprache statt der automatischen Erkennung auszuwählen, verbessert das Ergebnis meist.
10Funktioniert es offline?+
Nach dem ersten Durchlauf ja. Sobald Ihr Browser das Modell zwischengespeichert hat, gibt es keinerlei Netzwerkaktivität mehr — die Seite wandelt Audio also auch ganz ohne Verbindung weiter in Text um.
Jetzt Audio in Text umwandeln
Kostenlos, unbegrenzt und von Grund auf privat. Ihre Audiodatei wird in Ihrem Browser transkribiert und niemals hochgeladen.
Audio in Text umwandelnDa Audio vollständig in Ihrem Browser verarbeitet und niemals übertragen oder gespeichert wird, entsteht bei der Nutzung dieses Tools keine Datenübermittlung an uns. Das macht es zu einer guten Wahl für Aufnahmen, die unter die GDPR, HIPAA oder interne Vertraulichkeitsregeln fallen — für den angemessenen Umgang mit dem entstehenden Transkript bleiben jedoch Sie verantwortlich.