MP3 zu Text transkribieren.Sprecherkennzeichnung, 100+ Sprachen.

Laden Sie eine MP3-Datei mit beliebiger Bitrate von 64 bis 320 kbps hoch. Erhalten Sie ein zeitgestempeltes, mit Sprechern gekennzeichnetes Transkript in 99 Sprachen — keine Formatkonvertierung, keine Neukodierung, kein Warten in einer Warteschlange.

Audio oder Video ablegen

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Direkt aus Ihrem Browser aufnehmen

Die Registrierung dauert 30 Sekunden – die Aufnahme öffnet sich danach direkt im Dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTDateien werden automatisch nach 24h gelöscht

↓ Sehen Sie, was herauskommt

MP3 rein. Transkript mit Sprecherkennzeichnung raus.

Wir lesen die MP3-Frame-Header direkt — VBR, CBR, Joint-Stereo, beliebiger Encoder (LAME, Fraunhofer, FFmpeg). Wenn die Datei echtes Stereo mit Sprechern auf separaten Kanälen ist, nutzen wir das, um Stimmen zu trennen. Mono-Abmischung zieht sich auf akustische Sprechererkennung zurück.

interview-tape-04.mp3REC 192 kbps · Stereo · 38:42
automatisch erkannt en-GB44,1 kHz · LAME 3.100
~90s
Transkript · Streaming95% Genauigkeit
S1

Also, wann hast du realisiert, dass das Archiv unvollständig ist?

S2

Wahrscheinlich um 2019, als wir anfingen, die Spulen zu digitalisieren.

S1

Und die fehlenden Bänder — waren sie irgendwo katalogisiert?

S2

Es gibt einen Papierkatalog aus 1978, aber die Hälfte davon ist wasserbeschädigt.

95% bei 192 kbps StereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Drei echte Optionen · ehrlicher Vergleich

Kostenloses lokales Whisper. Otter oder Sonix. Oder wir.

Sie können Whisper kostenlos auf Ihrem eigenen Laptop ausführen, wenn Sie technisch versiert sind. Otter und Sonix akzeptieren MP3-Uploads in Abonnement-Dashboards. Wir nehmen die Datei, geben Ihnen das Transkript zurück und zwingen Sie nicht, in einer Benutzeroberfläche zu leben.

Option 01

Whisper lokal / Open Source

Kostenlos, wenn Sie eine GPU und einen Nachmittag Zeit haben. Keine Sprechererkennung ab Werk.

SetupPython + CUDA + 10-GB-Modelle
SprechererkennungNicht enthalten (pyannote-Add-on)
Geschwindigkeit · 1 Std. MP35–40 Min. auf Consumer-GPU
Sprachen99, aber kleines Modell fällt unter 80%
ExportTXT / SRT / VTT / JSON
KostenKostenlos + Ihr Strom
Best forIngenieure, die bereits eine GPU besitzen, keine Sprecherkennzeichnung benötigen und vollständige lokale Privatsphäre mögen.
Option 02

Transcription.Solutions

Werfen Sie die MP3 hin. Erhalten Sie gekennzeichneten Text in etwa Echtzeit × 0,025 zurück.

SetupDrag-and-Drop, kein Konto erforderlich zum Testen
SprechererkennungIntegriert (Pro & Business-Pläne)
Geschwindigkeit · 1 Std. MP3~90 Sekunden
Sprachen99, automatisch erkannt
ExportSRT · VTT · DOCX · TXT · JSON
Kosten · pro Min.$0.03
Best forJeder mit einer MP3 — Journalisten-Mitschnitt, Podcast-Export, Sprachmemo, Archiv-Kopie — der einfach nur exakten Text erhalten möchte.
Option 03

Otter / Sonix

Poliertes Dashboard, monatliches Minuten-Limit, auf Englisch optimiert. Datei-Upload wirkt wie eine Nebenfunktion.

SetupKonto + Bezahlplan
SprechererkennungAkustisch, auf Englisch ausgerichtet
Geschwindigkeit · 1 Std. MP35–10 Min. in Warteschlange
SprachenOtter nur Englisch; Sonix ~40
ExportHinter kostenpflichtigen Stufen gesperrt
Kosten$17+/Monat oder $10+/Std. (Sonix)
Best forTeams, die einen Transkript-Editor und eine Zusammenarbeits-UI mehr wollen als einen sauberen API-ähnlichen Datei-zu-Text-Fluss.

Preisgestaltung und Funktionsverfügbarkeit aktuell ab Mai 2026. Whisper-Leistung variiert je nach Modellgröße und Hardware.

Spezifisch für MP3

Drei Probleme mit generischen Transkriptionstools.

MP3 ist ein Format, kein Aufnahmestil — was bedeutet, dass die Fehlermodi vom Encoder stammen, nicht von der Sprache.

Was schiefgeht

  1. 1VBR-Header werden falsch geparst. Einige Tools lesen MP3s mit variabler Bitrate als Festrate und miscalkulieren die Dauer — Zeitstempel verschoben sich über eine Stunde lange Datei um Minuten.
  2. 2Joint-Stereo wird beim Upload-Preprocessing auf Mono reduziert. Sie verlieren die Pro-Sprecher-Kanaltrennung, die tatsächlich in der Datei war.
  3. 3Eingebettete ID3-Album-Grafiken treten einige Uploader — sie lehnen die Datei als 'keine reine Audio' ab oder entfernen sie und kodieren neu, verschlechtern die Qualität weiter.

Das machen wir stattdessen

  1. 1Wir verwenden den Xing/LAME-Header, wenn vorhanden, und das Fallback der Frame-Zahl, wenn nicht. VBR-Zeitstempel bleiben über mehrstündige Dateien auf ±0,1 s genau.
  2. 2Joint-Stereo und echte Stereo-MP3s werden vor der Sprechererkennung in L/R-PCM dekodiert. Wenn Ihre Sprecher gepannt waren, behalten wir sie getrennt.
  3. 3ID3v1, ID3v2, APE-Tags, eingebettete Grafiken — alle unverändert weitergeleitet. Wir kodieren Ihre MP3 niemals neu.

Empfohlene Jobeinstellungen für MP3-Uploads

Standardwerte, die zu ~80% der MP3-Dateien passen. Überschreiben Sie pro Job aus dem Formular.

Decoder
Frame-genau, keine Neukodierung
Sprechererkennung
Kanaltrennung bei Stereo, andernfalls akustisch
Sprecher-Modell
Automatisch · 1–12 Sprecher
Sprache
Automatische Erkennung aus ersten 30 s
Füllwörter
Entfernt (umschalten zum Behalten)
Export-Paket
DOCX + SRT + zeitgestempeltes TXT

Accuracy · real-world numbers

95%+ bei 192 kbps Stereo. Einsetzbar bis 64 kbps Mono.

Die MP3-Genauigkeit ist durch das, was der Encoder behalten hat, nicht durch uns begrenzt. Wahrnehmungskompression über ~96 kbps bewahrt Sprachintelligibilität sehr gut; unter 64 kbps beginnen Zischlaute und Konsonanten zu verschwinden. Die Zahlen unten stammen aus echten MP3-Dateien von Kunden in der Produktion.

96%
320 kbps Stereo, Studio-Quelle

Nahezu verlustfrei für Sprache. Podcast-Master, Diktat-App-Exporte, professionelle Interview-Rigs. Sprechererkennung ist sauber, wenn Sprecher auf separaten Kanälen sind.

95%
192 kbps Stereo, 2–3 Sprecher

Häufigste Bitrate für gesprochene MP3s. Zoom-Exporte, Riverside-Downloads, Standard der Sprachrekorder. Kompressionsartefakte sind für den Recognizer unmerklich.

91%
128 kbps Mono, Gespräch

Standard-Sprachmemo bei den meisten Telefonen. Akustische Sprechererkennung bewältigt 2–4 Sprecher. Zahlen und Eigennamen benötigen gelegentlich eine Überprüfung.

84%
64 kbps Mono, Archiv / Telefon-Speicher

Alte Anrufbeantworter-Rips, Vorlesungsarchive, Schmalband-Quellen. Hochfrequente Konsonanten (f/s/sch) verschwimmen. Noch lesbar — planen Sie eine Korrektur ein.

Häufige Fragen

8 häufig gestellte Fragen zur MP3-Transkription.

01Was ist die minimale MP3-Bitrate, die noch ein verwertbares Transkript ergibt?+
64 kbps ist die praktische Untergrenze. Darunter komprimieren sich Zischlaute (s, sch, f) in Rauschen und die Worterkennungsrate klettert über 20%. Wenn Sie frisch aufnehmen, zielen Sie auf 128 kbps Mono oder 192 kbps Stereo — alles Höhere ist Overkill für Sprache.
02Muss ich meine MP3 vor dem Upload erst in WAV konvertieren?+
Nein. Das Neukodieren MP3 → WAV addiert null Genauigkeit, da die Daten, die der Encoder verworfen hat, ohnehin weg sind. Laden Sie die MP3 direkt hoch. Wir dekodieren Frames im Speicher und übertragen PCM an den Recognizer.
03Gibt mir Stereo-MP3 bessere Sprecherkennzeichnung als Mono?+
Nur wenn die Sprecher tatsächlich auf separaten Kanälen aufgenommen wurden — die meisten Stereo-MP3s haben den gleichen Ton auf beiden Seiten ('Dual Mono') und gewinnen nichts. Echte Kanaltrennung (z. B. Riverside-Exporte, Zweimikrophon-Feldaufbauten) lässt uns die akustische Sprechererkennung überspringen und Sprecher nahezu perfekt kennzeichnen.
04Welche maximale MP3-Dateigröße akzeptieren Sie?+
5 GB pro Upload, was ungefähr 60 Stunden bei 192 kbps oder 90 Stunden bei 128 kbps entspricht. Wenn Ihre Datei größer ist, zeigen wir einen Upload mit Chunks — kein Bedarf zum selbst aufzuteilen.
05Wie lange dauert es, eine 60-Minuten-MP3 zu transkribieren?+
Normalerweise 90 Sekunden vom Upload-Abschluss bis zum Transkript-Ready, unabhängig von der Bitrate. Das Dekodieren von MP3-Frames ist schnell; die Zeit ist im Recognizer. Sprechererkennung addiert 5–10 Sekunden bei mehrersprächigen Dateien.
06Meine MP3 hat Hintergrundmusik — wird das Transkript ruiniert?+
Leise Musik unter Sprache ist in Ordnung. Laute Musik, die mit der Stimme konkurriert (Intro-Strophen, Musik unter Interviews), löst manchmal Misserkennungen auf überlappenden Silben aus. Schalten Sie Musikunterdrückung im Job-Formular um, um vorzufiltern.
07Können Sie MP3s verarbeiten, die aus Handy-Voicemail oder Anrufbeantwortern gerippt wurden?+
Ja, aber diese sind oft 8-kHz-Schmalband-recodiert als MP3 — die Audioqualitätsoberkante ist durch die ursprüngliche PSTN-Erfassung gesetzt, nicht durch den MP3-Wrapper. Erwarten Sie 78–85% Genauigkeit bei dieser Art von Quelle, was das gleiche ist, was wir am zugrundeliegenden Anruf bekommen würden.
08Behalten Sie meine MP3 nach Abschluss des Transkripts?+
Dateien werden standardmäßig nach 30 Tagen gelöscht oder sofort auf Anfrage über das Dashboard. Das Transkript bleibt in Ihrem Konto, bis Sie es löschen. Wir verwenden niemals Kunden-Audio zum Trainieren eines Modells — je nicht.

Legen Sie Ihre MP3 ab. Erhalten Sie Text in 90 Sekunden.

30 kostenlose Minuten jeden Monat. Keine Karteneingabe erforderlich. Sprecherkennzeichnung, 99 Sprachen, alle Export-Formate enthalten.

Kostenlos starten