Transkribeier MP3 a Text.Spriecher-Markéierungen, 100+ Sproochen.

Setzt eng MP3-Datei a mat engem Bitrate vun 64 bis 320 kbps. Kréie eng Transkriptioun mat Zäitstempel an Spriecher-Markéierungen a 99 Sproochen — keng Format-Konversioun, keng Noriichten, kee Waarden op enger Queue.

Drop your audio or video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Direkt aus dem Browser ophuelen

Aschreiwen dauert 30 Sekonnen — d'Opnam mécht direkt duerno op, am Dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFiles auto-delete in 24h

↓ Schau, wat erauskommt

MP3 eran. Diarisiert Transkriptioun eraus.

Mir liesen d'MP3 Frame Headers direkt — VBR, CBR, Joint-Stereo, all Encoder (LAME, Fraunhofer, FFmpeg). Wann d'Datei true Stereo ass mat Spriecher op separaten Kanäl, benotze mir dat fir Stëmmen ze splëtten. Mono Mix-Down fällt op akoustech Diarisierung zréck.

interview-tape-04.mp3REC 192 kbps · Stereo · 38:42
automaticsch erkannt en-GB44.1 kHz · LAME 3.100
~90s
Transkriptioun · Streaming95% Genauegkeet
S1

Also wéini hu Dir fir d'éischt réaliséiert, datt d'Arkiv onvollständeg war?

S2

Wahrscheinlech ronderëm 2019, wéini mir d'Reel-to-Reels digitaliséiert hunn.

S1

An d'vermëschte Bänner — goufen se iergendwou katalogéiert?

S2

Et ginn en Pabeier-Index vun '78, mä hallef dovun ass wasser-beschiedegt.

95% op 192 kbps StereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Dräi richteg Optiounen · Häerlich Verglach

Gratis lokal Whisper. Otter oder Sonix. Oder mir.

Dir kënnt Whisper op Iech eegen Laptop gratis lafen, wann Dir technesch sinn. Otter an Sonix akzeptéieren MP3-Uploads an Abonnements-Dashboards. Mir huelen d'Datei, ginn d'Transkriptioun zréck, an zwéngen Iech net, an enger UI ze liewen.

Option 01

Whisper lokal / OpenSource

Gratis, wann Dir eng GPU an engem Owend hutt. Keng Spriecher-Diarisierung out of the box.

SetupPython + CUDA + 10 GB Modeller
Spriecher-DiarisierungNet abegraff (pyannote Add-on)
Vitess · 1 Stonn MP35–40 Min op Consumer-GPU
Sproochen99, mä klengt Modell fällt ënner 80%
ExportTXT / SRT / VTT / JSON
KäschtenGratis + Äre Stroum
Best forIngeniéuren, déi schonn eng GPU hunn, keng Spriecher-Markéierungen brauchen, an komplett lokal Privacité wëllen.
Option 02

Transcription.Solutions

Setzt d'MP3 a. Kritt Spriecher-markéiert Text zréck a ongeféier Echt-Zäit × 0.025.

SetupDrag-an-Drop, keng Kont néideg fir ze probéieren
Spriecher-DiarisierungAgebaut (Pro & Business Plän)
Vitess · 1 Stonn MP3~90 Sekonnen
Sproochen99, automaticsch erkannt
ExportSRT · VTT · DOCX · TXT · JSON
Käschten · pro Min.$0.03
Best forJiddwereen mat engem MP3 — Journalisten-Dréiband, Podcast-Export, Stëmmen-Notiz, Arkiv-Kopi — deen eben nëmmen Text eraus brauch.
Option 03

Otter / Sonix

Poliert Dashboard, monatlech Minutten-Grenz, Englesch-optimaliséiert. Datei-Upload fillt sech un wéi eng Sëit-Feature.

SetupKont + bezuelt Plan
Spriecher-DiarisierungAkoustech, EN-geneet
Vitess · 1 Stonn MP35–10 Min an enger Queue
SproochenOtter EN-nëmmen; Sonix ~40
ExportGespaart hannert bezuelt Tiers
Käschten$17+/Moone oder $10+/Stonn (Sonix)
Best forEquipen, déi eng Transkriptioun-Editor an Kolaboratioun-UI méi wëllen as eng ronnen API-Stil Datei→Text Flow.

Präiswäerter an Feature-Verfügbarkeet akkurat wéi vun Mai 2026. Whisper-Performen variéiert duerch Modell-Gréisst an Hardware.

Spézifesch zu MP3

Dräi Saachen, déi Leit bei genereschen Transkriptéierungs-Outils Poblemer maachen.

MP3 ass en Format, net en Opnamen-Stil — dat heescht d'Feeler-Modi sti vum Encoder, net vun der Stëmmen.

Wat geet schif

  1. 1VBR-Header ginn mëspaarséiert. Munch Tools liesen verännerbar-Bitrate MP3s als fix-Bitrate a miscréchenen d'Dauer — Zäitstempel driften duerch Minutten iwwer eng Stonn-Datei.
  2. 2Joint-Stereo gëtt op Mono abgeflatt während Upload Virveraarbechtung. Dir verléiert d'Pro-Spriecher Kanâl-Separatioun, déi tatsächlech an der Datei war.
  3. 3Agebett ID3 Album-Konschter trippen e puer Uploader — si weigeren d'Datei als 'net reng Audio' oder strëppen se an enkodéieren nei, verléieren Qualitéit och méi.

Wat mir amplaz doen

  1. 1Mir benotze d'Xing/LAME Header wann präzent an Frame-Zäiel Fallback wann net. VBR Zäitstempel bleiwen akkurat zu ±0.1 s iwwer Multi-Stonn Dateien.
  2. 2Joint-Stereo an True-Stereo MP3s ginn dekodéiert zu L/R PCM virun Diarisierung. Wann Är Spriecher wueren gepannt, mir houzen se gesplëtzt.
  3. 3ID3v1, ID3v2, APE Tags, Agebett Konstbild — all duerchgepassuert ongeännert. Mir enkodéieren Är MP3 ni nei.

Rekemmandéiert Job-Astellungen fir MP3-Uploads

Defaults, déi op ~80% vun MP3-Dateien passen. Iwwerschreiwe pro-Job vum Formulair.

Dekoder
Frame-genauer, keng Noriichten
Diarisierung
Kanâl-Splëtt wann Stereo, élscht akoustech
Spriecher-Modell
Auto · 1-12 Spriecher
Sprooch
Automaticsch-erkannt vun éischt 30 s
Füller Wierder
Eweggeholl (Toggle fir z'behalen)
Export-Bundle
DOCX + SRT + Zäitstempel TXT

Accuracy · real-world numbers

95%+ op 192 kbps Stereo. Benotzbor erof bis 64 kbps Mono.

MP3 Genauegkeet ass begrenzt duerch wat den Encoder behalen, net duerch mir. Wahrnehmungskompressioun iwwer ~96 kbps erhält Stëmmen-Intellegibilitéit ganz gutt; ënner 64 kbps, Sibilanten an Konsonanteri starten ze léisen. Zuelen drënner sinn vun richtegen Clienten MP3s an der Produktioun.

96%
320 kbps Stereo, Studio-Quell

Bal verlustfräi fir Stëmmen. Podcast-Meister, Diktatiouns-App-Exporte, beruffleschen Interview-Rigs. Diarisierung reng, wann Spriecher op separaten Kanäl.

95%
192 kbps Stereo, 2-3 Spriecher

Déi meescht Iecht Bitrate fir gespréchtem-Wuert MP3s. Zoom Exporte, Riverside Downloads, Stëmmen-Rekorder Standard. Komprelessioun-Artefakte onhéirbar fir Erkennungstool.

91%
128 kbps Mono, Konversatioun

Stëmmen-Notiz Defaults op de meeschten Telefonen. Akoustech Diarisierung handelt 2-4 Spriecher. Nummeren an Eigennimm brauchen heiw an deier eng Bléck.

84%
64 kbps Mono, Arkiv / Telefon-Dump

Aal Antwort-Appareil-Ripen, Léiergang-Arkiver, Schmuell-Bande-Quellen. Heechfréquenz-Konsonanteri (f/s/sh) verunscharfen. Noch ëmmer lesbar — plangt eng Korrektur.

Gemeinsam Froen

8 Saachen, déi Leit iwwer MP3-Transkriptioun froen.

01Wat ass d'Minimum MP3-Bitrate, déi nach eng benotzbair Transkriptioun gëtt?+
64 kbps ass d'praktesch Grenz. Drënner, Sibilanten (s, sh, f) komprimeieren an Bräi an Wuert-Feeler-Taux klëmmt iwwer 20%. Wann Dir frësch opnemt, zielt 128 kbps Mono oder 192 kbps Stereo — iwwert méi ass Iwwerdréiwung fir Sprooch.
02Muss ech mäin MP3 an WAV éischt konvertéieren?+
Nee. Noriichten MP3 → WAV addéiert null Genauegkeet, well d'Donnéen, déi den Encoder verworf hutt, fir ëmmer fort ass. Ënnerluet d'MP3 direkt. Mir dekodéieren Frame a Mëmoire an féderen PCM zum Erkennungstool.
03Gëtt mir Stereo-MP3 bessere Spriecher-Label wéi Mono?+
Nëmmen, wann d'Spriecher wirklech op separaten Kanäl opgeholl goufen — déi meescht Stereo-MP3s hunn déi selwescht Audio op bei Säite ('Dual Mono') an gewinnen näischt. True Kanâl-Splëtt (z.B. Riverside-Exporte, Zwee-Mikrofon Feld-Rigs) erlaabt mir, akoustech Diarisierung ze sprochenen an Spriecher quasi perfekt z'étiqueteieren.
04Wat ass d'Maximal MP3-Datei-Gréisst, déi Dir akzeptéiert?+
5 GB pro Upload, wat ongeféier 60 Stonne bei 192 kbps oder 90 Stonne bei 128 kbps ass. Wann Är Datei méi grouss ass, wéi mir eng Chunk-Upload tëtzen — keng Noutwendegkeet, se selwer ze splëtten.
05Wéi laang dauert et, eng 60-Minutten MP3 ze transkribéieren?+
Typesch 90 Sekonnen vum Upload-Komplett bis Transkriptioun-Prett, onofhängeg vum Bitrate. Frame-Dekodéierung MP3 ass séier; d'Zäit ass a Erkennungstool. Diarisierung addéiert 5-10 Sekonnen op Multi-Spriecher Dateien.
06Mäin MP3 huet Hannergrond-Musik — gëtt d'Transkriptioun zerstéiert?+
Roueg Bett-Musik ënner Sprooch ass OK. Laut Musik, déi mat der Stëmmen konkurriert (Intro Stëmmen, Scoring ënner Interviews) triggert heiw an deier Mëscherkennung op iwwerlappende Silben. Schaltet Musik-Unterdrécking op der Job-Form un fir virzefiliteren.
07Kënnt Dir MP3s handhaen, déi aus Telefon-Stëmmen-Krëppel oder Antwort-Apparéiler geripp goufen?+
Jo, obwuel dës dacks 8 kHz Schmuell-Bande noriicht wéi MP3 — d'Audio-Qualitéit Plafong ass duerch déi ursprénglech PSTN-Opnahm gesat, net d'MP3 Wrapper. Erwaart 78-85% Genauegkeet op daat Arc Quell, wat d'Selwescht ass, déi mir iwwer d'ënnerlegend Ruff bekéimen.
08Houdt Dir mäin MP3 nom Transkriptioun fäerdeg?+
Dateien ginn no 30 Deeg standard geläscht, oder direkt op Ufro vum Dashboard. D'Transkriptioun bleift an Ärem Kont, bis Dir et läscht. Mir benotzen Client Audio net, fir engem Modell ze traineieren — jo.

Setzt Är MP3 a. Kritt Text zréck a 90 Sekonnen.

30 gratis Minutten all Moone. Keng Kaart néideg. Spriecher-Markéierungen, 99 Sproochen, all Export-Format abegraff.

Fräi Start