Transcrie MP3 la text.Etichete de vorbitor, 100+ limbi.

Trageți un fișier MP3 la orice bitrate de la 64 la 320 kbps. Obțineți transcript cu marcaje de timp și etichete de vorbitor în 99 de limbi — fără conversie de format, fără recodificare, fără așteptare la coadă.

Aruncă aici audio sau video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Înregistrează direct din browser

Înregistrarea se face în 30 de secunde — recorder-ul se deschide imediat, direct în dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFișierele se șterg automat în 24h

↓ Vezi ce iese

MP3 intră. Transcript diarizat iese.

Citim anteturile cadrelor MP3 direct — VBR, CBR, joint-stereo, orice codificator (LAME, Fraunhofer, FFmpeg). Dacă fișierul este adevărat stereo cu vorbitori pe canale separate, folosim asta pentru a separa vocile. Mix-down mono revine la diarizarea acustică.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Transcriere · streaming95% acuratețe
S1

Deci, când ai realizat pentru prima dată că arhiva era incompletă?

S2

Probabil în jurul anului 2019, când am început să digitizez bobinele.

S1

Și benzile lipsă — erau catalogate undeva?

S2

Există un index pe hârtie din '78, dar jumătate din el este deteriorat de apă.

95% pe 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trei opțiuni reale · comparație onestă

Whisper local gratuit. Otter sau Sonix. Sau noi.

Poți rula Whisper pe propriul laptop gratuit dacă ești tehnic. Otter și Sonix acceptă încărcare de MP3 în tablourile lor de bord de abonament. Luăm fișierul, îți returnăm transcrierul, și nu te blocăm într-o interfață.

Option 01

Whisper local / open source

Gratuit dacă ai o GPU și o după-amiază. Fără diarizare de vorbitor din cutie.

ConfigurarePython + CUDA + 10 GB modele
Diarizare de vorbitorNeinclusă (add-on pyannote)
Viteză · MP3 1 oră5–40 min pe GPU de consum
Limbi99, dar modelul mic scade sub 80%
ExportTXT / SRT / VTT / JSON
CostGratuit + electricitatea ta
Best forIngineri care deja au o GPU, nu au nevoie de etichete de vorbitor, și vor confidențialitate locală completă.
Option 02

Transcription.Solutions

Trageți MP3. Obțineți text etichetat de vorbitor înapoi în timp real aproximativ × 0,025.

ConfigurareGlisează și eliberează, nicio cont necesară pentru a încerca
Diarizare de vorbitorIncorparat (planuri Pro și Business)
Viteză · MP3 1 oră~90 secunde
Limbi99, detectate automat
ExportSRT · VTT · DOCX · TXT · JSON
Cost · pe minut$0.03
Best forOricine cu un MP3 — bandă de jurnalist, export podcast, notă vocală, dub arhival — care vrea doar text precis la final.
Option 03

Otter / Sonix

Tablou de bord rafinat, limită lunară de minute, reglat pentru engleză. Încărcarea fișierelor se simte ca o funcție secundară.

ConfigurareCont + plan plătit
Diarizare de vorbitorAcustică, orientată către EN
Viteză · MP3 1 oră5–10 min în coadă
LimbiOtter numai EN; Sonix ~40
ExportBlocat în spatele nivelurilor plătite
Cost$17+/lună sau $10+/oră (Sonix)
Best forEchipe care vor un editor de transcriere și o interfață de colaborare mai mult decât un flux curat de stil API.

Prețurile și disponibilitatea funcțiilor sunt exacte din mai 2026. Performanța Whisper variază în funcție de mărimea modelului și hardware.

Specific pentru MP3

Trei lucruri care musc oamenii pe uneltele generice de transcriere.

MP3 este un format, nu un stil de înregistrare — ceea ce înseamnă că modurile de defecțiune provin de la codificator, nu de la vorbire.

Ce merge greșit

  1. 1Anteturile VBR se parsează greșit. Unele unelte citesc MP3-urile cu bitrate variabil ca bitrate fix și calculează greșit durata — marcajele de timp se abat cu minute de-a lungul unui fișier de o oră.
  2. 2Joint-stereo se apasă la mono în timp ce fișierul se încarcă. Pierzi separarea canalului pe vorbitor care era de fapt în fișier.
  3. 3Arta albumului ID3 încorporată împiedică câțiva încărcători — ei resping fișierul ca 'nu e audio pur' sau o elimină și recodifică, scăzând calitatea și mai mult.

Ce facem în schimb

  1. 1Folosim antetul Xing/LAME atunci când este prezent și revenire la numărarea de cadre atunci când nu. Marcajele de timp VBR rămân precise cu ±0,1 s pe fișiere de mai multe ore.
  2. 2MP3-urile joint-stereo și adevărat stereo sunt decodate în L/R PCM înainte de diarizare. Dacă vorbitorii tăi au fost declinați, îi ținem despărțiți.
  3. 3Etichete ID3v1, ID3v2, APE, arta încorporată — toate trecute nemodificate. Nu recodificăm niciodată MP3-ul tău.

Setări recomandate de job pentru încărcări de MP3

Setări implicite care se potrivesc cu ~80% din fișierele MP3. Suprascrieți pe job din formular.

Decodor
Precis la cadru, fără recodificare
Diarizare
Despărțire canal dacă stereo, altfel acustică
Model de vorbitor
Automată · 1-12 vorbitori
Limbă
Detectare automată din primele 30 s
Cuvinte umplutură
Eliminate (comutare pentru a păstra)
Pachet de export
DOCX + SRT + TXT cu marcaj de timp

Accuracy · real-world numbers

95%+ pe 192 kbps stereo. Utilizabil până la 64 kbps mono.

Acuratețea MP3 este limitată de ceea ce a păstrat codificatorul, nu de noi. Compresia perceptuală peste ~96 kbps păstrează inteleligibilitatea vorbirii foarte bine; sub 64 kbps, sibilitele și consoanele încep să se dizolve. Numerele de mai jos provin din MP3-uri reale ale clienților în producție.

96%
320 kbps stereo, sursă de studio

Aproape fără pierderi pentru vorbire. Podcast masters, exporturi din aplicații de dictare, aparate de interviu profesionale. Diarizare curată dacă vorbitorii sunt pe canale separate.

95%
192 kbps stereo, 2-3 vorbitori

Bitrate-ul cel mai comun pentru MP3-urile cu cuvinte vorbite. Exporturi Zoom, descărcări Riverside, implicit al înregistratoarelor vocale. Artefactele de compresie sunt inaudibile pentru motorul de recunoaștere.

91%
128 kbps mono, conversațional

Setare implicită pentru notele vocale pe majoritatea telefoanelor. Diarizarea acustică gestionează 2-4 vorbitori. Numerele și numele proprii ocazional au nevoie de o privire.

84%
64 kbps mono, arhival / descărcare telefon

Rip-uri vechi de mașini de răspuns, arhive de curs, surse cu bandă îngustă. Consoanele de înaltă frecvență (f/s/sh) se estompează. Încă lizibil — plănuiți o revizuire.

Întrebări comune

8 lucruri pe care oamenii le întreabă despre transcrierile MP3.

01Care este bitrate-ul minim MP3 care permite totuși un transcript utilizabil?+
64 kbps este limita practică. Sub asta, sibilitele (s, sh, f) se comprează în zgomot și rata de eroare a cuvintelor urcă peste 20%. Dacă înregistrezi proaspăt, țintește 128 kbps mono sau 192 kbps stereo — orice mai sus este excesiv pentru vorbire.
02Trebuie să-mi convertesc MP3-ul la WAV mai întâi?+
Nu. Recodificarea MP3 → WAV nu adaugă nicio câștig de acuratețe—datele pe care le-a aruncat codificatorul sunt plecate pentru totdeauna. Încarcă MP3 direct. Decodificăm cadrele în memorie și alimentez PCM în motorul de recunoaștere.
03Mă va ajuta MP3 stereo cu etichete de vorbitor mai bune decât mono?+
Numai dacă vorbitorii erau de fapt înregistrați pe canale separate — majoritatea MP3-urilor stereo au același audio pe ambele părți ('dual mono') și nu căștigă nimic. Adevăratul split de canal (de exemplu, exporturi Riverside, aparate de teren cu două microfoane) ne permite să sărim diarizarea acustică și să etichetez vorbitorii aproape perfect.
04Care este dimensiunea maximă a fișierului MP3 pe care o accept?+
5 GB pe încărcare, care este aproximativ 60 de ore la 192 kbps sau 90 de ore la 128 kbps. Dacă fișierul tău este mai mare, vom arăta o încărcare fragmentată — nicio nevoie să o spargei singur.
05Cât durează transcriere unui MP3 de 60 de minute?+
De obicei 90 de secunde de la încărcare-complet la transcriere-gata, indiferent de bitrate. Decodificarea cadrelor MP3 este rapidă; timpul este în motorul de recunoaștere. Diarizarea adaugă 5-10 secunde la fișierele cu mai mulți vorbitori.
06MP3-ul meu are muzică de fundal — va fi transcrierul distrus?+
Muzica ușoară de fundal sub vorbire este bună. Muzica tare care concurează cu vocea (stinghi intro, scoring sub interviuri) uneori determină erori de recunoaștere atunci când silabele se suprapun. Comutați suprimarea muzicii din formularul de job pentru a filtra din față.
07Poți gestiona MP3-urile extrase din voicemail-ul telefonului sau de la mașinile de răspuns?+
Da, deși acestea sunt adesea 8 kHz banda îngustă recodificate ca MP3 — plafonul calității audio este stabilit de captura PSTN originală, nu de wrapper-ul MP3. Așteptați 78-85% acuratețe pe acel tip de sursă, care este la fel pe care am obține-o pe apelul subiacent.
08Păstrezi MP3-ul meu după ce transcrierul este gata?+
Fișierele sunt șterse după 30 de zile implicit, sau imediat la cerere prin tabloul de bord. Transcrierul rămâne în cont până îl ștergi. Nu folosim audio de client pentru a antrena niciun model — niciodată.

Trageți MP3. Obțineți text înapoi în 90 de secunde.

30 de minute gratuite în fiecare lună. Nicio carte necesară. Etichete de vorbitor, 99 de limbi, fiecare format de export inclus.

Începeți gratuit