MP3 szövegesítés.Beszélőjelölések, 100+ nyelvek.

Dobj egy MP3 fájlt bármilyen bitrátán 64–320 kbps között. Kapj egy időbélyeggel és beszélőjelölésekkel ellátott szöveget 99 nyelven — nincs formátum konvertálás, nincs újrakódolás, nincs sorban állás.

Húzd ide az audiót vagy videót

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Felvétel egyenesen a böngészőből

30 másodperc a regisztráció — utána rögtön a vezérlőpulton indulhat a felvétel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTA fájlok 24 órán belül törlődnek

↓ Nézd meg, mi jön ki

MP3 bemenet. Diárizált szöveg kimenet.

Az MP3 frame headereket közvetlenül olvassuk — VBR, CBR, joint-stereo, bármilyen kódoló (LAME, Fraunhofer, FFmpeg). Ha a fájl valódi sztereo, külön csatornákon lévő beszélőkkel, azt használjuk a hangok szétválasztásához. A mono mix-down akusztikus diárizálásra esik vissza.

interview-tape-04.mp3REC 192 kbps · sztereo · 38:42
automatikusan felismert en-GB44.1 kHz · LAME 3.100
~90s
Szöveg · streaming95% pontosság
S1

Szóval mikor vetted észre először, hogy az archívum hiányos?

S2

Valószínűleg 2019 körül, amikor elkezdtük a tekercseket digitalizálni.

S1

A hiányzó szalagokat — katalogizálták-e ezt bárki valahol?

S2

Van egy papír alapú index a '78-ból, de fele vízroncsolódott.

95% a 192 kbps sztereónSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Három valódi lehetőség · őszinte összehasonlítás

Ingyenes helyi Whisper. Otter vagy Sonix. Vagy mi.

Lefuttathatod a Whisper-t ingyen a saját gépeden, ha technikai-szempontból jártas vagy. Az Otter és Sonix elfogadja az MP3 feltöltéseket előfizetési irányítópultokon belül. Mi vagyunk azok, akik a fájlt, visszaadjuk a szöveget, és nem kötünk téged egy felhasználói felülethez.

Option 01

Whisper helyi / nyílt forráskódú

Ingyenes, ha van GPU-d és egy délutanod. Speaker diárizálás nincs a dobozban.

BeállításPython + CUDA + 10 GB modellek
Speaker diárizálásNem tartozék (pyannote bővítmény)
Sebesség · 1 óra MP35–40 perc fogyasztói GPU-n
Nyelvek99, de apró modell leesik 80% alá
ExportTXT / SRT / VTT / JSON
KöltségIngyenes + az elektromosságod
Best forMérnökök, akiknek már van GPU-juk, nem kell speaker jelölés, és teljes helyi adatvédelmet szeretnének.
Option 02

Transcription.Solutions

Dobd el az MP3-at. Kapj speaker-jelölt szöveget vissza nagyjából valós időben × 0.025.

BeállításDrag-and-drop, nincs szükség fiók próbálkozáshoz
Speaker diárizálásBeépített (Pro & Business tervek)
Sebesség · 1 óra MP3~90 másodperc
Nyelvek99, automatikus felismerés
ExportSRT · VTT · DOCX · TXT · JSON
Költség · percenként$0.03
Best forBárki MP3-mal — újságírói szalag, podcast export, hangmemo, archiválási másolat — aki csak azt szeretné, hogy az agyában Text végigmegy a végén.
Option 03

Otter / Sonix

Csiszolt irányítópult, havi percek limitálva, angol-optimalizált. A fájl feltöltése egy oldaljellegzetes funkciónak tűnik.

BeállításFiók + fizetett terv
Speaker diárizálásAkusztikus, EN-hajlamos
Sebesség · 1 óra MP35–10 perc sorban
NyelvekOtter csak EN; Sonix ~40
ExportFizetett szintek mögött zárolva
Költség$17+/hó vagy $10+/óra (Sonix)
Best forCsapatok, akik egy szöveg szerkesztőt és együttműködési felhasználói felületet szeretnének, mint egy tiszta API-stílusú fájl→szöveg áramlást.

Árazás és funkcióelérhetőség pontos 2026. május szerint. Whisper teljesítmény a modell méretétől és hardvertől függ.

Specifikus az MP3-hoz

Három velejárója az általános szövegesítő eszközöknek.

Az MP3 egy formátum, nem egy rögzítési stílus — which azt jelenti, hogy a kudarc módjai az encoder-ből, nem a beszédből jönnek.

Mi megy rosszul

  1. 1VBR headereket felületi-elemezik. Néhány eszköz a változó-bitráta MP3-kat fix-ráta-ként olvassa és helytelenül kalkulálja az időtartamot — időbélyegek egy óra alatt percekre csúsznak.
  2. 2Joint-stereo mono-ra lapítódik feltöltés előfeldolgozása során. Elveszíted a per-beszélő csatorna szétválasztást, amely ténylegesen a fájlban volt.
  3. 3Beágyazott ID3 albumborító egy néhány feltöltőt zavarna — elutasítják a fájlt 'nem tiszta hang'-ként vagy eltávolítják és újrakódolják, még továbbu minőség esik.

Mit teszünk helyette

  1. 1Használjuk az Xing/LAME headert, ha jelen van, és frame-számot fallback-ként. A VBR időbélyegek ±0.1 s pontosak maradnak több órás fájlokon keresztül.
  2. 2Joint-stereo és valódi-stereo MP3-ak L/R PCM-re dekódolódnak diárizálás előtt. Ha a beszélőid párhuzamosak voltak, megtartjuk a szétválasztást.
  3. 3ID3v1, ID3v2, APE tagek, beágyazott borító — mind érintetlenül átjuttatva. Mi soha nem kódoljuk újra az MP3-ad.

Ajánlott job beállítások MP3 feltöltésekhez

Alapértelmezettei ~80% MP3-fájlhoz illeszkednek. Bírálatot per-job-ként az űrlapról.

Dekóder
Frame-pontos, nincs újrakódolás
Diárizálás
Csatorna-osztás, ha sztereo, másképp akusztikus
Beszélő modell
Auto · 1-12 beszélő
Nyelv
Auto-detektálás az első 30 s-ből
Kitöltő szavak
Eltávolított (toggle-eld megtartásra)
Export csomag
DOCX + SRT + időbélyegelt TXT

Accuracy · real-world numbers

95%+ a 192 kbps sztereón. Használható 64 kbps monóig.

Az MP3 pontossága az encoder által megőrzöttekre korlátozódik, nem ránk. A ~96 kbps feletti percepcionális tömörítés nagyon jól megőrzi a beszéd értelmezhetőségét; 64 kbps alatt a sibilánsok és mássalhangzók kezdenek feloldódni. Az alábbi számok valós ügyfél MP3-okból származnak a termelésben.

96%
320 kbps sztereo, stúdió forrás

Szinte veszteségmentesség a beszédhez. Podcast mesterek, diktálóalkalmazás exportok, professzionális interjúkészülékek. Diárizálás tiszta, ha beszélők külön csatornákon vannak.

95%
192 kbps sztereo, 2-3 beszélő

A leggyakoribb bitráta beszélt szöveges MP3-okhoz. Zoom exportok, Riverside letöltések, hangrögzítők alapértelmezés. Tömörítési artefaktumok nem hallhatók az felismerő számára.

91%
128 kbps mono, társalgás

Hangüzenet alapértelmezettei a legtöbb telefonon. Az akusztikus diárizálás kezel 2-4 beszélőt. A számok és tulajdonnevek időnként igényelnek egy pillantást.

84%
64 kbps mono, archívális / telefonkisütés

Régi válaszcsatorna-gépek rip-jei, előadás archívumok, szűkkeblű források. A magas frekvenciájú mássalhangzók (f/s/sh) elmosódnak. Még mindig olvasható — tervezz proofread-ot.

Gyakori kérdések

8 kérdés az MP3 szövegesítésről.

01Mi az az MP3 bitrátájának minimuma, amely még használható szöveget adja?+
64 kbps a gyakorlati alsó korlát. Az alatt a sibilánsok (s, sh, f) zavljá tömörödnek, és a szóhiba aránya 20% fölé kúszik. Ha frissen rögzítesz, célozz 128 kbps mono vagy 192 kbps sztereo — bármi ennél magasabb túl sok a beszédhez.
02Az MP3-at WAV-vá kell konvertálnom előszöris?+
Nem. Az MP3 → WAV újrakódolás nulla pontosságot ad hozzá, mivel az encoder által elvetett adat örökre nyugszik. Töltsd fel az MP3-at közvetlenül. Dekódoljuk a frame-eket a memóriában és PCM-et táplálunk az felismerő-be.
03A sztereo MP3 jobbabb speaker labeleket fog adni, mint a monó?+
Csak akkor, ha a beszélőket ténylegesen külön csatornákon rögzítették — legtöbb sztereo MP3-ak ugyanaz a hang mindkét oldalon ('dual monó') és nem nyernek semmit. A valódi csatorna-osztás (pl. Riverside exportok, két-mikrofon field rig-ek) lehetővé teszi nekünk az akusztikus diárizálás kiihletésé és beszélőket szinte-tökéletesen labelezni.
04Mi az az MP3 fájlméretek maximuma, amelyet elfogadsz?+
5 GB feltöltésenként, ami nagyjából 60 óra 192 kbps vagy 90 óra 128 kbps. Ha a fájl nagyobb, megmutatunk egy darabolt feltöltést — nincs szükség magad szétválasztani.
05Mennyi idő alatt szövegesít egy 60 perces MP3?+
Általában 90 másodperc a feltöltés-kész-tól a szöveg-kész-ig, függetlenül a bitrátától. Az MP3 frame-ek dekódolása gyors; az idő az felismerő-ben van. A diárizálás 5-10 másodpercet ad hozzá a több-beszélő fájlokon.
06Az MP3-am háttér zene — a szöveg tönkre lesz?+
A csendes ágy zene beszéd alatt jó. A hangos zene, amely kompetál a hanggal (bevezetés csengések, pontozás az interjúk alatt) időnként félismeréseket okoz az átfedő szótagokon. A job-forma zene kimazsolódása toggle-a előszűrésre.
07Képes vagy telekód üzenetekből vagy válaszcsatorna-gépekből rip-zett MP3-akkal foglalkozni?+
Igen, bár ezek gyakran 8 kHz szűkkeblű-b újrakódolt MP3-ak — az audio minőség plafon az eredeti PSTN rögzítéssel van megállapítva, nem az MP3 töm-appal. Várj 78-85% pontosságot erre a fajta forrásra, amely ugyanaz, amit egy alapul szolgáló híváson kapnánk.
08Megtartod az MP3-mat, miután a szöveg kész?+
A fájlok alapértelmezésként 30 nap után törlődnek, vagy azonnal kérésre az irányítópulton keresztül. A szöveg a számlád-ben marad, amíg törlöd. Mi nem használjuk az ügyfél audiót egyik modell edzésére sem — soha.

Dobj MP3-at. Kapj szöveget vissza 90 másodperc alatt.

Ingyenes 30 perc havonta. Nincs szükség kártyára. Speaker jelölések, 99 nyelvek, minden export formátum tartalmazza.

Ingyenes indítás