Muunna MP3 tekstiksi.Puhujan merkinnöt, 100+ kielillä.

Pudota MP3-tiedosto mihin tahansa bittinopeudella 64–320 kbps. Saa aikaleimalla ja puhujalla merkitty litterointi 99 kielellä — ei muodonmuuntoa, ei uudelleenkoodausta, ei jonoon odottamista.

Pudota audio tai video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Nauhoita suoraan selaimesta

Rekisteröityminen kestää 30 sekuntia — nauhoitus avautuu heti perään dashboardissa.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTTiedostot poistuvat automaattisesti 24 h kuluessa

↓ Katso mitä tulee ulos

MP3 sisään. Diarisoinut litterointi ulos.

Luemme MP3-kehysotsikoita suoraan — VBR, CBR, joint-stereo, mikä tahansa kooderi (LAME, Fraunhofer, FFmpeg). Jos tiedosto on todellinen stereo ja puhujat ovat erillisillä kanavilla, käytämme sitä ääniä jakamaan. Mono-miksaus palaa akustiseen diarisointiin.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
automaattisesti tunnistettu en-GB44.1 kHz · LAME 3.100
~90s
Litterointi · suoratoisto95% tarkkuus
S1

Joten milloin huomasit ensimmäisen kerran, että arkisto oli epätäydellinen?

S2

Todennäköisesti noin 2019, kun aloimme digitoida rulla-nauhat.

S1

Ja puuttuvat nauhat — oliko ne katalogoi missään?

S2

On olemassa paperinen indeksi vuodelta '78, mutta puoli siitä on vesivaurioitunut.

95% 192 kbps stereollaSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Kolme todellista vaihtoehtoa · rehellinen vertailu

Ilmainen paikallinen Whisper. Otter tai Sonix. Tai me.

Voit käyttää Whisperia omalla kannettavallasi ilmaiseksi, jos osaat tekniikkaa. Otter ja Sonix hyväksyvät MP3-lataukset tilauskojeissa. Me otamme tiedoston, palautamme litteroinnin, ja emme pakota sinua elämään käyttöliittymän sisällä.

Option 01

Whisper paikallinen / avoimen lähdekoodin

Ilmainen, jos sinulla on GPU ja iltapäivä vapaana. Ei puhujadiarisointia valmiiksi.

AsennusPython + CUDA + 10 GB mallit
PuhujadiarisisointiEi sisälly (pyannote-lisäosa)
Nopeus · 1 h MP35–40 min consumer GPU:lla
Kielet99, mutta pieni malli putoaa alle 80%:n
VientiTXT / SRT / VTT / JSON
HintaIlmainen + sinun sähkö
Best forInsinööreille, joilla on jo GPU, eivät tarvitse puhujamerkintöjä ja haluavat täydellisen paikallisen yksityisyyden.
Option 02

Transcription.Solutions

Pudota MP3. Saa puhujalla merkitty teksti takaisin suunnilleen reaaliajassa × 0,025.

AsennusVedä ja pudota, ei tiliä tarvitse kokeillaksesi
PuhujadiarisisointiSisäänrakennettu (Pro & Business-suunnitelmat)
Nopeus · 1 h MP3~90 sekuntia
Kielet99, automaattisesti tunnistettu
VientiSRT · VTT · DOCX · TXT · JSON
Hinta · minuuttia kohti$0,03
Best forKaikille, joilla on MP3 — toimittajan nauha, podcast-vienti, äänimuistio, arkistoduplikaatti — jotka haluavat vain tarkkaa tekstiä toisesta päästä.
Option 03

Otter / Sonix

Kiillotettu kojeisto, kuukausittainen minuuttien raja, englannin kielen hienosäätö. Tiedostolataus tuntuukin sivuominaisuudelta.

AsennusTili + maksettu suunnitelma
PuhujadiarisisointiAkustinen, EN-kallistunut
Nopeus · 1 h MP35–10 min jonossa
KieletOtter vain EN; Sonix ~40
VientiLukittu maksettujen tasojen taakse
Hinta$17+/kk tai $10+/h (Sonix)
Best forTiimeille, jotka haluavat litterointi-editorin ja yhteistyö-käyttöliittymän enemmän kuin puhtaan API-tyylisen tiedosto→teksti-virtauksen.

Hinnoittelu ja ominaisuuksien saatavuus tarkkana toukokuussa 2026. Whisper-suorituskyky vaihtelee mallin koon ja laitteiston mukaan.

Spesifistä MP3:lle

Kolme asiaa, jotka vaivavat ihmisiä yleisillä litteroiden työkaluilla.

MP3 on muoto, ei tallennustyyli — mikä tarkoittaa, että ongelmatilanteet tulevat kooderista, ei puheesta.

Mitä menee pieleen

  1. 1VBR-otsikot tulkitaan väärin. Jotkut työkalut lukevat muuttuvabittinopeuden MP3:ia kiinteänä nopeudella ja laskevat keston väärin — aikaleima ajautuu minuuteillaan tunnin pituisen tiedoston yli.
  2. 2Joint-stereo tasoitetaan monoiksi latauksen esikäsittelyä varten. Menetät puhuja-kanavaeron, joka oli todella tiedostossa.
  3. 3Upotettu ID3-albumin kuva kompastuu joihinkin latauspalvelimiin — ne hylkäävät tiedoston 'ei puhdasta ääntä' tai poistoivat sen ja koodaa uudelleen, pudottaen laadun edelleen.

Mitä me teemme sen sijaan

  1. 1Käytämme Xing/LAME-otsikkoa, kun se on läsnä, ja kehystelu-takaisinpalautusta muussa tapauksessa. VBR-aikaleima pysyy tarkkana ±0,1 s:iin monimittaisissa tiedostoissa.
  2. 2Joint-stereo ja todellisen stereottelu MP3:ia dekoodataan L/R PCM:ksi ennen diarisointia. Jos puhujaasi panning, pidämme ne eroteltuna.
  3. 3ID3v1, ID3v2, APE-tagit, upotettu kuva — kaikki läpivalaistu koskemattomina. Us ei koskaan uudelleenkoodaa MP3:asi.

Suositellut työn asetukset MP3-latauksille

Oletusarvot, jotka sopivat ~80%:iin MP3-tiedostoista. Ohita per-työ lomakkeelta.

Dekooderi
Kehysstarkka, ei uudelleenkoodausta
Diarisisointi
Kanavan jako jos stereo, muussa tapauksessa akustinen
Puhujan malli
Auto · 1-12 puhujaa
Kieli
Automaattinen tunnistus ensimmäisen 30:n päivän perusteella
Täytteeseen sanat
Poistettu (vaihda säilyttääksesi)
Vientipaketti
DOCX + SRT + aikajaettu TXT

Accuracy · real-world numbers

95%+ 192 kbps stereolla. Käytettävissä 64 kbps monolle.

MP3-tarkkuus on rajoitettu sillä, mitä kooderi säilyi, ei meistä. Perceptuaalinen pakkaus yli ~96 kbps säilyttää puheenjäljityksen erittäin hyvin; alle 64 kbps:n, sibilantit ja konsonantit alkavat haihtua. Alla olevat luvut ovat todellisista asiakkaiden MP3:stä tuotannossa.

96%
320 kbps stereo, studiokuvake

Lähes häviötön puheelle. Podcast-perustuotteet, sanelu-sovelluksen vienti, ammattimainen haastattelu. Diarisisointi puhdas, jos puhujat erillisillä kanavilla.

95%
192 kbps stereo, 2-3 puhujaa

Yleisin bittinopeus puhuttujen MP3:ien osalta. Zoom-vienti, Riverside-lataukset, ääniuudelleen kirjaimet oletus. Pakkauskohina tuntematon tunnustajalle.

91%
128 kbps mono, keskustelua

Äänimuistiosta oletuslinja useimmissa puhelimissa. Akustinen diarisisointi käsittelee 2-4 puhujaa. Numerot ja omat nimet tarvitsevat joskus silmäilya.

84%
64 kbps mono, arkistoitu / puhelin-vedos

Vanha vastauskoneen riisumiset, luento-arkistot, kapeakaista-lähteet. Korkean taajuuden konsonantit (f/s/sh) sumentuvat. Silti luettava — suunnittele oikoluku.

Usein kysytyt kysymykset

8 asiaa, joita ihmiset kysyvät MP3-litteroinnista.

01Mikä on MP3:n pienin bittinopeus, joka antaa silti käytettävän litteroinnin?+
64 kbps on käytännön alin raja. Sitä pienemmällä, sibilantit (s, sh, f) pakkautuvat meluiksi ja sanan virheprosentti nousee yli 20%. Jos tallaat tuoretta, tavoita 128 kbps mono tai 192 kbps stereo — mikä tahansa korkeampi on puheelle liikaa.
02Pitääkö minun muuntaa MP3 WAV:ksi ensin?+
Ei. MP3:n uudelleenkoodaus → WAV lisää nolla-tarkkuutta, koska kooderi heitti pois on pois lopullisesti. Lataa MP3 suoraan. Dekoodaamme kehykset muistiin ja syötämme PCM:n tunnistajalle.
03Antaako stereo MP3 minulle parempia puhujamerkintöjä kuin mono?+
Vain, jos puhujat nauhoitettiin todella erillisillä kanavilla — useimmat stereo MP3:t ovat sama ääni molemmissa puolissa ('dual mono') ja saavat mitään. Todellinen kanavan jako (esimerkiksi Riverside-vienti, kaksi-mikrofoni kenttä) antaa meille ohittaa akustisen diarisioinnin ja merkitä puhujat lähes täydellisesti.
04Mikä on MP3-tiedoston enimmäiskoko, jonka hyväksyt?+
5 GB per lataus, joka on suunnilleen 60 tuntia 192 kbps:lla tai 90 tuntia 128 kbps:lla. Jos tiedosto on suurempi, näytämme jaotetun latauksen — sinun ei tarvitse jakaa sitä.
05Kauanko kestää 60 minuutin MP3:n litterointi?+
Tyypillisesti 90 sekuntia latauksen valmistumisesta kirjoituksen valmiiseen, bittinopeudesta riippumatta. MP3-kehysten dekoodaus on nopeaa; aika on tunnistajassa. Diarisisointi lisää 5-10 sekuntia monipuhujan tiedostoissa.
06Minun MP3:ssä on taustamusiikkia — pilataanko litterointi?+
Hidas sänky puhe akustisesti on hyvä. Kova musiikki, joka kilpailee äänen kanssa (intro-stingi, pisteet haastatteluiden sytyttämisen) voi joskus laukaista väärin tunnistukset päällekkäisillä tavuilla. Kytke musiikin vaimennus työn lomakkeelle esikäsittelemään.
07Voit käsitellä MP3:a, jotka on riisutettu puhelin-posti- tai vastauskoneen?+
Kyllä, vaikka nämä ovat usein 8 kHz kapea-kaista, jotka on uudelleenkoodattu MP3:ksi — audio-laadun katto asettaa alkuperäinen PSTN-kaappaus, ei MP3-kääre. Odota 78-85% tarkkuus siihen lajiin, mikä on sama, minkä saisimme taustalla olevasta puhelusta.
08Säilytätkö minun MP3:ää litteroinnin jälkeen?+
Tiedostot poistetaan 30 päivän oletuksena tai välittömästi pyynnöstä kojeiston kautta. Litterointi pysyy tilissäsi, kunnes poistat sen. Emme käytä asiakkaan ääntä minkään mallin harjoittamiseen — koskaan.

Pudota MP3. Saa teksti takaisin 90 sekunnissa.

30 ilmaista minuuttia joka kuukausi. Ei korttia vaaditaan. Puhuja-merkinnöt, 99 kielillä, jokainen vienin muoto mukana.

Aloita ilmaiseksi