Transkribera MP3 till text.Talarbeteckningar, 100+ språk.

Släpp en MP3-fil vid vilken bithastighet som helst från 64 till 320 kbps. Få ett tidsstämplat, talarbetecknat manuskript på 99 språk — ingen formatkonvertering, ingen omkodning, ingen väntan på kö.

Släpp in ditt ljud eller video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Spela in direkt från webbläsaren

Registrering tar 30 sekunder — inspelningen öppnas direkt efter, i dashboarden.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFiler raderas automatiskt efter 24 h

↓ Se vad som kommer ut

MP3 in. Talarbetecknad avskrift ut.

Vi läser MP3-ramhuvudena direkt — VBR, CBR, joint-stereo, vilken kodare som helst (LAME, Fraunhofer, FFmpeg). Om filen är sann stereo med talare på separata kanaler, använder vi det för att dela röster. Mono-blandning faller tillbaka på akustisk talarbeteckning.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Avskrift · streaming95% noggrannhet
S1

Så när insåg du först att arkivet var ofullständigt?

S2

Förmodligen omkring 2019, när vi började digitalisera spolarbitarna.

S1

Och de försvunna banden — var de katalogiserade någonstans alls?

S2

Det finns ett pappersregister från 78, men hälften av det är vattenskadad.

95% på 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tre riktiga alternativ · ärlig jämförelse

Gratis lokal Whisper. Otter eller Sonix. Eller oss.

Du kan köra Whisper på din egen bärbara dator gratis om du är teknisk. Otter och Sonix accepterar MP3-uppladdningar inom prenumerationsportaler. Vi tar filen, returnerar avskriften — du behöver inte spela en roll i ett gränssnitt.

Option 01

Whisper lokal / öppen kod

Gratis om du har en GPU och en eftermiddag. Ingen talarbeteckning ur lådan.

InställningPython + CUDA + 10 GB-modeller
TalarbeteckningInte inkluderad (pyannote-tillägg)
Hastighet · 1 tim MP35–40 min på consumer GPU
Språk99, men liten modell tappar under 80%
ExporteraTXT / SRT / VTT / JSON
KostnadGratis + din elektricitet
Best forIngenjörer som redan äger en GPU, inte behöver talarbeteckningar och vill ha fullständig lokal sekretess.
Option 02

Transcription.Solutions

Släpp MP3:en. Få talarbetecknad text tillbaka i ungefär realtid × 0,025.

InställningDrag-and-drop, inget konto behövs för att testa
TalarbeteckningInbyggd (Pro & Business-planer)
Hastighet · 1 tim MP3~90 sekunder
Språk99, auto-detekterat
ExporteraSRT · VTT · DOCX · TXT · JSON
Kostnad · per minut$0.03
Best forVem som helst med en MP3 — journalistband, podcastexport, röstmemo, arkivkopia — som bara vill ha exakt text från andra sidan.
Option 03

Otter / Sonix

Polerat dashboard, månatligt minuttak, engelskstämt. Filuppladdning känns som en sidefunktion.

InställningKonto + betald plan
TalarbeteckningAkustisk, EN-inriktad
Hastighet · 1 tim MP35–10 min i kö
SpråkOtter EN-bara; Sonix ~40
ExporteraLåst bakom betalda nivåer
Kostnad$17+/mån eller $10+/tim (Sonix)
Best forTeam som vill ha en avskriftsredigerare och samarbets-UI mer än ett rent API-format fil→text-flöde.

Priser och funktioners tillgänglighet exakt från maj 2026. Whisper-prestanda varierar beroende på modellstorlek och maskinvara.

Specifikt för MP3

Tre saker som drabbar människor på generiska transkriptionsverktyg.

MP3 är ett format, inte en inspelningsstil — vilket innebär att felmoderna kommer från kodaren, inte från talet.

Vad som går fel

  1. 1VBR-huvuden felavsedda. Några verktyg läser MP3:er med variabel bithastighet som fast rate och felberäknar varaktighet — tidsstämplar driftar med minuter över en timmeslång fil.
  2. 2Joint-stereo platnättas till mono under uppladdningsförbehandling. Du förlorar talarkanalseparationen som faktiskt var i filen.
  3. 3Inbäddad ID3-albumkonst snubblar några uppladdare — de avvisar filen som 'inte ren ljud' eller tar bort den och omkodifierar, vilket minskar kvaliteten ytterligare.

Vad vi gör istället

  1. 1Vi använder Xing/LAME-huvudet när det finns och fallback för ramräkning när det inte finns. VBR-tidsstämplar förblir exakta till ±0,1 s över fleratimmarsfiler.
  2. 2Joint-stereo och sann stereo-MP3:er är avkodade till L/R PCM före talarbeteckning. Om dina högtalare var panoramerade, håller vi dem delade.
  3. 3ID3v1, ID3v2, APE-taggar, inbäddad konst — allt passeras oförändrat. Vi omkodifierar aldrig din MP3.

Rekommenderade jobbinställningar för MP3-uppladdningar

Standardvärden som passa ~80% av MP3-filer. Åsidosätt per-jobb från formuläret.

Avkodare
Ramexakt, ingen omkodning
Talarbeteckning
Kanalsplit om stereo, annars akustisk
Talarmodell
Auto · 1-12 talare
Språk
Auto-detektera från första 30 s
Fyllnadsord
Borttaget (växla för att behålla)
Exportpaket
DOCX + SRT + tidsstämplad TXT

Accuracy · real-world numbers

95%+ på 192 kbps stereo. Användbar ned till 64 kbps mono.

MP3-noggrannhet är begränsad av vad kodaren behöll, inte av oss. Perceptuell komprimering över ~96 kbps bevarar talklar mycket väl; under 64 kbps börjar sibillanter och konsonanter lösa upp sig. Siffror nedan är från riktiga kund-MP3:er i produktion.

96%
320 kbps stereo, studiorkälla

Nästan förlustfritt för tal. Podcastmastrar, diktningsappsexporter, professionella intervjuriggar. Talarbeteckning ren om talare på separata kanaler.

95%
192 kbps stereo, 2-3 talare

Vanligaste bithastigheten för talat-ord MP3:er. Zoom-exporter, Riverside-nedladdningar, röstbandspelers standard. Komprimeringsartefakter ohörbara för igenkännaren.

91%
128 kbps mono, konversationell

Röstmemo-standard på de flesta telefoner. Akustisk talarbeteckning hanterar 2-4 talare. Siffror och egennamn behöver ibland en snabb titt.

84%
64 kbps mono, arkiv / telefonutdump

Gamla bandspelarkopior, föreläsningsarkiv, snallbandskällor. Högfrekventa konsonanter (f/s/sh) blir suddig. Fortfarande läsbar — planera en korrekturläsning.

Vanliga frågor

8 saker folk frågar om MP3-transkription.

01Vilken är den minsta MP3-bithastighet som fortfarande ger en användbar avskrift?+
64 kbps är den praktiska gränsen. Under det komprimeras sibillanter (s, sh, f) till brus och ordet felfrekvensen klättrar förbi 20%. Om du spelar in friskt, rikta 128 kbps mono eller 192 kbps stereo — allt högre är överkill för tal.
02Behöver jag konvertera min MP3 till WAV först?+
Nej. Omkodning MP3 → WAV lägger till noll noggrannhet eftersom data som kodaren kastade är borta för gott. Ladda upp MP3:en direkt. Vi avkodar ramar i minnet och matar PCM till igenkännaren.
03Ger stereo-MP3 mig bättre talarbeteckningar än mono?+
Endast om talarna faktiskt inspelades på separata kanaler — de flesta stereo-MP3:er har samma ljud på båda sidor ('dualmono') och vinner inget. Sann kanalsplit (t.ex. Riverside-exporter, tvåmikrofonfältriggar) låter oss hoppa över akustisk talarbeteckning och beteckna talare nästan perfekt.
04Vilken är den maximala MP3-filstorlek du accepterar?+
5 GB per uppladdning, vilket är ungefär 60 timmar på 192 kbps eller 90 timmar på 128 kbps. Om din fil är större visar vi en segmenterad uppladdning — ingen anledning att dela den själv.
05Hur lång tid tar det att transkribera en 60-minuters MP3?+
Vanligtvis 90 sekunder från uppladdning-klar till avskrift-klar, oavsett bithastighet. Avkodning av MP3-ramar är snabb; tiden ligger hos igenkännaren. Talarbeteckning lägger till 5–10 sekunder på flertalarfiler.
06Min MP3 har bakgrundsmusik — blir avskriften förstörd?+
Tyst sängmusik under tal är bra. Högt musik som konkurrerar med rösten (signalmusik, poäng under intervjuer) utlöser ibland felkänning på överlappande stavelser. Växla musikundertryckning på jobbrättsformuläret för att förfiltrera.
07Kan du hantera MP3:er som extraherats från telefonröstbreV eller telefonsvarare?+
Ja, men dessa är ofta 8 kHz snallband omkodade som MP3 — audiokvalitetstaket är satt av det ursprungliga PSTN-fångsten, inte MP3-omslaget. Förvänta dig 78–85% noggrannhet på den typen av källa, vilket är samma som vi skulle få på det underliggande samtalet.
08Behåller du min MP3 efter att avskriften är klar?+
Filer raderas efter 30 dagar som standard, eller omedelbar på begäran via instrumentpanelen. Avskriften stannar i ditt konto tills du tar bort det. Vi använder inte kundjud för att träna någon modell — aldrig.

Släpp din MP3. Få text tillbaka på 90 sekunder.

30 gratis minuter varje månad. Inget kort krävs. Talarbeteckningar, 99 språk, alla exportformat inkluderade.

Börja gratis