Transkribē MP3 uz tekstu.Runātāja marķējumi, 100+ valodas.

Nometiet MP3 failu jebkurā bitu ātrumā no 64 līdz 320 kbps. Saņemiet laika marķētu, runātāja marķētu stenogrammu 99 valodās — bez formāta konvertēšanas, bez atkārtota kodēšanas, bez gaidīšanas rindā.

Iemet audio vai video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Ieraksti tieši no pārlūka

Reģistrācija aizņem 30 sekundes — ierakstīšana atveras uzreiz pēc tam, vadības panelī.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFaili tiek automātiski dzēsti pēc 24h

↓ Skatiet, kas iznāk

MP3 ienākums. Diarizēta stenogramma ārā.

Mēs lasām MP3 frame galvenes tieši — VBR, CBR, joint-stereo, jebkurš kodētājs (LAME, Fraunhofer, FFmpeg). Ja fails ir īsts stereo ar runātājiem atsevišķos kanālos, mēs to izmantojam balsų sadalei. Mono jauktā forma atkāpjas uz akustiskās diarizācijas.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
automātiski atpazīts en-GB44.1 kHz · LAME 3.100
~90s
Stenogramma · straumēta95% precizitāte
S1

Tātad, kad jūs vispirms sapratāt, ka arhīvs bija nepilnīgs?

S2

Iespējams, ap 2019. gadu, kad mēs sākām digitalizēt spoles.

S1

Un pazudušās lentes — tās tika katalogizētas kaut kur?

S2

Ir papīra indekss no '78. gada, bet puse no tā ir bojāta ar ūdeni.

95% uz 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trīs īstas opcijas · godīgs salīdzinājums

Bezmaksas lokālais Whisper. Otter vai Sonix. Vai mēs.

Jūs varat palaist Whisper savā klēpjdatorā bezmaksas, ja esat tehnisks. Otter un Sonix pieņem MP3 augšupielādes abonēšanas informācijas panelī. Mēs ņemam failu, atgriežam stenogrammu un nepiespiedžam jums dzīvot UI iekšpusē.

Option 01

Whisper lokāls / atvērtā koda

Bezmaksas, ja jums ir GPU un pēcpusdiena. Nav runātāja diarizācijas no kastes.

IestatīšanaPython + CUDA + 10 GB modeļi
Runātāja diarizācijaNav iekļauts (pyannote pievienojums)
Ātrums · 1 hr MP35–40 min uz patērētāja GPU
Valodas99, bet mazs modelis nokrīt zem 80%
EksportsTXT / SRT / VTT / JSON
MaksaBezmaksas + jūsu elektroenerģija
Best forInženieri, kuriem jau ir GPU, nevajag runātāja marķējumus un vēlas pilnīgu lokālo privātumu.
Option 02

Transcription.Solutions

Nometiet MP3. Saņemiet runātāja marķētu tekstu atpakaļ aptuveni reāllaikā × 0.025.

IestatīšanaVilkt un nomest, konts netiek nepieciešams mēģinājumam
Runātāja diarizācijaIebūvēts (Pro & Business plāni)
Ātrums · 1 hr MP3~90 sekundes
Valodas99, automātiski atpazītas
EksportsSRT · VTT · DOCX · TXT · JSON
Maksa · minūtei$0.03
Best forIkvienam ar MP3 — žurnālista lente, podkāsta eksports, balss memo, arhīvālā kopija — kurš vienkārši vēlas precīzu tekstu otrā galā.
Option 03

Otter / Sonix

Pulēts informācijas panelis, mēneša minūšu vāciņš, angļu valodā noregulēts. Datnes augšupielāde izskatās kā sānjosla funkcija.

IestatīšanaKonts + maksas plāns
Runātāja diarizācijaAkustisks, EN-orientēts
Ātrums · 1 hr MP35–10 min rindā
ValodasOtter tikai EN; Sonix ~40
EksportsSlēgts aiz maksas pakāpieņiem
Maksa$17+/mēn vai $10+/hr (Sonix)
Best forKomandas, kas vēlas transkriptīvā redaktoru un sadarbības UI vairāk nekā tīru API stila failu→tekstu plūsmu.

Cenu noteikšana un līdzekļu pieejamība ir precīza 2026. gada maijā. Whisper veiktspēja atšķiras atkarībā no modeļa lieluma un aparatūras.

Specifisks MP3

Trīs lietas, kas ieņem cilvēkus uz vispārējos transkripciyas rīkiem.

MP3 ir formāts, nevis ierakstīšanas stils — kas nozīmē, ka kļūmes nāk no kodētāja, nevis no runāšanas.

Kas NotImplementedException

  1. 1VBR galvenes tiek nepareizi parsētas. Daži rīki lasa mainīga bitu ātruma MP3 kā fiksētu ātrumu un nepareizi aprēķina ilgumu — laika markas ripo minūtes vienas stundas failā.
  2. 2Joint-stereo tiek saplacināts uz mono augšupielādes priekšapstrādes laikā. Jūs zaudējat kanāla sadalā runātāju sadalī, kas faktiski bija failā.
  3. 3Iebūvēti ID3 albuma attēli vairākus augšupielādes modulis — tiem noraidīt failu kā 'ne tīru audio' vai noņemti un atkārtoti kodēti, vēl vairāk samazinot kvalitāti.

Ko mēs darām tā vietā

  1. 1Mēs izmantojam Xing/LAME galveni, kad tā ir klāt, un kadra skaita atpakaļpāriezi, kad nē. VBR laika markas paliek precīzas ±0.1 s daudzu stundu failos.
  2. 2Joint-stereo un patiesi stereo MP3 tiek dekodēti uz L/R PCM pirms diarizācijas. Ja jūsu runātāji tika pārvietoti, mēs tos turamies sadalīti.
  3. 3ID3v1, ID3v2, APE marķes, iebūvēti attēli — visi cauri nemodificēti. Mēs nekad atkārtoti nenkodējam jūsu MP3.

Ieteiktie darba iestatījumi MP3 augšupielādēm

Noklusējumi, kas der ~80% MP3 failus. Pārlabojiet katru darbu no formas.

Dekodētājs
Frame-precīzs, bez atkārtota kodēšanas
Diarizācija
Kanāla sadalīšana, ja stereo, citādi akustisks
Runātāja modelis
Auto · 1-12 runātāji
Valoda
Automātisks atpazīšana no pirmajiem 30 s
Pildvielas vārdi
Noņemti (pārslēgt, lai saglabātu)
Eksporta kopa
DOCX + SRT + laika marķēts TXT

Accuracy · real-world numbers

95%+ uz 192 kbps stereo. Noderīgs līdz 64 kbps mono.

MP3 precizitāte ir ierobežota ar ko kodētājs saglabāja, nevis ar mums. Perceptuālā saspiešana virs ~96 kbps ļoti labi saglabā runāšanas izpratni; zem 64 kbps, sibilantes un skaņas sāk izšķīst. Apakšā esošie skaitļi ir no patieso klientu MP3 ražošanā.

96%
320 kbps stereo, studijas avots

Gandrīz bezjaudas runāšanai. Podkāsta meistari, diktatora programmas eksporti, profesionāļu interviju aprīkojums. Diarizācija tīra, ja runātāji atsevišķos kanālos.

95%
192 kbps stereo, 2-3 runātāji

Visvairāk parastais bitu ātrums runātā vārda MP3. Zoom eksporti, Riverside lejupielādes, balss ierakstītāji noklusējumā. Saspiedinājuma artefakti nav dzirdami atpazītājam.

91%
128 kbps mono, sarunāta

Balss memo noklusējumi lielākajā daļā tālruņu. Akustiskā diarizācija apstrādā 2-4 runātājus. Skaitļi un īpašvārdi reizēm vajag ieskatu.

84%
64 kbps mono, arhivāls / telefona-izlietojums

Vecie atbildītāja-mašīnas rieši, lekciju arhīvi, šaura josla avoti. Augstās frekvences skaņas (f/s/sh) noapaļojas. Joprojām lasāms — plānojiet korektūru.

Bieži jautāti jautājumi

8 lietas, ko cilvēki prasa par MP3 transkribēšanu.

01Kāds ir minimālais MP3 bitu ātrums, kas joprojām dod lietojamu stenogrammu?+
64 kbps ir praktiski grīda. Zem tā sibilantes (s, sh, f) saspiedz trokšņa un vārdu kļūdu līmenis paceļas virs 20%. Ja ierakstat svaigi, mērķis 128 kbps mono vai 192 kbps stereo — kaut kas augstāks ir pārmērīgs runāšanai.
02Vai man jākonvertē MP3 uz WAV vispirms?+
Ne. MP3 atkārtota kodēšana → WAV pievieno nulles precizitāti, jo dati, ko kodētājs atmeta, ir pavisam pūsti. Augšupielādējiet MP3 tieši. Mēs dekodējam kadrus atmiņā un padodam PCM atpazītājam.
03Vai stereo MP3 dosim man labākus runātāja marķējumus nekā mono?+
Tikai ja runātāji tika faktiski ierakstīti atsevišķos kanālos — lielākā daļa stereo MP3 ir tā pati audio abās pusēs ('dual mono') un neiegūst neko. Patiess kanāla sadalīšana (piem., Riverside eksporti, divu mikrofonu lauka aprīkojums) ļauj mums izlaist akustiskā diarizāciju un marķēt runātājus gandrīz perfekti.
04Kāds ir maksimālais MP3 datnes lielums, ko jūs pieņemat?+
5 GB vienai augšupielādei, kas ir aptuveni 60 stundas 192 kbps vai 90 stundas 128 kbps. Ja fails ir lielāks, mēs parādīsim sadalītu augšupielādi — nav nepieciešams pats to sadalīt.
05Cik ilgi transkribē 60 minūšu MP3?+
Parasti 90 sekundes no augšupielādes pilnvērtības līdz stenogrammas gatavībai, neatkarīgi no bitu ātruma. MP3 kadru dekodēšana ir ātra; laiks ir atpazītājā. Diarizācija pievieno 5-10 sekundes multi-runātāju failiem.
06Mans MP3 skaņā fona mūzika — vai stenogramma būs sabojāta?+
Klussa gulnīca mūzika zem runāšanas ir labi. Garša mūzika, kas konkurē ar balsi (intro skaņas, mūzika intervijās), reizēm izraisa nepareizu atpazīšanu uz pārklāšiem zilbēm. Pārslēgt mūzikas nomākšana uz darba formas priekšfiltrēšanai.
07Vai varat rīkoties ar MP3, kas noplūdināti no tālruņa balss e-pasta vai atbildītāju mašīnām?+
Jā, lai gan šie bieži ir 8 kHz šauru joslu atkārtoti kodēti kā MP3 — audio kvalitātes grīda ir iestatīta pēc oriģinālā PSTN uztveršanas, nevis MP3 apvalka. Paredzieiet 78-85% precizitāti šāda veida avotā, kas ir tā pati, ko mēs iegūtu pamatā esošajā zvanā.
08Vai jūs paturējat manu MP3 pēc stenogrammas pabeigšanas?+
Datnes tiek dzēstas pēc 30 dienām noklusējumā, vai nekavējoties pieprasot caur informācijas paneli. Stenogramma paliktu savā kontā, līdz jūs to dzēš. Mēs neizmantojam klientu audio, lai apmācītu jebkuru modeli — nekad.

Nometiet MP3. Saņemiet tekstu atpakaļ 90 sekundēs.

30 bezmaksas minūtes katru mēnesi. Kartīte nav nepieciešama. Runātāja marķējumi, 99 valodas, katrs eksporta formāts iekļauts.

Sākt bezmaksas