Prepíšte MP3 na text.Označenia rečníkov, 100+ jazykov.

Vložte MP3 súbor pri akejkoľvek bitrate od 64 do 320 kbps. Dostanete prepis s časovými značkami a označeniami rečníkov v 99 jazykoch — bez konverzie formátu, bez reenkódovania, bez čakania v rade.

Pustite sem audio alebo video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Nahrávajte priamo z prehliadača

Registrácia trvá 30 sekúnd — nahrávanie sa otvorí hneď v dashboarde.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTSúbory sa automaticky mažú za 24 h

↓ Pozrite sa, čo sa stane

MP3 vstup. Prepis s identifikáciou rečníkov na výstupe.

Čítame hlavičky MP3 framov priamo — VBR, CBR, joint-stereo, akýkoľvek kódovač (LAME, Fraunhofer, FFmpeg). Ak je súbor skutočný stereo s rečníkmi na oddelených kanáloch, používame to na rozdelenie hlasov. Mono mix-down sa vracia k akustickej identifikácii rečníkov.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
automaticky detegovaný en-GB44.1 kHz · LAME 3.100
~90s
Prepis · streamovanie95% presnosť
S1

Tak��e kedy si si po prvý krát uvedomil, že archív bol neúplný?

S2

Pravdepodobne okolo roku 2019, keď sme začali digitalizovať pásky.

S1

A chýbajúce pásky — boli nikde zaradené?

S2

Existuje papierový index z roku 78, ale polovica je poškodená vodou.

95% na 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tri skutočné možnosti · čestné porovnanie

Bezplatný lokálny Whisper. Otter alebo Sonix. Alebo my.

Môžete spustiť Whisper na vlastnom laptope zadarmo, ak ste technickí. Otter a Sonix prijímajú nahrávky MP3 v rámci panelov predplatného. Berieme súbor, vrátimo prepis a nezavádame vás do používateľského rozhrania.

Option 01

Whisper lokálny / open source

Zadarmo, ak máte GPU a voľný čas. Bez identifikácie rečníkov v základe.

NastaveniePython + CUDA + 10 GB modelov
Identifikácia rečníkovNie je zahrnutá (doplnok pyannote)
Rýchlosť · 1 hodina MP35–40 min na spotrebiteľskom GPU
Jazyky99, ale malý model klesá pod 80%
ExportTXT / SRT / VTT / JSON
NákladyZadarmo + vaša elektrina
Best forInžinieri, ktorí už vlastnia GPU, nepotrebujú označenia rečníkov a chcú úplnú miestnu súkromie.
Option 02

Transcription.Solutions

Vložte MP3. Dostanete text s označeniami rečníkov späť v zhruba reálnom čase × 0,025.

NastavenieDrag-and-drop, bez potreby konta na skúšku
Identifikácia rečníkovZabudovaná (plány Pro a Business)
Rýchlosť · 1 hodina MP3~90 sekúnd
Jazyky99, automaticky detegované
ExportSRT · VTT · DOCX · TXT · JSON
Náklady · za minútu$0,03
Best forKtokoľvek s MP3 — žurnalistický záznam, podcast export, hlasová správa, archívna kópia — kto chce jednoduše presný text na výstupe.
Option 03

Otter / Sonix

Upravený panel, mesačný limit minút, anglicky ladený. Nahrávanie súboru sa javí ako vedľajšia funkcia.

NastavenieKonto + platený plán
Identifikácia rečníkovAkustická, anglicky orientovaná
Rýchlosť · 1 hodina MP35–10 min v rade
JazykyOtter iba angličtina; Sonix ~40
ExportDostupné iba v platených plánoch
Náklady$17+/mesiac alebo $10+/hodina (Sonix)
Best forTímy, ktoré chcú editor prepisu a rozhranie na spoluprácu viac ako čisté API štýlové toky súborov→text.

Ceny a dostupnosť funkcií sú presné k máju 2026. Výkon Whisperu sa líši v závislosti od veľkosti modelu a hardvéru.

Špecifické pre MP3

Tri veci, ktoré chytajú ľudí s generickými nástrojmi na prepis.

MP3 je formát, nie štýl nahrávky — čo znamená, že chybové režimy pochádzajú z kódovača, nie z reči.

Čo ide zle

  1. 1VBR hlavičky sa nesprávne parsujú. Niektoré nástroje čítajú MP3s s variabilnou bitrate ako pevnú bitrate a nesprávne vypočítajú trvanie — časové značky sa posúvajú o minúty počas hodinového súboru.
  2. 2Joint-stereo sa zjedností na mono počas predspracovania nahrávania. Stratíte rozdelenie kanálov na rečníka, ktoré bolo v súbore.
  3. 3Vložená ID3 obalka albumu chytí pár nahrávaní — odmietnu súbor ako "nie čistý zvuk" alebo ho odsúria a znova zakódujú, čím ďalej znižujú kvalitu.

Čo robíme namiesto toho

  1. 1Používame hlavičku Xing/LAME, keď je prítomná, a zálohu počtu framov, keď nie. VBR časové značky ostávajú presné na ±0,1 s v multi-hodinových súboroch.
  2. 2MP3s s joint-stereo a skutočným stereo sú dekódované do L/R PCM pred identifikáciou rečníkov. Ak boli vaši rečníci panorámovani, udržiavame ich rozdelené.
  3. 3ID3v1, ID3v2, APE značky, vložené umenie — všetko prejde bez zmien. Nikdy znova nekódujeme váš MP3.

Odporúčané nastavenia úlohy pre nahrávanie MP3

Predvolenia, ktoré vyhovujú ~80% MP3 súborom. Upravte jednotlivé úlohy z formulára.

Dekóder
Frame-presný, bez reenkódovania
Identifikácia rečníkov
Rozdelenie kanálov, ak je stereo, inak akustické
Model rečníka
Auto · 1-12 rečníkov
Jazyk
Automatická detekcia z prvých 30 s
Výplňové slová
Odstránené (prepnite na zachovanie)
Balík exportu
DOCX + SRT + timestampovaný TXT

Accuracy · real-world numbers

95%+ na 192 kbps stereo. Použiteľné až do 64 kbps mono.

Presnosť MP3 je ohraničená tým, čo kódovač zachoval, nie nami. Perceptuálna kompresia nad ~96 kbps veľmi dobre zachováva zrozumiteľnosť reči; pod 64 kbps začínajú sibilanty a spoluhlásky rozpúšťať. Nižšie uvedené čísla pochadzajú z reálnych MP3 súborov zákazníkov v produkcii.

96%
320 kbps stereo, štúdiový zdroj

Skoro bezstratový pre reč. Podcastové majstri, export diktovacích aplikácií, profesionálne nahrávajúce zariadenia. Identifikácia rečníkov je čistá, ak sú rečníci na oddelených kanáloch.

95%
192 kbps stereo, 2-3 rečníci

Najčastejšia bitrate pre hovoriace MP3s. Zoom exporty, Riverside stiahnutia, predvolené hlasové nahrávače. Artefakty kompresie sú pre rozpoznávač neslušiteľné.

91%
128 kbps mono, rozhovor

Predvolené hlasové správy na väčšine telefónov. Akustická identifikácia zvláda 2-4 rečníkov. Čísla a vlastné mená občas potrebujú pohľad.

84%
64 kbps mono, archívne / hlasová schránka

Staré odpisy z odpovedajúcich strojov, archívy prednášok, úzkopásmové zdroje. Vysokofrekvenčné spoluhásky (f/s/sh) sa rozmazávajú. Stále čitateľný — plánujte si prepravu.

Časte otázky

8 vecí, ktoré ľudia pýtajú na prípisy MP3.

01Aká je minimálna bitrate MP3, ktorá stále poskytuje použiteľný prepis?+
64 kbps je praktický podlaha. Pod tým sa sibilanty (s, sh, f) komprimujú do hluku a chybovosť slov stúpa nad 20%. Ak nahrávate čerstvo, zacieľujte na 128 kbps mono alebo 192 kbps stereo — čokoľvek vyššie je zbytočné pre reč.
02Musím konvertovať svoj MP3 do WAV na začiatku?+
Nie. Reenkódovanie MP3 → WAV nepridá nula presnosti, pretože dáta, ktoré kódovač vylúčil, sú preč navždy. Nahrajte MP3 priamo. Dekódujeme framy v pamäti a podáme PCM rozpoznávaču.
03Dá mi stereo MP3 lepšie označenia rečníkov ako mono?+
Iba ak boli rečníci naozaj zaznamenávaní na oddelených kanáloch — väčšina stereo MP3s má rovnaký zvuk na oboch stranách ("dual mono") a nezískava nič. Skutočné rozdelenie kanálov (napr. Riverside exporty, dvojmikrófónové terénne zariadenia) nám umožňuje preskočiť akustickú identifikáciu rečníkov a označiť rečníkov takmer dokonale.
04Aký je maximálny rozsah súboru MP3, ktorý prijímame?+
5 GB na nahrávanie, čo je približne 60 hodín pri 192 kbps alebo 90 hodín pri 128 kbps. Ak je váš súbor väčší, zobrazíme rozdelené nahrávanie — nemusíte ho sami rozdeľovať.
05Ako dlho trvá prepis 60-minútového MP3?+
Obvykle 90 sekúnd od dokončenia nahrávania po pripravený prepis, bez ohľadu na bitrate. Dekódovanie MP3 framov je rýchle; čas je v rozpoznávači. Identifikácia rečníkov pridáva 5-10 sekúnd v súboroch s viacerými rečníkmi.
06Môj MP3 má hudbu na pozadí — bude prepis zničený?+
Tichá hudobná pásma pod rečou sú v poriadku. Hlasná hudba, ktorá konkuruje hlasu (úvodné piesne, hodnotenie počas rozhovorov), niekedy spúšťa chybné rozpoznávanie na prekrývajúcich sa slabikách. Prepnite potlačenie hudby na formulári úlohy na predfiltrovanie.
07Môžete zvládnuť MP3s odsúrané z hlasovej schránky telefónu alebo odpovedajúcich strojov?+
Áno, aj keď sú to často odsúrania 8 kHz narrow-band znova zakódované ako MP3 — strop kvality zvuku je daný pôvodným PSTN chytením, nie obalom MP3. Očakávajte 78-85% presnosť na takomto zdroji, čo je rovnaké, ako by sme dostali na základnom hovore.
08Zachováte môj MP3 po dokončení prepisu?+
Súbory sa stanoveného odstraňujú o 30 dní, alebo hneď na požiadanie cez panel. Prepis zostáva na vašom konte, kým ho neodstránite. Nepoužívame zvuk zákazníka na trénovanie žiadneho modelu — nikdy.

Vložte MP3. Dostanete text späť za 90 sekúnd.

30 bezplatných minút každý mesiac. Bez karty. Označenia rečníkov, 99 jazykov, všetky formáty exportu sú zahrnuté.

Začnú zadarmo