Транскрыбуйце MP3 у тэкст.Пазнакі дыктара, больш за 100 моў.

Перацягніце файл MP3 пры любой бітрэйце ад 64 да 320 kbps. Атрымайце пазначаны часам, са спліцімі дыктараў транскрыпт на 99 мовах — без пераўтварэння фармату, без пераквадравання, без чакання ў чарзе.

Перацягніце аўдыя ці відэа

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Запісвайце проста з браўзера

Рэгістрацыя за 30 секунд — запіс адкрываецца адразу пасля, у панэлі.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTФайлы аўтавыдаляюцца праз 24 г

↓ Гляджыце, што выйдзе

MP3 на ўводзе. Транскрыпт з дыяризацыяй на выводзе.

Мы чытаем загалоўкі кадраў MP3 прамо — VBR, CBR, joint-stereo, любы кодэк (LAME, Fraunhofer, FFmpeg). Калі файл сапраўды стэрэа з дыктарамі на асобных каналах, мы выкарыстоўваем гэта, каб разыдзяліць голасы. Мага-план падае назад на акустычную дыяризацыю.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Транскрыпт · трансляцыя95% дакладнасці
S1

Так калі вы адчулі, што архіў неполны?

S2

Верагодна, каля 2019 года, калі мы пачалі дыджыталізаваць касеты.

S1

А адсутнічаючыя касеты — яны ў якой-небудзь каталогу?

S2

Ёсць паперовы індэкс з '78, але палова яго пашкоджана водай.

95% на 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Тры сапраўдныя варыянты · чэсны параўнанне

Бясплатны лакальны Whisper. Otter ці Sonix. Ці мы.

Вы можаце запусціць Whisper на вашым лаптопе бясплатна, калі ў вас ёсць тэхнічныя навыкі. Otter і Sonix прымаюць загрузкі MP3 у дашбордах падпіскі. Мы прымаем файл, вяртаем транскрыпт — і не забяспечваем вам жыць у інтэрфейсе.

Option 01

Whisper лакальны / адкрыты код

Бясплатна, калі ў вас ёсць GPU і запасны час. Дыяризацыя дыктараў не ўключана з кробкі.

УсталяваннеPython + CUDA + 10 GB мадэлей
Дыяризацыя дыктараўНе ўключана (дадатак pyannote)
Скорасць · 1 гадзіна MP35–40 хв на сумеснай GPU
Мовы99, але малая мадэль падае ніжэй 80%
ЭкспортTXT / SRT / VTT / JSON
КоштБясплатна + ваша электраэнергія
Best forІнжынёры, у якіх ужо ёсць GPU, не трэба пазнак дыктараў, і хочуць поўную лакальную адасаблёнасць.
Option 02

Transcription.Solutions

Закіньце MP3. Атрымайце тэкст з пазнакамі дыктараў практычна ў рэальным часе × 0,025.

УсталяваннеПерацягванне і апусканне, аккаўнт не потрібны для пробы
Дыяризацыя дыктараўЎбудавана (планы Pro & Business)
Скорасць · 1 гадзіна MP3~90 секунд
Мовы99, аўтаматычна выяўляюцца
ЭкспортSRT · VTT · DOCX · TXT · JSON
Кошт · за хвіліну$0.03
Best forКожны з MP3 — журналіст, подкаст, голасавая заметка, архіўная копія — хто проста хоча тачны тэкст на выхадзе.
Option 03

Otter / Sonix

Палаваны дашборд, ліміт хвілін у месяц, англійскі-ўло­ванны. Загрузка файлаў выглядае як побакавая функцыя.

УсталяваннеАккаўнт + платны план
Дыяризацыя дыктараўАкустычная, англійскія скланнасьці
Скорасць · 1 гадзіна MP35–10 хв у чарзе
МовыOtter — толькі EN; Sonix — ~40
ЭкспортЗамкнута ў платных ўзроўнях
Кошт$17+/мес ці $10+/гадзін (Sonix)
Best forКаманды, якія хочуць рэдактара транскрыптаў і інтэрфейс супрацоўніцтва больш, чым чыст API-подабны паток файл→тэкст.

Цаны і наяўнасць функцыяў дакладны на май 2026. Прадукцыйнасць Whisper зависит ад памеру мадэлі і апаратнага абеспячэння.

Спецыфічна для MP3

Тры проблемы, якія ломяць людзей пры юсе агульных інструмэнтаў транскрыпцыі.

MP3 — гэта фармат, не сцвіль запісу — адзін інструмэнты праблемы ідуць ад кодэка, не ад мовы.

Што пячэ

  1. 1Загалоўкі VBR хаўрацца. Акіяк інструмэнт чытаюць MP3 пераменнаю-бітрэйтам як фіксаванаю-бітрэйтам і памыляюцца ў рахунку працягвальнасці — тэмпус адсоўваюцца на хвіліны ў час-доўгім файле.
  2. 2Joint-stereo сплыцаюцца у мона падчас загрузкі папярэдняй апрацоўкі. Вы губляеце асередзяленне дыктараў пакінутыя, якія сапраўды были ў файле.
  3. 3Убудаваны ID3 альбомны арт спацывае акіяклі загружальнікі — яны відаюць файл як 'не чысты аўдыё' ці разоблічаюць і пакідаюць, захопліваючы якасць далей.

Што мы робім замість

  1. 1Мы выкарыстоўваем загаловак Xing/LAME калі ён наяўны і адлік кадраў у запасна. Тэмпусы VBR застаюцца дакладныя да ±0.1 с у мультыгадзінных файлах.
  2. 2Joint-stereo і сапраўдныя-stereo MP3 дэкодзіруюцца да L/R PCM перад дыяризацыяй. Калі вашы дыктары былі панаваны, мы іх раязяльнім.
  3. 3ID3v1, ID3v2, APE тэгі, убудаваны арт — ўсё прапесцьба без змяненняў. Мы ніколі не пакідаем ваш MP3.

Рэкамендаваныя наладкі заданняў для загрузак MP3

Стандарты, якія адпавядаюць ~80% файлаў MP3. Перавызначае за заданне ў формі.

Дэкодэр
Фрэй-дакладны, без пакідання
Дыяризацыя
Раздзел каналаў, калі stereo, іначай акустычны
Мадэль дыктара
Аўта · 1-12 дыктараў
Мова
Аўта-выяўленне з першых 30 с
Слова-напаўненні
Выдалены (уклюыма, каб далю)
Экспорт пакет
DOCX + SRT + пазначаны часам TXT

Accuracy · real-world numbers

95%+ на 192 kbps stereo. Прыдатна пачынаючы з 64 kbps мона.

Дакладнасць MP3 абмежавана тым, што захаваў кодэк, а не мною. Перцэптыўная кампрэсія вышэй ~96 kbps добра захоўває ўлаўлівасць мовы; ніжэй 64 kbps свістпяцы звукі і сумны пачынаюць расплаўляцца. Нумары ніжэй — з сапраўдных файлаў MP3 кліентаў у прадукцыі.

96%
320 kbps stereo, студыйны крыніца

Практычна без страт для мовы. Асноўныя подкасты, экспорты дыктофона, прафесійныя іміэнцы. Дыяризацыя чыста, калі дыктары на асобных каналах.

95%
192 kbps stereo, 2-3 дыктара

Найбольш частая бітрэйт для мовяшчага тэксту MP3. Экспорты Zoom, загрузкі Riverside, стандартныя голасавыя рэкордэры. Артэфакты кампрэсіі нечутныя для распазнавальніка.

91%
128 kbps мона, разговorous

Стандартныя выкрыўкі голасавых нотак на большасці тэлефонаў. Акустычная дыяризацыя справляецца з 2-4 дыктарамі. Наміры і ўласныя імёны часам трэба паглядзець.

84%
64 kbps мона, архіўная / тэлефонная-сброс

Старыя рыпы з адказніка, архіўныя лекцыі, вузкізіс-канальныя крыніцы. Высокачастотныя сумны (f/s/sh) размыты. Яшчё чытаецца — плануй��е карэкцыю.

Частыя пытанні

8 пытанняў пра транскрыпцыю MP3.

01Пры якой мінімальнай бітрэйце MP3 ёшчё дае прыдатны транскрыпт?+
64 kbps — практычны ніз. Ніжэй гэта, свістпяцы (s, sh, f) сцісняюцца ў шум і памыловасць слова расце вышэй 20%. Калі вы запісуеце нанова, мярэйце 128 kbps мона ці 192 kbps stereo — што-небудзь вышэй гэта перамна для мовы.
02Патрібна мне пераўтворыць мой MP3 у WAV спярша?+
Не. Пераквадраванне MP3 → WAV не дадае дакладнасці, таму што дадзеныя, якія выдаліў кодэк, уся адыйшлі. Загрузіце MP3 напрамкі. Мы дэкодзіруем кадры ў памяці і пракідаем PCM распазнавальніку.
03Атрымаю ці я лепшыя пазнакі дыктараў ад stereo MP3, чым ад мана?+
Толькі, калі дыктары запісаны сапраўды на асобных каналах — більш stereo MP3 маюць той жа аўдыё на абодвух баках ('дваль мона') і нічога не атрымліваюць. Сапраўдны раздзел каналаў (напр. экспортаў Riverside, двух-мік палявых рыг) дазваляе нам праскочыць акустычную дыяризацыю і пазнакаць дыктараў практычна ідэальна.
04Які максі­мальны памер файла MP3, які вы прымаеце?+
5 GB за загрузку, што прыблізна 60 гадзін пры 192 kbps ці 90 гадзін пры 128 kbps. Калі ваш файл больш, мы бачыме раздзелену загрузку — не трэба раз ёго раз.
05Як доўга транскрыбуецца 60-хвіліны MP3?+
Звычайна 90 секунд ад загрузкі-завершаны да транскрыпта-гатовы, незаледь бітрэйта. Дэкодаванне кадраў MP3 хутка; час у распазнавальніку. Дыяризацыя дадае 5-10 секунд у мультыдыктарных файлах.
06Мой MP3 мае фонавую музыку — будзе ацэнена?+
Цыя музыка пад мовай добра. Гучная музыка, якая спарнічае з голасам (уводны напевы, скорінг пад інтэрв'юдмі), часам ухіляе памыловасту на перак­лаўеных слізіку. Уклюыма сламаленне музыкі на форме заданняў, каб папярэдне фільтраваць.
07Можаце вы справіцца з MP3 рыпцамі з тэлефоннага голаса ци адказніка?+
Так, хча гэтыя часта 8 kHz вузкізіс-каналь пракі­кодаваны як MP3 — потаг якасцці аўдыё запрацоўлівалі оргінальным PSTN захопленнем, не MP3 трэйлер. Очакайце 78-85% дакладнасці на такім тыпе крыніцы, што аства мы бы атрымалі на пад­ляжны выклік.
08Вы захоўваеце мой MP3 пасля транскрыпт зроблены?+
Файлы выдаляюцца спустя 30 дзён па аўтаўсяцы, ці неадагіцуючы па запросе праз дашборд. Транскрыпт застаецца ў вашым аккаўнце, пакі вы яго не выучыце. Мы не выкарыстоўваем аўдыё кліентаў для навучання любой мадэлі — ніколі.

Закіньце ваш MP3. Атрымайце тэкст за 90 секунд.

30 бясплатных хвілін кожны месяц. Карта не потрібна. Пазнакі дыктара, 99 моў, ўсе фарматы экспорту ўключаны.

Пачаць бясплатна