Транскрибирайте MP3 в текст.Етикети на говорещите, 100+ езика.

Прекарайте MP3 файл при всякакъв битрейт от 64 до 320 kbps. Получете снимена запис със времеви клеймо и етикети на говорещите в 99 езика — без преобразуване на формат, без повторно кодиране, без чакане на опашка.

Пусни своето аудио или видео

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Записвай директно от браузъра

Регистрацията отнема 30 секунди — записът се отваря веднага след това, в таблото.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTФайловете се изтриват автоматично след 24 ч.

↓ Вижте какво излиза

MP3 входящо. Диаризиран транскрипт изходящ.

Четем MP3 заглавията на кадрите директно — VBR, CBR, joint-stereo, всеки кодер (LAME, Fraunhofer, FFmpeg). Ако файлът е истински стерео със говорещи на отделни канали, го използваме за разделяне на гласове. Монофонното свеждане отпада на акустична диаризация.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
автоматично разпознат en-GB44.1 kHz · LAME 3.100
~90s
Транскрипт · потоково95% точност
S1

Кога за първи път разбра, че архивът е непълен?

S2

Вероятно около 2019 г., когато започнахме да дигитализираме ролките.

S1

А липсващите ленти — бяха ли каталогизирани някъде изобщо?

S2

Има паперен индекс от '78, но половината му е повредена от вода.

95% при 192 kbps стереоSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Три реални опции · честно сравнение

Безплатен локален Whisper. Otter или Sonix. Или ние.

Можете да стартирате Whisper на своя лаптоп безплатно, ако сте технически наклонени. Otter и Sonix приемат MP3 качвания вътре в приборните панели на абонамента. Ние вземаме файла, връщаме транскрипта, и не ви принуждаваме да живеете вътре в интерфейс.

Option 01

Whisper local / open source

Безплатно, ако имате GPU и един следобед. Без диаризация на говорещите по подразбиране.

НастройкаPython + CUDA + 10 GB модели
Диаризация на говорещитеНе е включена (добавка pyannote)
Скорост · 1 час MP35–40 мин на потребителския GPU
Езици99, но малкия модел пада под 80%
ЕкспортиранеTXT / SRT / VTT / JSON
ЦенаБезплатно + вашата електроенергия
Best forИнженери, които вече имат GPU, не нуждаят се от етикети на говорещите и искат пълна локална поверителност.
Option 02

Transcription.Solutions

Прекарайте MP3. Получете говорещи етикети назад за примерно реално време × 0.025.

НастройкаDrag-and-drop, не е необходима сметка за опит
Диаризация на говорещитеВградена (Pro & Business планове)
Скорост · 1 час MP3~90 секунди
Езици99, автоматично разпознаване
ЕкспортиранеSRT · VTT · DOCX · TXT · JSON
Цена · за минута$0.03
Best forВсеки с MP3 — журналистически лента, експорт на подкаст, гласова памет, архивна копира — който просто иска точен текст на другия край.
Option 03

Otter / Sonix

Полиран приборен панел, месечен лимит на минутите, английски настроен. Качването на файл се чувства като странична функция.

НастройкаСметка + платен план
Диаризация на говорещитеАкустична, EN-склонна
Скорост · 1 час MP35–10 мин в опашка
ЕзициOtter EN-само; Sonix ~40
ЕкспортиранеЗаключено зад платени нива
Цена$17+/месец или $10+/час (Sonix)
Best forЕкипи, които искат редактор на транскрипт и сътрудничество на потребителския ин��ерфейс повече от чист API-стил файл→текст поток.

Цена и достъпност на функции точни към май 2026 г. Производителността на Whisper варира в зависимост от размера на модела и хардуера.

Специфично за MP3

Три неща, които кусат хора на генеричен инструменти за транскрипция.

MP3 е формат, не стил на запис — което означава, че режимите на отказ идват от кодъра, не от речта.

Какво се случва

  1. 1VBR заглавията се анализира�� неправилно. Някои инструменти четат MP3 файлове с променлива скорост като с фиксирана скорост и погрешно калкулират продължителността — времеви клеймо се отместват с минути през час-долгия файл.
  2. 2Joint-stereo се сплеща в монофонно по време на предварителен преработка на качване. Губите разделянето на канали по говорещ, което наистина е било в файла.
  3. 3Вградено ID3 албумно изкуство подпалва няколко качвачи — те отхвърлят файла като 'не чист аудио' или го премахват и повторно кодират, намаляват качеството допълнително.

Какво правим вместо това

  1. 1Използваме Xing/LAME заглавие когато присъства и fallback на брой на кадрите, когато не е. VBR времеви клеймо остават точни до ±0.1 s през много-часови файлове.
  2. 2Joint-stereo и истински стерео MP3 файлове са декодирани в L/R PCM преди диаризация. Ако вашите говорещи са били панирани, ги запазваме разделни.
  3. 3ID3v1, ID3v2, APE етикети, вградено изкуство — всички пропуснати неповредени. Ние никога не повторно кодираме вашия MP3.

Препоръчани настройки на работа за MP3 качвания

Стандартни, които се вписват ~80% на MP3 файлове. Отмяна за всяка работа от формата.

Декодер
Точен на кадър, без повторна кодиране
Диаризация
Разделяне на канал, если стерео, иначе акустична
Модел на говорещ
Авто · 1-12 говорещи
Език
Автоматично разпознав от първи 30 s
Пълнителни думи
Премахнати (превалидирайте да запазите)
Експортна сноп
DOCX + SRT + времева клеймо TXT

Accuracy · real-world numbers

95%+ при 192 kbps стерео. Работещо до 64 kbps монофонно.

MP3 точността е ограничена от това, което кодерът запази, не от нас. Перцепционната компресия над ~96 kbps запазва разбираемостта на речта много добре; под 64 kbps, свистящите и съгласните звуци започват да се разтварят. Числата по-долу са от реални MP3 файлове на клиенти в производство.

96%
320 kbps стерео, студийна източник

Близо до безстратна за реч. Мастери на подкасти, експорти на приложения за диктуване, професионални интервю ризи. Диаризацията е чиста, ако говорещите са на отделни канали.

95%
192 kbps стерео, 2-3 говорещи

Най-често срещаният битрейт за MP3 файлове със разговорна реч. Експорти на Zoom, Riverside изтегляния, стандартни гласови записвачи. Артефактите на компресия са неслышни за разпознавателя.

91%
128 kbps монофонно, разговорно

Стандартни гласови памети на повечето телефони. Акустичната диаризация работи с 2-4 говорещи. Числата и имена на място понякога нуждаят поглед.

84%
64 kbps монофонно, архивно / телефонно-демп

Стари риповачи на телефонни отговарачи, архиви на лекции, тесни честотни полоси. Високочестотни съгласни (f/s/sh) размиване. Все още разбираемо — планирайте проверка.

Често задавани въпроси

8 неща, които хора питат за MP3 транскрипция.

01Какъв е минималният MP3 битрейт, който все още дава използваемо транскрипция?+
64 kbps е практичния минимум. По-долу, свистящите звуци (s, sh, f) се компресират в шум и процентът на грешка в думите се изкачва над 20%. Ако записвате направо, целете 128 kbps монофонно или 192 kbps стерео — всичко по-високо е излишно за реч.
02Трябва ли да конвертирам MP3 в WAV преди това?+
Не. Повторна кодиране MP3 → WAV добавя нулева точност, защото данните, които кодерът е отхвърлил, са ненавратни. Качете MP3 директно. Ние декодираме кадрите в паметта и хранилище PCM към разпознавател.
03Ще ми даде ли стерео MP3 по-добри етикети на говорещите от монофонно?+
Само ако говорещите са действително записани на отделни канали — повечето стерео MP3 файлове имат един и същ аудио от двете страни ('dual mono') и печелят нищо. Истинския канал-разделяне (напр. Riverside експорти, два-микрофона работилници ризи) ни позволява да пропуснем акустична диаризация и да етикетираме говорещи близо-перфектно.
04Какъв е максималният MP3 размер на файла, който приемате?+
5 GB за качване, което е грубо 60 часа при 192 kbps или 90 часа при 128 kbps. Ако вашия файл е по-голям, ще показваме качване с на части — не е необходимо да го разделите сами.
05Колко време отнема транскрипция на 60-минутен MP3?+
Обикновено 90 секунди от качване-завършен към транскрипт-готов, независимо от битрейт. Декодираното MP3 кадрите е бързо; времето е в разпознавателя. Диаризацията добавя 5-10 секунди на много-говорещи файлове.
06Модата MP3 има фонова музика — ще бъде ли транскрипцията разрушена?+
Спокойна музика под реч е добра. Силната музика, която се конкурира с гласа (интро щифтове, скоринг под интервюта) понякога предизвиква неправилно разпознаване на преклоняващи слагама. Превалидирайте потискане на музика на форма на работа за предварителен филтър.
07Можете ли да обработите MP3 файлове, риповани от телефонна гласова поща или телефонни отговарачи?+
Да, макар че тези често са 8 kHz теснолентово повторна кодиране като MP3 — потолък на качеството на аудиото е определен от оригиналния PSTN улов, не от MP3 обвивка. Очаквайте 78-85% точност по този тип източник, което е същото, което получихме на основния призив.
08Задържате ли моя MP3, след като транскрипцията е готова?+
Файловете се изтриват След 30 дни по подразбиране, или веднага по поискване чрез приборен панел. Транскрипцията остава в сметка си докато не я изтриете. Ние не използваме клиентския аудио за обучение на всеки модел — никога.

Прекарайте вашия MP3. Получете текст назад в 90 секунди.

30 безплатни минути всеки месец. Не е необходима карта. Етикети на говорещите, 99 езика, всеки експортен формат включен.

Начало безплатно