Транскрибирајте MP3 во текст.Етикети за говорници, 100+ јазици.

Пуштете MP3 датотека при која било брзина од 64 до 320 kbps. Добијте временски означена, транскрипција со етикети за говорници на 99 јазици — без конверзија на формат, без повторно кодирање, без чекање во ред.

Спушти го аудиото или видеото

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Снимај директно од прелистувачот

Регистрацијата трае 30 секунди — снимањето се отвора веднаш потоа, во контролната табла.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFiles auto-delete in 24h

↓ Видете што излегува

MP3 внатре. Дијаризирана транскрипција надвор.

Ги читаме MP3 frame headers директно — VBR, CBR, joint-stereo, по какво било кодирање (LAME, Fraunhofer, FFmpeg). Ако датотеката е вистинско stereo со говорници на одделни канали, го користиме тоа за да раздвоиме гласови. Mono мешање се враќа на акустичната дијаризација.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
автоматски детектирана en-GB44.1 kHz · LAME 3.100
~90s
Транскрипција · streaming95% точност
S1

Кога за прв пат сфативте дека архивот е непотполн?

S2

Веројатно околу 2019, кога почнавме да дигитализираме reel-to-reels.

S1

А недостасување касетите — дали се каталогизирани некаде воопште?

S2

Има хартиен индекс од '78, но половина од него је оштетена од вода.

95% на 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Три вистински опции · честно споредување

Бесплатен локален Whisper. Otter или Sonix. Или нас.

Можете да го извршите Whisper на вашиот лаптоп бесплатно ако сте технички способни. Otter и Sonix прифаќаат MP3 поставени во рамките на subscription dashboard-и. Ја земаме датотеката, ја враќаме транскрипцијата, и не ви наметнуваме да живеете внатре UI.

Option 01

Whisper локален / open source

Бесплатно ако имате GPU и време. Без дијаризација на говорници по дефолт.

ПоставкаPython + CUDA + 10 GB модели
Дијаризација на говорнициНе е вклучена (pyannote додаток)
Брзина · 1 час MP35–40 мин на consumer GPU
Јазици99, но мал модел паѓа под 80%
ЕкспортTXT / SRT / VTT / JSON
ЦенаБесплатно + вашата електрична енергија
Best forИнженери кои веќе имаат GPU, не им требаат етикети за говорници, и сакаат целосна локална приватност.
Option 02

Transcription.Solutions

Пуштете го MP3. Добијте текст со етикети за говорници назад за релативно вистинско време × 0.025.

ПоставкаDrag-and-drop, нема потреба од сметка за пробување
Дијаризација на говорнициВграден (Pro & Business планови)
Брзина · 1 час MP3~90 секунди
Јазици99, автоматски детектирани
ЕкспортSRT · VTT · DOCX · TXT · JSON
Цена · по мин$0.03
Best forБило кој со MP3 — интервју касета, podcast експорт, voice memo, архивна дублирање — кој само сака точен текст на излезот.
Option 03

Otter / Sonix

Полиран dashboard, месечна граница на минути, англиски-наредување. Поставување датотека изгледа како страничен функција.

ПоставкаСметка + платен план
Дијаризација на говорнициАкустична, EN-ориентирана
Брзина · 1 час MP35–10 мин во ред
ЈазициOtter EN-само; Sonix ~40
ЕкспортЗаклучен зад платени нивоа
Цена$17+/месец или $10+/час (Sonix)
Best forЕкипи кои сакаат транскрипцијски уредник и сумеј UI повеќе од чист API-стил датотека→текст проток.

Цена и достапност на ф��нкции точни кон май 2026. Whisper перформанса варира според величина на модел и хардвер.

Специфично за MP3

Три нешта кои ги бодат луѓето на генерички транскрипцијски алатки.

MP3 е формат, не стил на снимање — што значи дека режимот на неуспех доаѓа од кодирачот, не од говорот.

Што оди погрешно

  1. 1VBR headers добиваат погрешно разработени. Некои алатки го читаат variable-bitrate MP3 како fixed-rate и наполево го пресметуваат времетраењето — време петни дрифт за минути над час-долго датотека.
  2. 2Joint-stereo добива спушена до mono за време на поставување на упозорување. Вие ја губите per-speaker channel раздвајање која вистински беше во датотеката.
  3. 3Embed ID3 albumu уметност tripnava на неколку uploaderi — ја отфрлањат датотеката како 'не чист аудио' или го собира и повторно кодира, фрла квалитет подалеку.

Што ние правиме наместо

  1. 1Ги користиме Xing/LAME header кога присутен и frame-count fallback кога не. VBR временските печати остануваат точни до ±0.1 s преку multi-hour датотеки.
  2. 2Joint-stereo и true-stereo MP3 се декодирани до L/R PCM пред дијаризација. Ако вашите говорници беа панирани, ги держиме раздвоени.
  3. 3ID3v1, ID3v2, APE tags, embed уметност — се прошлеџа нераспорпдена. Ние никогаш не повторно кодираме ваше MP3.

Препорачани поставки на работа за MP3 поставени

Дефолти кои одговараат ~80% од MP3 датотеки. Override по-работа од формата.

Декодер
Frame-точен, нема повторно кодирање
Дијаризација
Channel раздвајање ако stereo, иначе акустична
Модел на говорник
Auto · 1-12 говорници
Јазик
Auto-detect од први 30 s
Filler зборови
Отстранетo (toggle за задржување)
Експорт пакет
DOCX + SRT + временско означена TXT

Accuracy · real-world numbers

95%+ на 192 kbps stereo. Употребено надолу до 64 kbps mono.

MP3 точност е ограничена од што кодирачот ја задржа, не од нас. Перцептуална компресија над ~96 kbps одлично ја зачувува говорната разбирливост; надолу од 64 kbps, sibilants и consonants почнуваат да се расипуваат. Броевите подолу се од вистински MP3 на клиенти во производство.

96%
320 kbps stereo, studio извор

Скоро-без-загуба за говор. Podcast мастери, диктатор приложувања, професионален интервју риг. Дијаризација чиста ако говорници на одделни канали.

95%
192 kbps stereo, 2-3 говорници

Најчеста брзина за говорни MP3. Zoom експорти, Riverside преземања, voice recorder дефичнии. Компресија артефакти читав на препознавач.

91%
128 kbps mono, разговорен

Voice memo дефолти на повеќе телефони. Акустична дијаризација справува 2-4 говорници. Броеви и имена понекогаш требаат да видите.

84%
64 kbps mono, архивна / phone-dump

Стари машина за одговори рипови, лекция архиви, narrow-band извори. Високо-фреквентност consonants (f/s/sh) замаглени. Сé уште разбирливо — планирајте проверка.

Чести прашања

8 нешта кои луѓето прашуваат за MP3 транскрипција.

01Која е минимална MP3 брзина која сé уште給 употребена транскрипција?+
64 kbps е практична подземје. Надолу од тоа, sibilants (s, sh, f) компресира во шум и word error rate се качува над 20%. Ако вие снимате свеж, го насочува 128 kbps mono или 192 kbps stereo — нешто покрајно е overkill за говор.
02Дали морам да го конвертирам мој MP3 до WAV прво?+
Не. Повторно кодирање MP3 → WAV додава нула точност бидејќи податоците кодирачот отфрлени паралелni за добро. Пуштете го MP3 директно. Ние декодираме frames во меморија и храна PCM на препознавачот.
03Дали stereo MP3 ќе ми даде подобри етикети за говорници од mono?+
Само ако говорците вистински беше зазнаен на одделни канали — повеќе stereo MP3 имаме ист аудио на обе страна ('dual mono') и добиво ништо. Вистинска channel-split (т.е. Riverside експорти, два-mic field риг) ни дозволава да го прескочиме акустична дијаризација и этикета говорници блиску-совршено.
04Која е максимална MP3 величина датотека што ја прифаќате?+
5 GB по поставување, што е грубо 60 часа на 192 kbps или 90 часа на 128 kbps. Ако вашата датотека е поголема ќе покажеме chunked поставување — нема потреба да ја раздвоите самите.
05Колку долго трае 60-минутен MP3 за да се транскрибира?+
Типично 90 секунди од upload-комплет до транскрипт-готин, независно од брзина. Декодирање MP3 frames е брзо;時間е во препознавачот. Дијаризација додава 5-10 секунди на multi-speaker датотеки.
06Мој MP3 има позадинска музика — ќе биде транскрипцијата си уништена?+
Тивко легло музика под говор е во ред. Громка музика која се натпреварува со глас (intromuzika, снимање под интервјуа) понекогаш го тригерира неоспоривање на преклопување на слаби. Toggle music suppression на формата работа за пред-филтер.
07Можете ли да го справувате MP3 рипови од телефонски voicemail или машина за одговори?+
Да, иако овие се се 8 kHz narrow-band повторно кодирана како MP3 — потолок на аудио квалитет е вие тthe оригинален PSTN захтев, не на MP3 обвивка. Очекувај 78-85% точност на тој вид извор, што е иста ќе бивме од основната повик.
08Дали ја задржувате мој MP3 по завршувањето на транскрипцијата?+
Датотеката се бришат по 30 дена по дефолт, или веднаш на барање преку dashboard. Транскрипцијата останува во вашата сметка додека не ја избришите. Ние не користиме customer аудио до train bilo кој модел — никогаш.

Пуштете го вашиот MP3. Добијте текст назад во 90 секунди.

30 слободни минути секој месец. Нема картичка потребна. Етикети за говорници, 99 јазици, секој експорт формат вклучен.

Почни слободно