Транскрибуйте MP3 як текст.Позначення промовців, 100+ мов.

Завантажте MP3 файл будь-якої бітрейти від 64 до 320 kbps. Отримайте розмічену часовими мітками, з позначеннями промовців стенограму в 99 мовах — без конвертування формату, без перекодування, без очікування в черзі.

Перетягніть аудіо чи відео

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Записуйте прямо з браузера

Реєстрація — 30 секунд. Запис відкриється одразу в кабінеті.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTФайли видаляються через 24 години

↓ Дивіться, що вийде

MP3 на вході. Розпізнана стенограма на виході.

Ми читаємо заголовки кадрів MP3 безпосередньо — VBR, CBR, joint-stereo, будь-який кодер (LAME, Fraunhofer, FFmpeg). Якщо файл — справжнє стерео з промовцями на окремих каналах, ми використовуємо це для поділу голосів. Мішування до моно переходить на акустичне розпізнавання промовців.

interview-tape-04.mp3REC 192 kbps · стерео · 38:42
автоматично виявлено en-GB44.1 kHz · LAME 3.100
~90s
Стенограма · потокова передача95% точність
S1

Коли ти вперше зрозумів, що архів неповний?

S2

Мабуть, близько 2019 року, коли ми почали оцифровувати котушки.

S1

А відсутні касети — вони взагалі були каталогізовані?

S2

Є паперовий індекс з 78 року, але половина його пошкоджена водою.

95% на 192 kbps стереоSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Три реальні варіанти · чесне порівняння

Безплатний локальний Whisper. Otter або Sonix. Або ми.

Ви можете запустити Whisper на своному ноутбуці безплатно, якщо вмієте програмувати. Otter та Sonix приймають завантаження MP3 у панелях передплати. Ми беремо файл, повертаємо стенограму та не змушуємо вас жити у інтерфейсі.

Option 01

Whisper локальний / відкритий код

Безплатно, якщо у вас є GPU та вільний час. Без розпізнавання промовців з коробки.

НалаштуванняPython + CUDA + моделі 10 GB
Розпізнавання промовцівНе включено (модуль pyannote)
Швидкість · 1 год MP35–40 хв на consumer GPU
Мови99, але маленька модель падає нижче 80%
ЕкспортTXT / SRT / VTT / JSON
ВартістьБезплатно + ваша електроенергія
Best forІнженери, у яких уже є GPU, не потрібні позначення промовців та хочуть повної локальної приватності.
Option 02

Transcription.Solutions

Завантажте MP3. Отримайте текст з позначеннями промовців майже в реальному часі × 0,025.

НалаштуванняПеретягніть і відпустіть, акаунт не потрібен для пробування
Розпізнавання промовцівВбудовано (плани Pro & Business)
Швидкість · 1 год MP3~90 секунд
Мови99, автоматичне розпізнавання
ЕкспортSRT · VTT · DOCX · TXT · JSON
Вартість · за хвилину$0,03
Best forБудь-хто з MP3 — журналістська касета, експорт подкасту, голосова записка, архівна дублювання — хто просто хоче отримати точний текст на іншому кінці.
Option 03

Otter / Sonix

Полірована панель, щомісячна кількість хвилин, налаштована для англійської. Завантаження файлу виглядає як побічна функція.

НалаштуванняАкаунт + платний план
Розпізнавання промовцівАкустичне, EN-орієнтоване
Швидкість · 1 год MP35–10 хв в черзі
МовиOtter EN тільки; Sonix ~40
ЕкспортЗаблоковано за платними рівнями
Вартість$17+/міс або $10+/год (Sonix)
Best forКоманди, які хочуть редактора стенограм та UI співпраці більше, ніж чистого потоку API-стилю файл→текст.

Ціни та доступність функцій точні на травень 2026 р. Продуктивність Whisper залежить від розміру моделі та обладнання.

Специфічно для MP3

Три речі, які спотикають людей на універсальних сервісах транскрипції.

MP3 — це формат, не стиль запису — що означає режими відмови виникають із кодера, не з мови.

Що піде не так

  1. 1Заголовки VBR неправильно розпізнаються. Деякі інструменти читають MP3 зі змінною бітрейтою як фіксований рівень і невірно обчислюють тривалість — часові мітки дрейфують на хвилини протягом однієї години файлу.
  2. 2Joint-stereo розпліснюється до моно під час попередньої обробки завантаження. Ви втрачаєте розділення на канал по промовцю, яке було насправді у файлі.
  3. 3Вбудована обкладинка альбому ID3 спотикає кілька завантажувальників — вони відхиляють файл як 'не чистий аудіо' або видаляють його і перекодують, ще більше скидаючи якість.

Що ми робимо замість цього

  1. 1Ми використовуємо заголовок Xing/LAME, коли присутній, та fallback підрахунку кадрів коли ні. Часові мітки VBR залишаються точні в межах ±0,1 с протягом багатогодинних файлів.
  2. 2Joint-stereo та справжні стерео MP3 декодуються до L/R PCM перед розпізнаванням промовців. Якщо ваші промовці були розподілені по панелям, ми їх зберігаємо розділеними.
  3. 3ID3v1, ID3v2, APE теги, вбудована обкладинка — всі передані без змін. Ми ніколи не перекодуємо ваш MP3.

Рекомендовані налаштування завдання для завантажень MP3

Параметри за замовчуванням, які підходять ~80% файлів MP3. Перевизначити за завданням з форми.

Декодер
Точний за кадром, без перекодування
Розпізнавання промовців
Розділення каналу, якщо стерео, інакше акустичне
Модель промовця
Авто · 1-12 промовців
Мова
Автоматичне розпізнавання з першого 30 с
Слова-наповнювачі
Видалені (перемикач, щоб зберегти)
Пакет експорту
DOCX + SRT + розмічений за часом TXT

Accuracy · real-world numbers

95%+ на 192 kbps стерео. Придатна вже від 64 kbps моно.

Точність MP3 обмежена тим, що кодер зберіг, не нами. Розпізнавальна компресія вище ~96 kbps дуже добре зберігає зрозумілість мови; нижче 64 kbps, сибілянти та приголосні починають розчинятися. Цифри нижче — від справжніх MP3 клієнтів у виробництві.

96%
320 kbps стерео, студіойне джерело

Майже без втрат для мови. Майстер-версії подкастів, експорти з додатку диктування, професіональна апаратура для інтерв'ю. Розпізнавання промовців чисте, якщо промовці на окремих каналах.

95%
192 kbps стерео, 2-3 промовці

Найпоширеніша бітрейта для розмовних MP3. Експорти Zoom, завантаження Riverside, голосові записувачі за замовчуванням. Артефакти компресії непомітні розпізнавачу.

91%
128 kbps моно, розмовна мова

За замовчуванням голосові записки на більшості телефонів. Акустичне розпізнавання промовців обробляє 2-4 промовців. Числа та власні імена інколи потребують перевірки.

84%
64 kbps моно, архівна / телефонна

Старі дампи автовідповідача, архіви лекцій, вузькосмугові джерела. Високочастотні приголосні (f/s/sh) розмиваються. Все ще читаєма — планіруйте перевірку.

Часті запитання

8 речей, які люди запитують про транскрипцію MP3.

01Яка мінімальна бітрейта MP3, яка все ще дає придатну стенограму?+
64 kbps — практичне мінімум. Нижче цього, сибілянти (s, sh, f) стискаються в шум, а середня помилка слова піднімається вище 20%. Якщо ви записуєте нові матеріали, прагніть 128 kbps моно або 192 kbps стерео — все вище є зайвим для мови.
02Чи потрібно мені конвертувати мій MP3 у WAV спочатку?+
Ні. Перекодування MP3 → WAV не додає нульову точність, тому що дані, які кодер відкинув, безслідно зникли. Завантажте MP3 безпосередньо. Ми декодуємо кадри в пам'ять та передаємо PCM розпізнавачу.
03Чи дасть мені стерео MP3 кращі позначення промовців, ніж моно?+
Тільки якщо промовці були насправді записані на окремих каналах — більшість стерео MP3 мають один і той же звук на обох сторонах ('двійне моно') і не отримують нічого. Справжній поділ каналів (наприклад, експорти Riverside, риг з двома мікрофонами) дозволяє нам пропустити акустичне розпізнавання промовців та позначити промовців майже ідеально.
04Який максимальний розмір файлу MP3, який ви приймаєте?+
5 GB на завантаження, що приблизно 60 годин на 192 kbps або 90 годин на 128 kbps. Якщо ваш файл більший, ми покажемо поступове завантаження — жодної потреби розділяти це самостійно.
05Як довго займає транскрибування 60-хвилинного MP3?+
Зазвичай 90 секунд від завершення завантаження до готівки стенограми, незалежно від бітрейти. Декодування кадрів MP3 швидке; час у розпізнавачеві. Розпізнавання промовців додає 5-10 секунд на файлах з кількома промовцями.
06Мій MP3 має фонову музику — чи стенограма буде зіпсована?+
Тиха ліжечка музики під мовою в порядку. Гучна музика, яка конкурує з голосом (вступні стінги, оцінка під інтерв'ю), іноді спричиняє помилки розпізнавання на перекриваних складах. Перемикніть музичне придушення на формі завдання, щоб попередньо фільтрувати.
07Чи можете ви обробляти MP3, зірвані з голосової пошти або автовідповідачів телефону?+
Так, хоча це часто 8 kHz вузькосмуга перекодовані як MP3 — стеля якості аудіо встановлюється первинним PSTN захватом, не обгорткою MP3. Очікуйте точність 78-85% на цьому виді джерела, яка така ж, як на самому дзвінку.
08Ви зберігаєте мій MP3 після завершення стенограми?+
Файли видаляються через 30 днів за замовчуванням або негайно на запит через панель. Стенограма залишається у вашому акаунті, поки ви її не видалите. Ми не використовуємо аудіо клієнтів для навчання будь-якої моделі — ніколи.

Завантажте свій MP3. Отримайте текст за 90 секунд.

30 безплатних хвилин щомісяця. Без карти. Позначення промовців, 99 мов, всі формати експорту включені.

Почати безплатно