Transkrybuj MP3 na tekst.Etykiety mówców, 100+ języków.

Prześlij plik MP3 o dowolnym bitratcie od 64 do 320 kbps. Uzyskaj transkrypt z czasomierzem i etykietami mówców w 99 językach — bez konwersji formatu, bez ponownego kodowania, bez czekania w kolejce.

Wrzuć audio lub wideo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Nagrywaj prosto z przeglądarki

Rejestracja zajmuje 30 sekund — nagrywanie otwiera się od razu po niej, w panelu.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTPliki znikają automatycznie po 24 h

↓ Sprawdź co otrzymasz

MP3 wchodzi. Transkrypt z separacją mówców wychodzi.

Czytamy nagłówki ramek MP3 bezpośrednio — VBR, CBR, joint-stereo, jakiś koder (LAME, Fraunhofer, FFmpeg). Jeśli plik jest prawdziwym stereofonikiem z głosami na osobnych kanałach, używamy tego do podziału głosów. Mieszanina mono powraca do separacji akustycznej.

rozmowa-04.mp3REC 192 kbps · stereo · 38:42
auto-detektowany en-GB44.1 kHz · LAME 3.100
~90s
Transkrypt · strumieniowanie95% dokładności
S1

Kiedy się okazało, że archiwum jest niekompletne?

S2

Prawdopodobnie wokół 2019, kiedy zaczęliśmy cyfryzować taśmy szpulowe.

S1

A brakujące taśmy — były gdzieś katalogowane?

S2

Jest papierowy indeks z 78, ale połowa jest uszkodzona wodą.

95% przy 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trzy prawdziwe opcje · szczera porównanie

Darmowy lokalny Whisper. Otter lub Sonix. Lub my.

Możesz uruchomić Whisper na swoim laptopie za darmo, jeśli jesteś techniczny. Otter i Sonix akceptują przesyłanie MP3 w kokpitach subskrypcji. Bierzemy plik, zwracamy transkrypt i nie zmuszamy cię do życia w interfejsie użytkownika.

Option 01

Whisper lokalny / open source

Bezpłatnie, jeśli masz GPU i popołudnie. Bez separacji mówców z pudełka.

SetupPython + CUDA + modele 10 GB
Separacja mówcówNie dołączone (dodatek pyannote)
Szybkość · 1 h MP35–40 min na konsumenckim GPU
Języki99, ale mały model spada poniżej 80%
EksportTXT / SRT / VTT / JSON
KosztBezpłatnie + twoja elektryczność
Best forInżynierowie, którzy już posiadają GPU, nie potrzebują etykiet mówców i chcą pełną lokalną prywatność.
Option 02

Transcription.Solutions

Prześlij MP3. Uzyskaj tekst z etykietami mówców prawie w czasie rzeczywistym × 0.025.

SetupPrzeciągnij i upuść, bez konta aby spróbować
Separacja mówcówWbudowana (plany Pro i Business)
Szybkość · 1 h MP3~90 sekund
Języki99, auto-detektowane
EksportSRT · VTT · DOCX · TXT · JSON
Koszt · za minutę$0.03
Best forKażdy z MP3 — taśma dziennikarza, eksport podcastu, notatka głosowa, archiwalna kopia — kto po prostu chce dokładny tekst na wyjściu.
Option 03

Otter / Sonix

Polerowany kokpit, limit minut na miesiąc, anglojęzyczny. Przesyłanie pliku wygląda jak funkcja uboczna.

SetupKonto + płatny plan
Separacja mówcówAkustyczna, EN-skierowana
Szybkość · 1 h MP35–10 min w kolejce
JęzykiOtter EN-only; Sonix ~40
EksportZablokowany za płatnymi warstwami
Koszt$17+/mc lub $10+/h (Sonix)
Best forZespoły, które chcą więcej edytora transkryptów i interfejsu współpracy niż czysty przepływ plik→tekst w stylu API.

Ceny i dostępność funkcji dokładne na maj 2026. Wydajność Whispera zależy od rozmiaru modelu i sprzętu.

Specyficzne dla MP3

Trzy rzeczy, które zawiedzą ludzi na ogólnych narzędziach transkrypcji.

MP3 to format, a nie styl nagrania — co oznacza, że rodzaje awarii pochodzą z kodera, a nie z mowy.

Co się nie udaje

  1. 1Nagłówki VBR są błędnie parsowane. Niektóre narzędzia czytają MP3 ze zmiennym bitrate jako ze stałym i błędnie obliczają czas trwania — znaczniki czasu dryfują o minuty na pliku godzinnym.
  2. 2Joint-stereo spłaszczane do mono podczas wstępnego przetwarzania przesyłu. Tracisz separację kanałów per-mówca, która była faktycznie w pliku.
  3. 3Osadzona okładka albumu ID3 wycina kilka przesyłaczy — odrzucają plik jako 'nie czystej audio' lub usuwają i ponownie kodują, obniżając jakość dalej.

Co my robimy zamiast tego

  1. 1Używamy nagłówka Xing/LAME gdy jest obecny i rezerwowy złiczania ramek gdy nie. Znaczniki czasu VBR pozostają dokładne do ±0.1 s na plikach wielogodzinnych.
  2. 2Joint-stereo i prawdziwe stereo MP3 są dekodowane do L/R PCM przed separacją. Jeśli twoje głosy były panoramowane, je zachowujemy rozdzielone.
  3. 3ID3v1, ID3v2, tagi APE, osadzona okładka — wszystkie przechodzą bez zmian. Nigdy nie ponownie kodujemy twój MP3.

Rekomendowane ustawienia zadania dla przesyłań MP3

Domyślne ustawienia pasujące do ~80% plików MP3. Przesłoń na zadanie z formularza.

Dekoder
Dokładny do ramki, bez ponownego kodowania
Separacja
Podział kanałów jeśli stereo, inaczej akustyczna
Model mówcy
Auto · 1-12 mówców
Język
Auto-detektuj z pierwszych 30 s
Słowa wypełniające
Usunięte (przełącznik aby zachować)
Pakiet eksportu
DOCX + SRT + TXT z czasomierzem

Accuracy · real-world numbers

95%+ przy 192 kbps stereo. Do użytku aż do 64 kbps mono.

Dokładność MP3 jest ograniczona tym, co koder zachował, a nie przez nas. Kompresja percepcyjna powyżej ~96 kbps bardzo dobrze zachowuje zrozumiałość mowy; poniżej 64 kbps, sybillanty i spółgłoski zaczynają się rozpuszczać. Liczby poniżej pochodzą z prawdziwych MP3 klientów w produkcji.

96%
320 kbps stereo, źródło studyjne

Prawie bez strat dla mowy. Mastery podcastów, eksporty aplikacji dyktafonowej, profesjonalne urządzenia do nagrywania rozmów. Separacja czista, jeśli mówcy na osobnych kanałach.

95%
192 kbps stereo, 2-3 mówcy

Najczęstszy bitrate dla MP3 gatunku mówionego. Eksporty Zoom, pobieranie Riverside, domyślne ustawienia rejestratora głosu. Artefakty kompresji nie słyszalne dla rozpoznającego.

91%
128 kbps mono, konwersacyjny

Domyślna notatka głosowa na większości telefonów. Separacja akustyczna obsługuje 2-4 mówców. Liczby i nazwy własne czasami potrzebują spojrzenia.

84%
64 kbps mono, archiwalne / zrzuty z telefonu

Rip starych sekretarek, archiwa wykładów, źródła o wąskim paśmie. Spółgłoski wysoko-częstotliwościowe (f/s/sh) się rozmywają. Wciąż czytelne — zaplanuj korektę.

Popularne pytania

8 rzeczy, które ludzie pytają o transkrypcję MP3.

01Jaki jest minimalny bitrate MP3, który daje użyteczny transkrypt?+
64 kbps to praktyczna granica. Poniżej tego sybillanty (s, sh, f) kompresować się w szum i wskaźnik błędu słowa wspina się powyżej 20%. Jeśli nagrywasz świeżo, celuj 128 kbps mono lub 192 kbps stereo — cokolwiek wyżej to overkill dla mowy.
02Czy muszę konwertować mój MP3 do WAV najpierw?+
Nie. Re-kodowanie MP3 → WAV dodaje zero dokładności, ponieważ dane, które koder odrzucił są skończone na zawsze. Prześlij MP3 bezpośrednio. Dekodujemy ramki w pamięci i podajemy PCM do rozpoznającego.
03Czy stereo MP3 da mi lepsze etykiety mówców niż mono?+
Tylko jeśli mówcy byli faktycznie nagrywani na osobnych kanałach — większość stereo MP3 ma ten sam audio na obu stronach ('dual mono') i zyskuje nic. Prawdziwy podział kanałów (np. eksporty Riverside, dwu-mikrofonowe urządzenia terenowe) pozwala nam pominąć separację akustyczną i etykietować mówców prawie doskonale.
04Jaki jest maksymalny rozmiar pliku MP3, który akceptujesz?+
5 GB na przesył, co to jest mniej więcej 60 godzin przy 192 kbps lub 90 godzin przy 128 kbps. Jeśli twój plik jest większy, pokażemy przesył podzielony — nie ma potrzeby dzielenia go samemu.
05Jak długo trwa transkrypcja 60-minutowego MP3?+
Typowo 90 sekund od przesłania-kompletnego do transkryptu-gotowego, niezależnie od bitrate. Dekodowanie ramek MP3 jest szybkie; czas jest w rozpoznającym. Separacja dodaje 5-10 sekund na plikach multi-głosu.
06Mój MP3 ma muzykę w tle — czy transkrypt będzie zrujnowany?+
Cicha muzyka pod mowę jest w porządku. Głośna muzyka, która rywalizuje z głosem (intro stingi, scoring pod wywiady) czasami wyzwala błędne rozpoznania na nakładających się złogach. Przełącznik tłumienie muzyki w formularzu zadania do pre-filtru.
07Czy możesz obsługować MP3 rip z telefonu sekretarki lub automatyków?+
Tak, chociaż są to często 8 kHz wąsko-pasmowe re-kodowane jako MP3 — sufit jakości audio jest ustawiony przez oryginalne przechwytywanie PSTN, a nie przez opakowanie MP3. Oczekuj 78-85% dokładności na tego rodzaju źródło, co jest tym samym, co byśmy otrzymali na bazowej rozmowie.
08Czy trzymacie mój MP3 po skończeniu transkryptu?+
Pliki są usuwane po 30 dniach domyślnie, lub natychmiast na żądanie przez kokpit. Transkrypt pozostaje w twoim koncie aż go usuniesz. Nie używamy audio klientów do trenowania żadnego modelu — nigdy.

Prześlij swój MP3. Uzyskaj tekst z powrotem w 90 sekund.

30 bezpłatnych minut każdego miesiąca. Bez karty wymagane. Etykiety mówców, 99 języków, każdy format eksportu dołączony.

Zacznij bezpłatnie