Transkrybuj film MP4 na tekst.Dźwięk wyodrębniany automatycznie.

Upuść plik MP4 bez zmian — wyodrębniamy ścieżkę dźwiękową po stronie serwera, zwracamy transkrypt ze znacznikami czasu i wysyłamy SRT, które natychmiast wraca do YouTube, Vimeo lub twojego NLE.

Wrzuć audio lub wideo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Nagrywaj prosto z przeglądarki

Rejestracja zajmuje 30 sekund — nagrywanie otwiera się od razu po niej, w panelu.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTPliki znikają automatycznie po 24 h

↓ Obejrzyj, co z tego wynika

MP4 na wejściu. Transkrypt + SRT na wyjściu.

MP4 to kontener — czytamy strumień dźwięku bezpośrednio, nigdy nie kodujemy ponownie wideo. Znaczniki czasu pozostają dokładne do klatki na osi czasu, więc SRT wyrównuje się przy pierwszym importzie.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
auto-detected en-USAAC 48 kHz stereo · 192 kbps
~90s
Transkrypt · przesyłanieDokładność 95%
S1

Ok, w tym module przeszukujemy przepływ zwrotu od początku do końca.

S2

Szybkie pytanie zanim zaczniemy — czy to dotyczy również zwrotów częściowych?

S1

Dobra obserwacja. Zwroty częściowe używają tego samego ekranu, ale innego kodu przyczyny.

S2

Rozumiem. A próg zatwierdzenia to nadal dwieście dolarów?

95% przy czystym dialoguSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trzy rzeczywiste opcje · uczciwe porównanie

DIY z ffmpeg. Edytor wideo. Lub my.

Możesz sam wyodrębniać dźwięk i uruchomić Whisper. Możesz przeciągnąć MP4 do Descript lub VEED i pracować w ich edytorze. Albo upuść plik tutaj i otrzymaj transkrypt + SRT, bez blokady edytora.

Option 01

ffmpeg + Whisper

Bezpłatne, lokalne, wymagające majstrowania. Ty posiadasz potok i każdy błąd w nim.

WymagaCLI + model 10 GB + GPU
Diaryzacja mówcyOddzielne narzędzie (pyannote)
Wyjście SRTTak, flaga ręczna
Czas dla MP4 o długości 1 godziny20–90 min na CPU
Dźwięk wielościeżkowyTy wybierasz strumień
Koszt$0 + twój sprzęt
Best forInżynierowie, którzy już uruchamiają Whisper lokalnie i nie mają problemu z dodawaniem diaryzacji.
Option 02

Transcription.Solutions

Upuść MP4. Ekstrakcja dźwięku, diaryzacja, SRT, podsumowanie — jedno przejście.

WymagaPrzeglądarka, tyle
Diaryzacja mówcyWbudowana, każda praca
Wyjście SRTWyrównane do klatki na źródle
Czas dla MP4 o długości 1 godziny~4 min, przesyłane strumieniowo
Dźwięk wielościeżkowyWymieniamy wszystkie strumienie
Koszt · na minutę$0.03
Best forKażdy z MP4, który chce tekst i SRT bez nauki edytora wideo lub CLI.
Option 03

Descript / VEED

Załaduj MP4 do edytora. Transkrypt pojawia się jako część interfejsu osi czasu.

WymagaKonto + krzywa uczenia się edytora
Diaryzacja mówcyTak, dostrojona do EN
Wyjście SRTBramkowane przez plan
Limit przesyłania5 GB (Descript za darmo)
Dźwięk wielościeżkowyTylko pierwsza ścieżka
Koszt$12–24/użytkownik/miesiąc
Best forRedaktorzy, którzy chcą cut wideo i transkrypt w tym samym narzędziu.

Ceny i limity funkcji są przybliżone na rok 2026. Nazwy planów Descript i VEED zmieniają się często — sprawdź ich stronę dla aktualnych limitów.

Specyficzny dla MP4

Trzy rzeczy, które gryzą ludzi w ogólnych narzędziach transkrypcji.

MP4 to kontener, nie kodek — i większość narzędzi transkrypcji traktuje go jak jeden duży plik dźwięku. Stąd pochodzą błędy.

Co pójdzie źle

  1. 1MP4 z wieloma ścieżkami z boom + lavalier. Ogólne narzędzia pobierają ścieżkę 1 i ignorują resztę, więc tracisz czystszy mikrofon. Powszechne w eksportach FCP i Premiere.
  2. 2Muzyka w tle w vlogach i reklamach wyzwala fantomowe słowa. Rozpoznawacz próbuje transkrybować wokal na podłożu muzycznym.
  3. 3Znaczniki czasu SRT dryfują gdy narzędzie koduje ponownie wideo na wejściu. Do minuty 40 napisy są o sekundę opóźnione.

Co zmienić tutaj

  1. 1Prześlij — sondujemy każdy strumień dźwięku i pozwalamy ci wybrać, który transkrybować. Domyślnie strumień o najwyższym wskaźniku transmisji.
  2. 2Włącz Supresję muzyki w formularzu zadania. Bramkujemy rozpoznawacz na VAD mowy, aby odcinki instrumentalne pozostały puste.
  3. 3Nigdy nie kodujemy wideo ponownie. Dźwięk jest wyodrębniany z natywną częstością próbkowania, znaczniki czasu odwołują się do listy edycji kontenera — SRT wyrównuje się z dokładnością do klatki.

Zalecane ustawienia zadania dla MP4

Upuść MP4 i te opcje włączą się domyślnie. Zmień ustawienia na zadanie w formularzu.

Ekstrakcja dźwięku
Natywna częstość próbkowania, bez ponownego kodowania
Wybór ścieżki
Strumień o najwyższym wskaźniku transmisji
Diaryzacja
Akustyczna · 1-6 mówcy
Supresja muzyki
Włączona dla ustawień vlog/reklama
Format SRT
≤42 znaki/linia, maks. 2 linie
Eksport
SRT · VTT · DOCX · TXT ze znacznikami czasu

Accuracy · real-world numbers

95% przy czystym nagraniu. Uczciwe liczby, gdy dźwięk się włączy.

Dokładność MP4 zależy od mikrofonu, a nie kodeka. Mikrofon lavalier na cichym planie zawsze jest lepszy niż kamera 4K z wbudowanym dźwiękiem. Liczby poniżej pochodzą z rzeczywistych MP4 klientów, posortowane według tego, co rejestrowało dźwięk.

96%+
Nagranie studyjne, mikrofon lavalier lub shotgun

Mikrofon lavalier lub boom do rejestratora, 48 kHz AAC na 192+ kbps, pomieszczenie akustycznie przygotowane. Najlepszy przypadek. Etykiety mówcy działają doskonale przy nagraniu z dwiema osobami.

93%
Aparat DSLR z mikrofonem shotgun na kamerze

Mikrofon na górze kamery 2-4 stopy od mówcy. Trochę hałasu pomieszczenia, ale mowa jest zrozumiała. Większość materiałów twórców YouTube trafia tutaj.

89%
Nagranie ekranu z mikrofonem USB

Eksporty OBS, Loom, Camtasia. Mikrofon jest blisko, ale pomieszczenie jest niepreparowane, często z przeciekami dźwięku systemowego. Doskonale do transkrypcji samouczków.

84%
Vlog nagrany telefonem, wbudowany mikrofon

Wbudowany mikrofon telefonu, hałas wiatru lub obsługi, odległość zmienia się od kadr do kadru. Słowa są użyteczne, spodziewaj się 1-2 poprawek na minutę w nazwach własnych.

Częste pytania

8 rzeczy, które ludzie pytają o transkrypcję MP4.

01Czy kodujesz ponownie moje wideo?+
Nie. Tylko czytamy strumień dźwięku z kontenera MP4. Strumień wideo nigdy nie jest dotykany, nigdy nie jest kodowany ponownie i nigdy nie jest przechowywany po zakończeniu zadania — zachowujesz oryginalny plik bez zmian.
02Jakie kodeki wewnątrz MP4 są obsługiwane?+
Standard H.264 + AAC to łatwy przypadek. Obsługujemy również HEVC/H.265, ProRes-in-MP4 i dźwięk w MP3, Opus, ALAC, lub PCM. Jeśli ffmpeg może to sondować, możemy to transkrybować.
03Jaki jest limit rozmiaru pliku?+
10 GB za przesłanie w przeglądarce, 50 GB przez API z wznawianymi fragmentami. Typowy MP4 1080p o długości 1 godziny wynosi 1-3 GB, więc większość plików mieści się w ścieżce webowej bez myślenia o tym.
04Czy SRT wyrovn się z moim oryginalnym wideo?+
Tak — znaczniki czasu odwołują się do listy edycji MP4 i natywnej częstości próbkowania. Nie kodujemy ponownie, więc nie ma dryftu. Upuść SRT obok MP4 w dowolnym odtwarzaczu lub NLE, a napisy zsynchronizują się przy pierwszym ładowaniu.
05Czy mogę wypalić napisy do wideo?+
Nie po naszej stronie — wyświetlamy SRT i pozostawiamy wypalenie edytorowi. Jednoliniowy ffmpeg, HandBrake, Premiere, DaVinci, Kapwing wszystkie akceptują SRT, który produkujemy. Nie chcemy być również narzędziem kodowania.
06A co z MOV, MKV, M4V, WebM?+
Wszystkie obsługiwane przez ten sam potok. MOV szczególnie — ta sama rodzina MPEG-4, identyczna ścieżka ekstrakcji. MKV z wieloma ścieżkami dźwięku otrzymuje ten sam interfejs wyboru strumienia co wielościeżkowy MP4.
07Czy mogę wysłać adres URL YouTube lub Vimeo?+
Tak dla YouTube — wklej publiczny adres URL na ekranie przesyłania, a my pobieramy dźwięk bezpośrednio, bez potrzeby pobierania MP4. Vimeo wymaga bezpośredniego pliku lub podpisanego linku pobierania, ponieważ ich odtwarzacz bramkuje strumień.
08A co jeśli nie ma dialogu, tylko muzyka lub materiał archiwalny?+
VAD detektuje ciche i tylko muzyczne sekcje i je pomija, więc nie płacisz za materiał otoczenia. Transkrypt oznacza te zakresy jako `[music]` lub `[no speech]` zamiast wymyślać słowa.

Upuść swój MP4. Otrzymaj transkrypt i SRT z powrotem.

30 bezpłatnych minut każdego miesiąca. Bez karty. Dźwięk wyodrębniany po stronie serwera, etykiety mówcy, dokładne SRT — wszystko wliczone.

Zacznij bezpłatnie