ffmpeg + Whisper
Bezpłatne, lokalne, wymagające majstrowania. Ty posiadasz potok i każdy błąd w nim.
Upuść plik MP4 bez zmian — wyodrębniamy ścieżkę dźwiękową po stronie serwera, zwracamy transkrypt ze znacznikami czasu i wysyłamy SRT, które natychmiast wraca do YouTube, Vimeo lub twojego NLE.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Obejrzyj, co z tego wynika
MP4 to kontener — czytamy strumień dźwięku bezpośrednio, nigdy nie kodujemy ponownie wideo. Znaczniki czasu pozostają dokładne do klatki na osi czasu, więc SRT wyrównuje się przy pierwszym importzie.
Ok, w tym module przeszukujemy przepływ zwrotu od początku do końca.
Szybkie pytanie zanim zaczniemy — czy to dotyczy również zwrotów częściowych?
Dobra obserwacja. Zwroty częściowe używają tego samego ekranu, ale innego kodu przyczyny.
Rozumiem. A próg zatwierdzenia to nadal dwieście dolarów?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Trzy rzeczywiste opcje · uczciwe porównanie
Możesz sam wyodrębniać dźwięk i uruchomić Whisper. Możesz przeciągnąć MP4 do Descript lub VEED i pracować w ich edytorze. Albo upuść plik tutaj i otrzymaj transkrypt + SRT, bez blokady edytora.
Bezpłatne, lokalne, wymagające majstrowania. Ty posiadasz potok i każdy błąd w nim.
Upuść MP4. Ekstrakcja dźwięku, diaryzacja, SRT, podsumowanie — jedno przejście.
Załaduj MP4 do edytora. Transkrypt pojawia się jako część interfejsu osi czasu.
Ceny i limity funkcji są przybliżone na rok 2026. Nazwy planów Descript i VEED zmieniają się często — sprawdź ich stronę dla aktualnych limitów.
Specyficzny dla MP4
MP4 to kontener, nie kodek — i większość narzędzi transkrypcji traktuje go jak jeden duży plik dźwięku. Stąd pochodzą błędy.
Upuść MP4 i te opcje włączą się domyślnie. Zmień ustawienia na zadanie w formularzu.
Accuracy · real-world numbers
Dokładność MP4 zależy od mikrofonu, a nie kodeka. Mikrofon lavalier na cichym planie zawsze jest lepszy niż kamera 4K z wbudowanym dźwiękiem. Liczby poniżej pochodzą z rzeczywistych MP4 klientów, posortowane według tego, co rejestrowało dźwięk.
Mikrofon lavalier lub boom do rejestratora, 48 kHz AAC na 192+ kbps, pomieszczenie akustycznie przygotowane. Najlepszy przypadek. Etykiety mówcy działają doskonale przy nagraniu z dwiema osobami.
Mikrofon na górze kamery 2-4 stopy od mówcy. Trochę hałasu pomieszczenia, ale mowa jest zrozumiała. Większość materiałów twórców YouTube trafia tutaj.
Eksporty OBS, Loom, Camtasia. Mikrofon jest blisko, ale pomieszczenie jest niepreparowane, często z przeciekami dźwięku systemowego. Doskonale do transkrypcji samouczków.
Wbudowany mikrofon telefonu, hałas wiatru lub obsługi, odległość zmienia się od kadr do kadru. Słowa są użyteczne, spodziewaj się 1-2 poprawek na minutę w nazwach własnych.
Częste pytania
30 bezpłatnych minut każdego miesiąca. Bez karty. Dźwięk wyodrębniany po stronie serwera, etykiety mówcy, dokładne SRT — wszystko wliczone.
Zacznij bezpłatnie