ffmpeg + Whisper
Kostenlos, lokal, fummelig. Sie besitzen die Pipeline und jeden Bug darin.
Laden Sie die MP4-Datei hoch — wir extrahieren den Audio-Track serverseitig, liefern ein zeitgestempeltes Transkript zurück und eine SRT, die direkt in YouTube, Vimeo oder Ihren Editor passt.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Das Ergebnis
MP4 ist ein Container — wir lesen den Audio-Stream direkt, ohne das Video neu zu codieren. Die Zeitstempel entsprechen exakt Ihrem Original, die SRT passt beim ersten Import perfekt.
Alright, in this module we're walking through the refund workflow end-to-end.
Quick question before we start — does this apply to partial refunds too?
Good catch. Partials use the same screen but a different reason code.
Got it. And the approval threshold is still two hundred dollars?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Drei echte Optionen · ehrlich verglichen
Sie können das Audio selbst extrahieren und Whisper laufen lassen. Sie können die MP4 in Descript oder VEED ziehen und dort arbeiten. Oder Sie laden die Datei hier hoch, bekommen Transkript + SRT zurück, keine Editor-Lock-in.
Kostenlos, lokal, fummelig. Sie besitzen die Pipeline und jeden Bug darin.
MP4 hochladen. Audio-Extraktion, Diarization, SRT, Zusammenfassung — ein Durchgang.
MP4 in den Editor laden. Transkript erscheint als Teil der Zeitleisten-UI.
Preisgestaltung und Feature-Limits ungefähr Stand 2026. Descript und VEED ändern häufig Tiernamen — prüfen Sie ihre Website für aktuelle Limits.
Spezifisch für MP4
MP4 ist ein Container, nicht ein Codec — und die meisten Transkriptionstools behandeln es wie einen großen Audio-Blob. Dort kommen die Misses her.
Laden Sie eine MP4 hoch und diese Schalter sind standardmäßig an. Überschreiben Sie pro Job über das Formular.
Accuracy · real-world numbers
MP4-Genauigkeit wird durch das Mikrofon festgelegt, nicht durch den Codec. Ein Lavaliermikrofon auf einem ruhigen Set schlägt eine 4K-Kamera mit On-Board-Audio immer. Die Zahlen unten stammen von echten Kunden-MP4s, sortiert danach, welches Audio aufgenommen wurde.
Ansteckmikrofon oder Boom in einen Recorder, 48 kHz AAC bei 192+ kbps, behandelter Raum. Der Idealfall. Sprecherkennzeichnung nail es bei einem Zweipersonendreh.
Kamera-top Mikrofon 2-4 Fuß vom Sprecher entfernt. Etwas Raumton, aber Sprache ist verständlich. Die meisten YouTube-Creator-Videos landen hier.
OBS, Loom, Camtasia-Exports. Mikrofon ist nah, aber der Raum ist unbehandelt, oft mit Systemton-Übersprechen. Mehr als genug für Tutorial-Transkripte.
Internes Smartphone-Mikrofon, Wind oder Handgriffe, Entfernung variiert Shot zu Shot. Wörter sind nutzbar, rechnen Sie 1-2 Fixes pro Minute bei Eigennamen.
Häufig gestellte Fragen
30 kostenlose Minuten jeden Monat. Keine Kartenbindung. Audio serverseitig extrahiert, Sprecherkennzeichnung, frame-genaue SRT — alles inklusive.
Kostenlos starten