Lange Audiodateien transkribieren.Bis zu 10 Stunden. Ohne Timeout.

Laden Sie eine lange Audiodatei hoch — bis zu 10 Stunden, 5 GB auf Business. Wir chunken parallel, halten Sprecher-IDs durchgehend konsistent und geben Ihnen ein Transkript statt eines nummerieren Ordners.

Audio oder Video ablegen

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Direkt aus Ihrem Browser aufnehmen

Die Registrierung dauert 30 Sekunden – die Aufnahme öffnet sich danach direkt im Dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTDateien werden automatisch nach 24h gelöscht

↓ Eine 5-Stunden-Datei, mitten in der Transkription

Stunden rein. Eine saubere Datei raus.

Die meisten Tools zeitlimitieren um die 90-Minuten-Marke oder teilen Ihre lange Aufnahme in nummerierte Teile auf, die Sie selbst zusammenfügen müssen. Wir verwenden 12-Minuten-Fenster mit Überlappung, verarbeiten parallel und fügen mit einem globalen Sprecherdurchlauf wieder zusammen.

Strategiesitzung des VorstandsREC 3 Sprecher · 5:14:22 · 3,1 GB
automatisch erkannt: en-GB44,1 kHz Stereo · 192 kbps
~90s
Transkript · einzelne Datei92% Genauigkeit · t=3:14:08
S1

Wir sind drei Stunden drin — lassen Sie uns zum Lieferkettenthema aus der Morgensitzung zurückkehren.

S2

Richtig, der Umschwung der Fertigung in Vietnam. Ich denke, wir haben das Vorlaufzeit-Risiko übersehen.

S1

Die Vorlaufzeiten sind nach der Zolländerung von 14 auf 31 Tage angewachsen.

S3

Und das ist, bevor wir die Staukrise in Long Beach einrechnen.

92% über die gesamte 5-Stunden-DateiDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Drei echte Optionen · ehrlicher Vergleich

Otter Pro. DIY Whisper Chunking. Oder uns.

Consumer-Tools begrenzen die Dateilänge und kürzen stillschweigend ab. Die Whisper API hat eine 25 MB pro Request-Obergrenze, daher müssen Sie den Chunker selbst erstellen. Wir akzeptieren die gesamte 10-Stunden-Datei und geben ein Transkript zurück.

Option 01

Otter Pro

Begrenzt lange Dateien auf 4 Stunden pro Aufnahme. Sprecherlabels driften nach der 2-Stunden-Marke ab.

Max. Dateilänge4 Stunden (Pro-Plan)
Max. Dateigröße~1,5 GB Upload
Sprecher-IDs durchgehendDriften nach 2 Stunden ab
Long-File-OutputEinzelnes Dokument, bei Limit gekürzt
Kosten$16,99/Benutzer/Monat
Wiederaufnahme-UploadNein
Best forKurze Meetings unter 2 Stunden. Scheitert bei ganztägigen Aufnahmen.
Option 02

Transcription.Solutions

10 Stunden pro Datei. Paralleles Chunking, globaler Sprecherdurchlauf, ein DOCX raus.

Max. Dateilänge10 Stunden (Pro & Business)
Max. Dateigröße2 GB Pro · 5 GB Business
Sprecher-IDs durchgehendGlobaler Embedding-Durchlauf
Long-File-OutputEinzelne Datei · DOCX/SRT/TXT
Kosten · pro Min.$0,03 pauschal, egal wie lang
Wiederaufnahme-UploadMultipart, übersteht Verbindungsabbrüche
Best forGanztägige Workshops, Zeugenaussagen, Vorstandssitzungen, Oral Histories — alles über der 90-Minuten-Grenze.
Option 03

Whisper API + DIY Chunking

Günstigster Preis pro Minute. Sie bauen den Chunker, die Sprecher-Zusammenfügung und die Retry-Logik.

Max. Dateilänge25 MB pro Request (~25 Min.)
Max. Dateigröße25 MB Obergrenze
Sprecher-IDs durchgehendKeine — kein Diarisierung
Long-File-OutputNummerierte Teile, Sie fügen zusammen
Kosten · pro Min.$0,006 (OpenAI Whisper)
Engineering-ZeitStunden bis Tage pro Pipeline
Best forIngenieure, die Rohtexte pro Chunk wollen und keine Sprecher, Zusammenfassungen oder Single-Output benötigen.

Preise und Limits korrekt ab Mai 2026. Otter Pro Längenbegrenzung zuletzt überprüft auf ihrer öffentlichen Preisseite.

Spezifisch für lange Dateien

Drei Wege, wie generische Tools nach der 90-Minuten-Marke scheitern.

Die meisten Pipelines wurden für einstündige Meetings gebaut. Lange Audio bricht sie auf vorhersehbar Weise kaputt — hier ist, was wir anders machen.

Was schiefgeht

  1. 1Stilles Timeout bei 90 Minuten. Der Job läuft eine Stunde lang, dann stirbt ohne brauchbare Fehlermeldung. Sie haben nichts zum Wiederholen.
  2. 2Sprecher-IDs driften zwischen Blöcken. Sprecher 1 in Stunde 1 wird Sprecher 4 in Stunde 3, weil jeder Block isoliert diarisiert wird.
  3. 3Output ist ein nummerierter Ordner. `transcript_part_01.txt` bis `transcript_part_24.txt` mit Zeitstempel-Zurücksetzen bei jeder Block-Grenze. Sie fügen selbst zusammen.

Was hier umkehren

  1. 1Wiederaufnahme-Multipart-Upload. Verbindung bricht um Stunde 2 auf ab? Wird ab dem letzten abgeschlossenen Teil fortgesetzt. Kein Neuupload von 4 GB.
  2. 2Globaler Speaker-Embedding-Durchlauf. Nach per-Block-Diarisierung clustern wir Stimmen über die gesamte Datei, sodass Sprecher 3 dieselbe Person bei Minute 12 und Minute 487 ist.
  3. 3Ein DOCX mit Stundenmarken. Eine Datei, kontinuierliche Zeitstempel, optionaler Kapitelumbruch alle 60 Minuten. Kein Zusammenfügen.

Empfohlene Job-Einstellungen für lange Dateien

Laden Sie alles über 90 Minuten hoch und diese schalten automatisch ein. Überschreiben Sie pro Job im Formular.

Chunking-Strategie
12-Min.-Fenster · 10-Sek.-Überlappung
Diarisierung
Globaler Durchlauf über alle Blöcke
Sprecher-Modell
Langform · 2–20 Sprecher
Upload
Wiederaufnahme-Multipart
Warteschlange
Priorität (Business-Plan)
Export
Einzelnes DOCX · Stundenmarken an

Accuracy · real-world numbers

92% bleibt über eine 5-Stunden-Datei konstant. Qualität bleibt Stunde für Stunde stabil.

Das Schwierige bei langen Audiodateien ist nicht das Modell — es ist, die Genauigkeit von Minute 1 bis Minute 600 stabil zu halten. Sprecherdrift und Chunk-Grenzfehler sind das, was die meisten Pipelines zerstört. Die untenstehenden Zahlen werden über vollständige Kundendateien gemessen, nicht über die ersten 10 Minuten.

95%
Studio Langform, einzelner Sprecher

Audiobook-Erzählung, Solo-Podcast, diktiertes Manuskript. 6–10 Stunden saubere Stimme ohne Rauschen. Keine Diarisierung nötig.

92%
Konferenztisch, 2–6 Sprecher

Konferenztisch, anständiges Mikrofon, 3–5 Stunden. Globaler Sprecherdurchlauf hält IDs über die ganze Datei stabil.

88%
Ganztägiger Workshop, Lavalier-Mikrofone

7–9-Stunden-Trainingstag mit Mikrofonübergaben und Publikumsfragen. Namen benötigen einen 5-Minuten-Durchlauf der Sprecher-Chips.

82%
Feldgespräch, 8+ Sprecher

Lange oral history, Fokusgruppe oder Panel mit überlappenden Stimmen und Umgebungsgeräuschen. Nutzbar, aber erwarten Sie Nachbearbeitung.

Häufig gestellte Fragen

8 Dinge, die Menschen über lange Audio-Transkription fragen.

01Wie lang und groß können die Dateien wirklich sein?+
10 Stunden pro Datei auf Pro und Business. Pro begrenzt die Dateigröße auf 2 GB, Business auf 5 GB. Wenn Sie etwas länger als 10 Stunden haben, teilen Sie es einmal bei einer natürlichen Pause — wir halten die Sprecher-IDs konsistent, wenn Sie sie nacheinander in dasselbe Projekt hochladen.
02Bekomme ich ein Transkript oder einen Ordner mit nummerierten Teilen?+
Eine Datei. Immer. DOCX, SRT, TXT oder JSON — Ihre Wahl. Zeitstempel laufen kontinuierlich von 00:00:00 bis zum Ende der Aufnahme, nicht zurückgesetzt bei jeder Block-Grenze.
03Wie lange dauert eine 6-Stunden-Datei?+
Etwa 18–25 Minuten in der Pro-Warteschlange, 8–12 auf Business-Priorität. Wir verarbeiten die 12-Minuten-Blöcke parallel, daher skaliert die Verarbeitungszeit sublinear mit der Dateilänge, nicht Minute für Minute.
04Bleiben die Sprecher-IDs durchgehend konsistent?+
Ja. Nach per-Block-Diarisierung clustert ein globaler Embedding-Durchlauf Stimmen über die ganze Datei. Sprecher 3 bei Minute 12 ist derselbe Sprecher 3 bei Minute 487. Das ist das Hauptproblem, das DIY-Whisper-Pipelines falsch machen.
05What happens wenn mein Upload in Stunde 3 einer 4 GB-Datei abbricht?+
Wiederaufnahme-Multipart-Upload setzt vom letzten abgeschlossenen Teil fort. Sie laden die ersten 3 GB nicht erneut hoch. Funktioniert auf flächigem Hotel-Wi-Fi und Mobilfunk-Tethering — wir haben beide getestet.
06Warum scheitert die Whisper API bei langen Dateien?+
Der Whisper-Endpoint von OpenAI hat ein 25 MB pro Request Limit — etwa 25 Minuten komprimiertes Audio. Alles längere braucht Sie zum Chunken, parallel zu transkribieren und dann Transkripte zusammenzufügen und Sprecher selbst abzugleichen. Das machen wir server-seitig.
07Ist der Minutenpreis gleich bei einer 10-Stunden- wie bei einer 10-Minuten-Datei?+
Ja. $0,03 pro Minute pauschal, egal wie lang. Eine 10-Stunden-Datei kostet $18. Wir berechnen keine Zusatzgebühr für lange Dateien wie Rev ($1,50/min menschlich × 10 Stunden = $900).
08Kann ich Kapitelmarken oder Zeitstempel jede Stunde bekommen?+
Aktivieren Sie 'Stundenmarken' im Job-Formular und das DOCX exportiert mit Überschriftumbruch alle 60 Minuten. SRT behält kontinuierliche Zeitcodes. JSON hat beides — Kapitel-Array plus wortebenenweise Zeitstempel.

Laden Sie Ihre lange Datei hoch. Erhalten Sie ein Transkript zurück.

30 kostenlose Minuten jeden Monat. Keine Kartenzahlung. Dateien bis zu 10 Stunden, Sprecherlabels, die konsistent bleiben, Einzeldatei-Export.

Kostenlos starten