WAV-Dateien mit Sprecherlabeln transkribieren.Verlustfreie Qualität.

Legen Sie eine WAV-Aufnahme direkt von Ihrer Feldausrüstung, DAW-Bounce oder Interviewausrüstung ab. Wir bewahren den 24-Bit-Kopfraum, führen Diarisierung auf dem Raw-PCM durch und geben innerhalb von Minuten ein zeitgestempeltes Transkript mit SRT zurück.

Audio oder Video ablegen

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Direkt aus Ihrem Browser aufnehmen

Die Registrierung dauert 30 Sekunden – die Aufnahme öffnet sich danach direkt im Dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTDateien werden automatisch nach 24h gelöscht

↓ Sehen Sie, was herauskommt

Raw-PCM rein. Sauberes Transkript raus.

Verlustfreie WAV bedeutet, dass jede Sibilanz, jeder Plosiv und jedes leise Wort intakt überdauert — kein MP3-Verschmieren bei Konsonanten. Wenn die Datei Multi-Track ist (ein Sprecher pro Kanal), überspringen wir die akustische Diarisierung und teilen stattdessen nach Kanal-Layout.

WAV · 48 kHz / 24-BitREC 2 Tracks · 1h 12m · 743 MB
automatisch erkannt en-GBStereo-PCM · unkomprimiert
~90s
Transkript · Streaming97% Genauigkeit
S1

Bring mich zurück zu dem Morgen 1978 — wie spät kam der Anruf?

S2

Viertel vor fünf, ungefähr. Der Wasserkocher war an, daran erinnere ich mich noch.

S1

Und von dort bist du direkt in den Hafen gefahren?

S2

Direkt zum Bootshof. Die Lichter waren noch an, als ich einfuhr.

97% bei Spur-bezogener WAVSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Drei echte Optionen · ehrlicher Vergleich

Adobe Audition. Descript. Oder wir.

Auditions Speech to Text ist in Creative Cloud enthalten und bleibt in der Timeline. Descript importiert Ihre WAV in seinen Editor. Wir nehmen die Datei, wie sie ist, geben Standard-Exporte zurück und bitten Sie nicht, Ihr Projekt woanders hin zu verschieben.

Option 01

Adobe Audition / Premiere

Transkript-Panel in der Adobe-Timeline. An Creative Cloud und die Projektdatei gebunden.

ErforderlichCreative Cloud-Abonnement
Sprecher-DiarisierungJa, nur Mix-Down
Multi-Track WAVVor STT zu Mono abgemischt
ExportSRT · CSV · XML
Sprachen18, manuelle Auswahl
Kosten~23 €/Monat (einzelne App)
Best forEditoren, die bereits in Premiere oder Audition schneiden und Untertitel an der Timeline befestigen möchten.
Option 02

Transcription.Solutions

WAV ablegen. Spur-weise Diarisierung bei Multi-Track. Quelle innerhalb von 24h gelöscht.

ErforderlichNichts — nur die Datei
Sprecher-DiarisierungPro Spur oder akustisch
Multi-Track WAVBis zu 16 Kanäle
ExportSRT · VTT · DOCX · TXT · JSON
Sprachen99, automatisch erkannt
Kosten · pro Minute$0,03
Best forJeder mit Raw-WAV — Feldaufzeichner, Podcaster mit DAW-Bounce, Oral-History-Archivisten, Forscher.
Option 03

Descript

Importiert Ihre WAV in Descripts Editor. Leistungsstark, aber Sie arbeiten darin.

ErforderlichDescript-Konto + Import
Sprecher-DiarisierungAkustisch, EN-optimiert
Multi-Track WAVAls separate Clips importieren
ExportTXT · SRT · DOCX
Sprachen23, Genauigkeit variiert
Kosten€16–24/Benutzer/Monat
Best forPodcast-Editoren, die Audio bearbeiten, indem sie das Transkript bearbeiten — Descripts eigentliche Stärke.

Preise aktuell 2026. Adobe und Descript Features ändern sich häufig; aktuelle Dokumentation vor dem Commitment prüfen.

Spezifisch für WAV

Drei Probleme mit generischen Transkriptionswerkzeugen.

Die meisten Uploader downsampling Ihre WAV stillschweigend, bevor sie sie zum Erkennungsmodell senden. Wir nicht.

Was schiefgeht

  1. 1Multi-Track WAV wird abgemischt. Eine 4-Kanal-Feldaufnahme von einem Sound Devices MixPre wird vor STT zu Mono abgemischt. Die Pro-Mikrofon-Trennung, wofür Sie bezahlt haben, wird verworfen.
  2. 232-Bit-Float-WAVs von Zoom F-Serie oder MixPre werden vollständig abgelehnt oder auf 16-Bit reduziert und verlieren ihre Kopfraum-Wiederherstellung.
  3. 396 kHz / 24-Bit Interviews dauern ewig zum Hochladen, weil das Tool im Browser vor dem Senden zu MP3 neu kodiert.

Was man hier umschalten kann

  1. 1Laden Sie die Multi-Track-WAV unverändert hoch (bis zu 16 Kanäle). Wir lesen das Kanal-Layout aus dem WAV-Header und weisen einen Sprecher pro Spur zu — keine akustischen Vermutungen.
  2. 232-Bit-Float wird nativ akzeptiert. Wir bewahren den Float-Kopfraum, wenn wir für das Erkennungsmodell normalisieren, sodass Peaks über 0 dBFS nicht abgeschnitten werden.
  3. 3Direkter Binär-Upload, kein Transcode im Browser. Eine 2-GB-WAV bewegt sich mit voller Bandbreite und startet die Verarbeitung, sobald das letzte Byte ankommt.

Empfohlene Job-Einstellungen für WAV

Legen Sie eine WAV ab und diese sind standardmäßig aktiviert. Pro Job im Formular überschreiben.

Abtastrate
Nativ (kein Downsampling)
Bittiefe
24-Bit / 32-Float bewahrt
Diarisierung
Pro Kanal, falls Multi-Track
Sprecher-Modell
Interview · 2–8 Sprecher
Füllwörter
Beibehalten (umschalten wenn nötig)
Export
DOCX · SRT · zeitgestempeltes TXT

Accuracy · real-world numbers

97%+ bei Spur-weiser WAV. WAV gibt dem Erkennungsmodell die sauberste mögliche Signalquelle.

Da WAV Raw-PCM ohne Wahrnehmungskomprimierung speichert, werden Konsonanten und Sibilanten nicht auf die Weise verschwommen, wie MP3 sie verschmiert. Das Modell hört, was das Mikrofon gehört hat. Zahlen unten stammen aus realen Kunden-WAV-Jobs in der Produktion.

98%
Studio WAV · Einzelsprechend

48 kHz / 24-Bit, großflächiger Kondensator, behandelter Raum. Erzählungen, Audiobooks, Voice-Over-Aufträge landen hier.

96%
Multi-Track Interview WAV

Ein Kanal pro Sprecher (Lavs oder Grenzflächenmikrofone). Diarisierung ist nur Channel-Routing — nur Text-Fehler.

92%
Tragbarer Feldrecorder

Zoom H5, Tascam DR-40, ähnlich. Stereo-XY-Abnahme, 2–3 Sprecher, etwas Raumreflektion. Die meisten Podcast-WAVs landen hier.

85%
Laute Umgebung Feld-WAV

Draußen, Café, Auto. Verlustfreie Aufzeichnung hilft — der Lärm ist echt, kein Codec-Artefakt — aber die Genauigkeit sinkt bei überlappender Sprache.

Häufig gestellte Fragen

8 häufig gestellte Fragen über WAV-Transkription.

01Welche maximale WAV-Dateigröße gibt es?+
5 GB pro Datei im Standard-Plan; das ist ungefähr 8 Stunden Stereo 48 kHz / 24-Bit oder 2,5 Stunden 96 kHz / 24-Bit. Größere Dateien geht im Team-Plan — kontaktieren Sie uns vor dem Upload.
02Unterstützen Sie 32-Bit-Float-WAV von Zoom F-Serie oder MixPre?+
Ja, nativ. Wir lesen die Float-Samples ohne Abschneiden bei 0 dBFS, sodass laute Transienten, die Sie in der Post-Produktion reduzieren wollten, immer noch sauber transkribiert werden. Die meisten generischen Uploader casten stillschweigend zuerst auf 16-Bit ab.
03Ich habe eine 4-Kanal-WAV von einem Feldrecorder — ein Mikrofon pro Person. Wird Diarisierung das nutzen?+
Ja. Laden Sie die polyphonische WAV unverändert hoch (nicht zuerst zu Stereo abmischen). Wir parsen das Kanal-Layout aus dem WAV-Header und weisen einen Sprecher pro Spur zu — viel zuverlässiger als akustische Diarisierung bei ähnlichen Stimmen.
04Wirst du meine 96 kHz WAV downsampling?+
Das Erkennungsmodell läuft intern bei 16 kHz — das ist die Obergrenze der menschlichen Sprachverständlichkeit. Aber wir halten Ihre Originaldatei unverändert und nutzen sie für weitere Verarbeitung wie Noise-Gating. Ihre Exporte beziehen sich auf die ursprüngliche Zeitlinie.
05Ist WAV tatsächlich genauer als MP3 für Transkription?+
Marginal ja — normalerweise 1–2 Punkte WER auf sauberer Sprache. Der größere Unterschied zeigt sich bei Sibilanten und leisen Passagen, wo MP3s psychoakustische Komprimierung Informationen verwirft, die das Modell hätte nutzen können. Für Archiv- oder forensische Arbeiten ist WAV der richtige Weg.
06Sind BWF-Metadaten und Zeitcode erhalten?+
Wir lesen BWF-Chunks (bext, iXML) und verwenden den Start-Zeitcode, um das Transkript an Ihre Session-Zeitlinie auszurichten. Die ursprüngliche WAV wird nie geändert — wir arbeiten an einer Kopie, die innerhalb von 24h gelöscht wird.
07Kann ich einen Ordner mit WAV-Dateien aus einem DAW-Session-Export ablegen?+
Ja. Batch-Upload akzeptiert bis zu 50 Dateien gleichzeitig. Jede WAV bekommt ihren eigenen Job und Transkript. Wenn sie Stems aus einer Session sind, können Sie sie auch vor dem Upload zu einer einzigen Multi-Track-WAV zusammenführen und wir diarisieren pro Kanal.
08Wie lange dauert eine 1-Stunden-Stereo-WAV wirklich?+
Upload ist der langsamste Teil — eine 1-Stunden-48-kHz-/24-Bit-Stereo-WAV ist etwa 600 MB und dauert 2–5 Minuten auf typischem Breitband. Nach dem Upload läuft die Transkription selbst in etwa 4–6 Minuten in der Standard-Warteschlange.

Legen Sie Ihre WAV ab. Halten Sie die verlustfreie Qualität. Sehen Sie, was rauskommt.

30 kostenlose Minuten jeden Monat. Keine Karte erforderlich. Spur-weise Diarisierung, 32-Bit-Float unterstützt, Quellaufnahme innerhalb von 24h gelöscht.

Kostenlos starten