Whisper lokal / Open Source
Kostenlos, wenn Sie eine GPU und einen Nachmittag Zeit haben. Keine Sprechererkennung ab Werk.
Laden Sie eine MP3-Datei mit beliebiger Bitrate von 64 bis 320 kbps hoch. Erhalten Sie ein zeitgestempeltes, mit Sprechern gekennzeichnetes Transkript in 99 Sprachen — keine Formatkonvertierung, keine Neukodierung, kein Warten in einer Warteschlange.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Sehen Sie, was herauskommt
Wir lesen die MP3-Frame-Header direkt — VBR, CBR, Joint-Stereo, beliebiger Encoder (LAME, Fraunhofer, FFmpeg). Wenn die Datei echtes Stereo mit Sprechern auf separaten Kanälen ist, nutzen wir das, um Stimmen zu trennen. Mono-Abmischung zieht sich auf akustische Sprechererkennung zurück.
Also, wann hast du realisiert, dass das Archiv unvollständig ist?
Wahrscheinlich um 2019, als wir anfingen, die Spulen zu digitalisieren.
Und die fehlenden Bänder — waren sie irgendwo katalogisiert?
Es gibt einen Papierkatalog aus 1978, aber die Hälfte davon ist wasserbeschädigt.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Drei echte Optionen · ehrlicher Vergleich
Sie können Whisper kostenlos auf Ihrem eigenen Laptop ausführen, wenn Sie technisch versiert sind. Otter und Sonix akzeptieren MP3-Uploads in Abonnement-Dashboards. Wir nehmen die Datei, geben Ihnen das Transkript zurück und zwingen Sie nicht, in einer Benutzeroberfläche zu leben.
Kostenlos, wenn Sie eine GPU und einen Nachmittag Zeit haben. Keine Sprechererkennung ab Werk.
Werfen Sie die MP3 hin. Erhalten Sie gekennzeichneten Text in etwa Echtzeit × 0,025 zurück.
Poliertes Dashboard, monatliches Minuten-Limit, auf Englisch optimiert. Datei-Upload wirkt wie eine Nebenfunktion.
Preisgestaltung und Funktionsverfügbarkeit aktuell ab Mai 2026. Whisper-Leistung variiert je nach Modellgröße und Hardware.
Spezifisch für MP3
MP3 ist ein Format, kein Aufnahmestil — was bedeutet, dass die Fehlermodi vom Encoder stammen, nicht von der Sprache.
Standardwerte, die zu ~80% der MP3-Dateien passen. Überschreiben Sie pro Job aus dem Formular.
Accuracy · real-world numbers
Die MP3-Genauigkeit ist durch das, was der Encoder behalten hat, nicht durch uns begrenzt. Wahrnehmungskompression über ~96 kbps bewahrt Sprachintelligibilität sehr gut; unter 64 kbps beginnen Zischlaute und Konsonanten zu verschwinden. Die Zahlen unten stammen aus echten MP3-Dateien von Kunden in der Produktion.
Nahezu verlustfrei für Sprache. Podcast-Master, Diktat-App-Exporte, professionelle Interview-Rigs. Sprechererkennung ist sauber, wenn Sprecher auf separaten Kanälen sind.
Häufigste Bitrate für gesprochene MP3s. Zoom-Exporte, Riverside-Downloads, Standard der Sprachrekorder. Kompressionsartefakte sind für den Recognizer unmerklich.
Standard-Sprachmemo bei den meisten Telefonen. Akustische Sprechererkennung bewältigt 2–4 Sprecher. Zahlen und Eigennamen benötigen gelegentlich eine Überprüfung.
Alte Anrufbeantworter-Rips, Vorlesungsarchive, Schmalband-Quellen. Hochfrequente Konsonanten (f/s/sch) verschwimmen. Noch lesbar — planen Sie eine Korrektur ein.
Häufige Fragen
30 kostenlose Minuten jeden Monat. Keine Karteneingabe erforderlich. Sprecherkennzeichnung, 99 Sprachen, alle Export-Formate enthalten.
Kostenlos starten