Whisper lokalny / open source
Bezpłatnie, jeśli masz GPU i popołudnie. Bez separacji mówców z pudełka.
Prześlij plik MP3 o dowolnym bitratcie od 64 do 320 kbps. Uzyskaj transkrypt z czasomierzem i etykietami mówców w 99 językach — bez konwersji formatu, bez ponownego kodowania, bez czekania w kolejce.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Sprawdź co otrzymasz
Czytamy nagłówki ramek MP3 bezpośrednio — VBR, CBR, joint-stereo, jakiś koder (LAME, Fraunhofer, FFmpeg). Jeśli plik jest prawdziwym stereofonikiem z głosami na osobnych kanałach, używamy tego do podziału głosów. Mieszanina mono powraca do separacji akustycznej.
Kiedy się okazało, że archiwum jest niekompletne?
Prawdopodobnie wokół 2019, kiedy zaczęliśmy cyfryzować taśmy szpulowe.
A brakujące taśmy — były gdzieś katalogowane?
Jest papierowy indeks z 78, ale połowa jest uszkodzona wodą.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Trzy prawdziwe opcje · szczera porównanie
Możesz uruchomić Whisper na swoim laptopie za darmo, jeśli jesteś techniczny. Otter i Sonix akceptują przesyłanie MP3 w kokpitach subskrypcji. Bierzemy plik, zwracamy transkrypt i nie zmuszamy cię do życia w interfejsie użytkownika.
Bezpłatnie, jeśli masz GPU i popołudnie. Bez separacji mówców z pudełka.
Prześlij MP3. Uzyskaj tekst z etykietami mówców prawie w czasie rzeczywistym × 0.025.
Polerowany kokpit, limit minut na miesiąc, anglojęzyczny. Przesyłanie pliku wygląda jak funkcja uboczna.
Ceny i dostępność funkcji dokładne na maj 2026. Wydajność Whispera zależy od rozmiaru modelu i sprzętu.
Specyficzne dla MP3
MP3 to format, a nie styl nagrania — co oznacza, że rodzaje awarii pochodzą z kodera, a nie z mowy.
Domyślne ustawienia pasujące do ~80% plików MP3. Przesłoń na zadanie z formularza.
Accuracy · real-world numbers
Dokładność MP3 jest ograniczona tym, co koder zachował, a nie przez nas. Kompresja percepcyjna powyżej ~96 kbps bardzo dobrze zachowuje zrozumiałość mowy; poniżej 64 kbps, sybillanty i spółgłoski zaczynają się rozpuszczać. Liczby poniżej pochodzą z prawdziwych MP3 klientów w produkcji.
Prawie bez strat dla mowy. Mastery podcastów, eksporty aplikacji dyktafonowej, profesjonalne urządzenia do nagrywania rozmów. Separacja czista, jeśli mówcy na osobnych kanałach.
Najczęstszy bitrate dla MP3 gatunku mówionego. Eksporty Zoom, pobieranie Riverside, domyślne ustawienia rejestratora głosu. Artefakty kompresji nie słyszalne dla rozpoznającego.
Domyślna notatka głosowa na większości telefonów. Separacja akustyczna obsługuje 2-4 mówców. Liczby i nazwy własne czasami potrzebują spojrzenia.
Rip starych sekretarek, archiwa wykładów, źródła o wąskim paśmie. Spółgłoski wysoko-częstotliwościowe (f/s/sh) się rozmywają. Wciąż czytelne — zaplanuj korektę.
Popularne pytania
30 bezpłatnych minut każdego miesiąca. Bez karty wymagane. Etykiety mówców, 99 języków, każdy format eksportu dołączony.
Zacznij bezpłatnie