Whisper local / open source
Libre kung mayroon kang GPU at hapon. Walang speaker diarization out of the box.
I-drop ang MP3 file sa kahit anong bitrate mula 64 hanggang 320 kbps. Kumuha ng timestamped, speaker-labeled transcript sa 99 wika — walang format conversion, walang re-encoding, walang paghihintay sa queue.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Tingnan kung ano ang lumalabas
Binabasa namin ang MP3 frame headers nang direkta — VBR, CBR, joint-stereo, anumang encoder (LAME, Fraunhofer, FFmpeg). Kung ang file ay tunay na stereo na may nagsasalita sa hiwalay na channels, ginagamit namin yan para paghiwayin ang mga tinig. Mono mix-down ay umaasa sa acoustic diarization.
Kaya kailan mo unang nalaman na hindi kumpleto ang archive?
Malamang sa paligid ng 2019, noong nagsama kami ng pag-digitise sa reel-to-reels.
At ang mga nawawalang tapes — naka-catalogue ba sila kahit saan man?
May paper index mula '78, pero kalahati ay water-damaged.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tatlong tunay na option · tapat na paghahambing
Maaari mong i-run ang Whisper sa sarili mong laptop nang libre kung technical ka. Tinatanggap ng Otter at Sonix ang MP3 uploads sa loob ng subscription dashboards. Tinatanggap namin ang file, ibabalik namin ang transcript, at hindi ka ginagawang mamuhay sa loob ng UI.
Libre kung mayroon kang GPU at hapon. Walang speaker diarization out of the box.
I-drop ang MP3. Kumuha ng speaker-labeled text pabalik sa humigit-kumulang real-time × 0.025.
Polished dashboard, monthly minutes cap, English-tuned. File upload ay pakiramdam na side feature.
Pricing at feature availability accurate mula Mayo 2026. Whisper performance ay nag-iiba depende sa model size at hardware.
Specific sa MP3
MP3 ay format, hindi recording style — kaya ang failure modes ay galing sa encoder, hindi sa speech.
Mga default na akma sa ~80% ng MP3 files. I-override per-job mula sa form.
Accuracy · real-world numbers
Ang MP3 accuracy ay hanggat ng kung ano ang nag-alok ng encoder, hindi kami. Perceptual compression sa itaas ng ~96 kbps ay pinapanatili ang speech intelligibility ng maayos; sa ibaba ng 64 kbps, ang sibilants at consonants ay nagsisimulang lumabo. Ang mga numero sa ibaba ay galing sa tunay na customer MP3s sa production.
Halos-lossless para sa speech. Podcast masters, dictation app exports, professional interview rigs. Diarization clean kung speakers sa hiwalay na channels.
Pinakasyadong bitrate para sa spoken-word MP3s. Zoom exports, Riverside downloads, voice recorders default. Compression artifacts hindi naririnig ng recognizer.
Voice memo defaults sa karamihan ng phones. Acoustic diarization ay humahawak ng 2-4 speakers. Mga numero at proper nouns minsan ay kailangan ng tingin.
Lumang answering-machine rips, lecture archives, narrow-band sources. High-frequency consonants (f/s/sh) ay nag-blur. Basta legible pa — magplano ng proofread.
Mga karaniwang tanong
30 libreng minuto tuwing buwan. Walang card na kailangan. Speaker labels, 99 wika, bawat export format kasama.
Magsimula ng libre