Whisper 本地/開源
如果你有 GPU 和一個下午就免費。沒有開箱即用的講者分化。
以 64 到 320 kbps 的任何比率上傳 MP3 檔案。以 99 種語言取得時間戳記、標註講者的記錄——無需格式轉換、無需重新編碼、無需等待隊列。
↓ 看看會輸出什麼
我們直接讀取 MP3 幀頭——VBR、CBR、聯合立體聲、任何編碼器(LAME、Fraunhofer、FFmpeg)。如果檔案是真立體聲且講者在不同頻道,我們使用它來分割聲音。單聲道混合回退到聲學講者分化。
所以你什麼時候才意識到檔案庫不完整?
大約 2019 年,當我們開始將卷帶數位化時。
那些遺失的卷帶——它們在任何地方都被編目過嗎?
有一份來自 78 年的紙質索引,但一半被水毀。
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
三個真實選項 · 誠實比較
如果你懂技術,可以在自己的筆電上免費執行 Whisper。Otter 和 Sonix 在訂閱儀表板內接受 MP3 上傳。我們取得檔案、返回記錄,不讓你待在 UI 內。
如果你有 GPU 和一個下午就免費。沒有開箱即用的講者分化。
上傳 MP3。以約 0.025 倍即時速度取回標註講者的文字。
設計精良的儀表板、每月分鐘上限、英文調整。檔案上傳感覺像是附加功能。
定價和功能可用性以 2026 年 5 月為準。Whisper 性能因模型大小和硬體而異。
MP3 特有
MP3 是一個格式,不是錄音風格——這意味著失敗模式來自編碼器,而不是語音。
適合 ~80% MP3 檔案的預設值。從表單按工作覆蓋。
Accuracy · real-world numbers
MP3 準確度受限於編碼器保留的,而不是我們。感知壓縮在 ~96 kbps 以上保留語音清晰度很好;低於 64 kbps,嘶音和輔��開始溶解。下面的數字來自生產中的真實客戶 MP3。
對語音幾乎無損。播客主檔案、聽寫應用匯出、專業採訪設備。如果講者在不同頻道,講者分化乾淨。
口語 MP3 最常見的比率。Zoom 匯出、Riverside 下載、語音記錄器預設值。壓縮成品對識別器無聲。
大多數手機上的語音備忘錄預設值。聲學講者分化處理 2-4 位講者。數字和專有名詞偶爾需要檢查。
舊的自動應答機錄音、講座存檔、窄帶源。高頻輔音(f/s/sh)模糊。仍可讀——計畫校對。
常見問題