Whisper 本地 / 开源
如果你有 GPU 和一个下午,免费。开箱没有说话人分离。
上传任意比特率(64 到 320 kbps)的 MP3 文件。获得 99 种语言的带时间戳、带说话人标签的文字稿 — 无需格式转换、无需重新编码、无需排队等待。
↓ 看看输出的内容
我们直接读取 MP3 帧头 — 支持 VBR、CBR、联合立体声、任何编码器(LAME、Fraunhofer、FFmpeg)。如果文件是真立体声且说话人在不同声道,我们用此分离语音。单声道混音则回退到声学分说者识别。
那你什么时候意识到档案不完整的?
大概在 2019 年,当我们开始数字化这些盘带的时候。
那些丢失的磁带呢 — 有地方编目过吗?
有一份 78 年的纸质索引,但有一半被水浸了。
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
三个真实选项 · 诚实比较
如果你有技术背景,可以在笔记本上免费运行 Whisper。Otter 和 Sonix 在订阅仪表板内接受 MP3 上传。我们接收文件并返回文字稿,不会让你困在界面里。
如果你有 GPU 和一个下午,免费。开箱没有说话人分离。
上传 MP3。获得带说话人标签的文字稿,几乎实时返回 × 0.025。
精美的仪表板,月度分钟限制,英文优化。文件上传感觉像个副功能。
定价和功能可用性截至 2026 年 5 月准确。Whisper 性能因模型大小和硬件而异。
MP3 特有
MP3 是一种格式,不是录音风格 — 这意味着失败模式来自编码器,而不是语音。
适配约 80% MP3 文件的默认值。从表单按任务覆盖。
Accuracy · real-world numbers
MP3 准确率受 编码器保留了什么 限制,而不是受我们限制。96 kbps 以上的感知压缩很好地保留了语音可懂性;低于 64 kbps,嘶音和辅音开始散失。下面的数字来自生产中真实客户的 MP3。
对语音几乎无损。播客母带、听写应用导出、专业录音设备。如果说话人在不同声道,分离清晰。
口头 MP3 最常见的比特率。Zoom 导出、Riverside 下载、语音记录器默认设置。压缩工件无法被识别器感知。
大多数手机的语音备忘录默认值。声学分说者处理 2-4 个说话人。数字和专有名词偶尔需要核实。
旧留言机拷贝、讲座档案、窄带源。高频辅音(f/s/sh)模糊。仍然可读 — 计划校对。
常见问题