Otter Pro
对长文件的限制是每个录音4小时。说话人标签在2小时后会偏移。
上传一个长音频文件 — 最长10小时、5 GB(Business支持)。我们并行分块,保持说话人ID从始至终的一致性,交付单个转录文件而不是编号文件夹。
↓ 一个5小时的文件,转录中
大多数工具在90分钟左右超时或将你的长音频 分成编号的部分文件供你自己拼接。我们以12分钟的重叠窗口分块、并行处理,然后通过全局说话人检测来重新组合。
我们已经三小时了 — 让我们回到上午会议中提到的供应链问题。
对,越南制造转向。我认为我们忽略了交期风险。
关税变化后,交期从14天增加到31天。
那还没有考虑长滩港的拥堵情况。
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
三种真实选择 · 诚实对比
消费类工具对文件长度有上限并会无声截断。Whisper API有25 MB的单请求上限,所以你需要自己构建分块器。我们接受完整的10小时文件并交付一份转录。
对长文件的限制是每个录音4小时。说话人标签在2小时后会偏移。
每个文件10小时。并行分块,全局说话人检测,输出DOCX。
每分钟最便宜。你需要构建分块器、说话人拼接和重试逻辑。
定价和限制截至2026年5月准确无误。Otter Pro长度上限最后在其公开定价页面验证。
特定于长文件
大多数管道是为一小时的会议构建的。长音频以可预测的方式打破它们 — 这是我们不同做法的地方。
上传任何超过90分钟的内容,这些会自动打开。每个任务从表单中覆盖。
Accuracy · real-world numbers
长音频的难点不在模型 — 而在从第1分钟到第600分钟保持准确率稳定。说话人偏移和分块边界错误是最常见的管道杀手。下面的数字来自完整长度的客户文件测量,而不是前10分钟。
有声书叙述、独播播客、口述手稿。6-10小时的清晰语音,无室内噪音。不需要说话人分离。
会议桌、不错的麦克风、3-5小时。全局说话人检测在整个文件中保持ID稳定。
7-9小时的培训日,包括麦克风交接和听众问答。说话人芯片需要5分钟的检测。
长期口述历史、焦点小组或有重叠语音和环境噪音的小组讨论。可用,但需要清理。
常见问题