MP3 转录为文字。说话人标签,100+ 种语言。

上传任意比特率(64 到 320 kbps)的 MP3 文件。获得 99 种语言的带时间戳、带说话人标签的文字稿 — 无需格式转换、无需重新编码、无需排队等待。

Drop your audio or video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

直接在浏览器里录音

注册只要 30 秒——之后直接在控制台里开始录音。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXT文件 24 小时后自动删除

↓ 看看输出的内容

MP3 进, 分说者文字稿出。

我们直接读取 MP3 帧头 — 支持 VBR、CBR、联合立体声、任何编码器(LAME、Fraunhofer、FFmpeg)。如果文件是真立体声且说话人在不同声道,我们用此分离语音。单声道混音则回退到声学分说者识别。

interview-tape-04.mp3REC 192 kbps · 立体声 · 38:42
自动检测 en-GB44.1 kHz · LAME 3.100
~90s
文字稿 · 流式传输95% 准确率
S1

那你什么时候意识到档案不完整的?

S2

大概在 2019 年,当我们开始数字化这些盘带的时候。

S1

那些丢失的磁带呢 — 有地方编目过吗?

S2

有一份 78 年的纸质索引,但有一半被水浸了。

192 kbps 立体声准确率 95%SRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

三个真实选项 · 诚实比较

免费本地 Whisper。Otter 或 Sonix。 或者选我们。

如果你有技术背景,可以在笔记本上免费运行 Whisper。Otter 和 Sonix 在订阅仪表板内接受 MP3 上传。我们接收文件并返回文字稿,不会让你困在界面里。

Option 01

Whisper 本地 / 开源

如果你有 GPU 和一个下午,免费。开箱没有说话人分离。

设置Python + CUDA + 10 GB 模型
说话人分离不包含(pyannote 插件)
速度 · 1 小时 MP3消费级 GPU 上 5–40 分钟
语言99 种,但小模型低于 80%
导出TXT / SRT / VTT / JSON
成本免费 + 你的电费
Best for已经拥有 GPU、不需要说话人标签、需要完整本地隐私的工程师。
Option 02

Transcription.Solutions

上传 MP3。获得带说话人标签的文字稿,几乎实时返回 × 0.025。

设置拖放即可,无需账户即可试用
说话人分离内置(专业版和企业版计划)
速度 · 1 小时 MP3约 90 秒
语言99 种,自动检测
导出SRT · VTT · DOCX · TXT · JSON
成本 · 每分钟$0.03
Best for任何有 MP3 的人 — 记者磁带、播客导出、语音备忘录、归档副本 — 只想快速获得准确的文字。
Option 03

Otter / Sonix

精美的仪表板,月度分钟限制,英文优化。文件上传感觉像个副功能。

设置账户 + 付费计划
说话人分离声学,偏向英文
速度 · 1 小时 MP3队列中 5–10 分钟
语言Otter 仅英文;Sonix 约 40 种
导出被锁定在付费层后
成本$17+/月 或 $10+/小时(Sonix)
Best for想要转录编辑和协作界面的团队,而不是干净的 API 风格的文件→文字流程。

定价和功能可用性截至 2026 年 5 月准确。Whisper 性能因模型大小和硬件而异。

MP3 特有

三个陷阱。 通用转录工具上常见的

MP3 是一种格式,不是录音风格 — 这意味着失败模式来自编码器,而不是语音。

哪里出错

  1. 1VBR 头被误解析。 一些工具将可变比特率 MP3 读为固定比特率并误算时长 — 时间戳在一小时文件中漂移数分钟。
  2. 2联合立体声在上传预处理时被压平为单声道。 你丧失了文件中实际存在的每说话人声道分离。
  3. 3嵌入的 ID3 唱片封面让一些上传工具犯错 — 它们将文件拒为'非纯音频'或剥离并重新编码,进一步降低质量。

我们改用什么

  1. 1我们在有 Xing/LAME 头时使用它,没有时用帧计数回退。VBR 时间戳在多小时文件中保持 ±0.1 秒的准确度。
  2. 2联合立体声和真立体声 MP3 在分说者之前解码为 L/R PCM。如果你的说话人被对位,我们保持它们分离。
  3. 3ID3v1、ID3v2、APE 标签、嵌入艺术 — 全部原样通过。我们永远不重新编码你的 MP3。

MP3 上传的推荐任务设置

适配约 80% MP3 文件的默认值。从表单按任务覆盖。

解码器
帧精确,无重新编码
分说者
如果立体声则声道分离,否则声学
说话人模型
自动 · 1-12 个说话人
语言
从前 30 秒自动检测
填充词
已移除(切换以保留)
导出包
DOCX + SRT + 带时间戳 TXT

Accuracy · real-world numbers

192 kbps 立体声 95%+ 准确率。 64 kbps 单声道仍可用。

MP3 准确率受 编码器保留了什么 限制,而不是受我们限制。96 kbps 以上的感知压缩很好地保留了语音可懂性;低于 64 kbps,嘶音和辅音开始散失。下面的数字来自生产中真实客户的 MP3。

96%
320 kbps 立体声,录音室源

对语音几乎无损。播客母带、听写应用导出、专业录音设备。如果说话人在不同声道,分离清晰。

95%
192 kbps 立体声,2-3 个说话人

口头 MP3 最常见的比特率。Zoom 导出、Riverside 下载、语音记录器默认设置。压缩工件无法被识别器感知。

91%
128 kbps 单声道,对话式

大多数手机的语音备忘录默认值。声学分说者处理 2-4 个说话人。数字和专有名词偶尔需要核实。

84%
64 kbps 单声道,归档 / 电话转储

旧留言机拷贝、讲座档案、窄带源。高频辅音(f/s/sh)模糊。仍然可读 — 计划校对。

常见问题

8 个常见问题。 关于 MP3 转录的

01MP3 的最小比特率是多少仍能给出可用的文字稿?+
64 kbps 是实用下限。以下那会,嘶音(s、sh、f)会压缩成噪音,词错率会攀升超过 20%。如果你在录制新内容,目标 128 kbps 单声道或 192 kbps 立体声 — 高于此对语音来说是浪费的。
02我需要先将 MP3 转换为 WAV 吗?+
不需要。重新编码 MP3 → WAV 不会增加任何准确度,因为编码器丢弃的数据永久丧失了。直接上传 MP3。我们在内存中解码帧并将 PCM 馈送给识别器。
03立体声 MP3 相比单声道会给我更好的说话人标签吗?+
仅当说话人实际上在不同声道录音时 — 大多数立体声 MP3 两边音频相同('双单声道'),受益无。真正的声道分离(如 Riverside 导出、双麦田野录音)让我们跳过声学分说者,几乎完美标签说话人。
04你接受的最大 MP3 文件大小是多少?+
每次上传 5 GB,大约 192 kbps 下 60 小时或 128 kbps 下 90 小时。如果文件更大,我们会显示分块上传 — 无需你自己拆分。
0560 分钟的 MP3 需要多长时间才能转录?+
通常从上传完成到文字稿就绪 90 秒,与比特率无关。解码 MP3 帧很快;时间在识别器。分说者在多说话人文件上增加 5-10 秒。
06我的 MP3 有背景音乐 — 文字稿会被毁掉吗?+
语音下的安静音乐床不碍事。与语音竞争的大声音乐(开头音效、配乐配音在采访中)有时会在重叠音节上触发误识。在任务表单上切换音乐抑制以预过滤。
07你能处理从手机语音邮件或应答机拉出的 MP3 吗?+
可以,虽然这些通常是从 8 kHz 窄带重新编码成 MP3 — 音频质量天花板由原始 PSTN 捕获设置,而不是 MP3 包装。期待那种来源上 78-85% 的准确率,这和我们在底层通话上的准确率一样。
08文字稿完成后你们会保留我的 MP3 吗?+
文件默认在 30 天后删除,或通过仪表板请求后立即删除。文字稿保留在你的账户中直到你删除。我们不用客户音频训练任何模型 — 永远不会。

上传你的 MP3。 90 秒内获得文字。

每月免费 30 分钟。无需信用卡。说话人标签、99 种语言、每种导出格式全包。

免费开始