MP4 视频转录为文本。音频自动提取。

直接上传 MP4 文件 — 我们在服务器端提取音轨,返回带时间戳的记录,以及可直接导回 YouTube、Vimeo 或你的编辑软件的 SRT 文件。

Drop your audio or video

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

直接在浏览器里录音

注册只要 30 秒——之后直接在控制台里开始录音。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXT文件 24 小时后自动删除

↓ 看看输出结果

MP4 进来。 文本 + SRT 输出。

MP4 是容器格式 — 我们直接读取音频流,从不重新编码视频。时间戳与原始时间线保持帧精度对齐,所以 SRT 导入时能完美同步。

training-module-04.mp4REC 1080p · 22:14 · 412 MB
自动检测 en-USAAC 48 kHz 立体声 · 192 kbps
~90s
转录文本 · 实时95% 准确度
S1

好的,这个模块我们从头到尾讲解退款流程。

S2

开始前快速问一下 — 这个流程对部分退款也适用吗?

S1

问得好。部分退款用同一个界面但不同的原因代码。

S2

明白了。批准的金额阈值还是两百美元吗?

清晰对话下 95% 准确度SRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

三种真实方案 · 诚实比较

用 ffmpeg 自己动手。用视频编辑器。 或者用我们的。

你可以自己提取音频并运行 Whisper。也可以把 MP4 拖到 Descript 或 VEED,在他们的编辑器里工作。或者直接上传到这里,得到记录和 SRT,无需依赖任何编辑器。

Option 01

ffmpeg + Whisper

免费、本地、需要折腾。整个流程和所有缺陷都由你掌控。

需要命令行 + 10 GB 模型 + GPU
发言人分离独立工具 (pyannote)
SRT 输出支持,需要手动指定
1 小时 MP4 的处理时间CPU 上 20–90 分钟
多轨音频你选择要用的流
成本$0 + 你的硬件
Best for已在本地运行 Whisper 的工程师,不介意在上面添加发言人分离的情况。
Option 02

Transcription.Solutions

上传 MP4。音频提取、发言人分离、SRT、摘要 — 一步完成。

需要浏览器,仅此而已
发言人分离内置,每个任务都包括
SRT 输出与源文件帧精度对齐
1 小时 MP4 的处理时间~4 分钟,实时流式
多轨音频我们列出全部流供选择
成本 · 每分钟$0.03
Best for任何需要 MP4 转文字和 SRT,但不想学视频编辑器或命令行的人。
Option 03

Descript / VEED

将 MP4 加载到编辑器。转录文本作为时间线 UI 的一部分出现。

需要账户 + 编辑器学习曲线
发言人分离支持,英文优化
SRT 输出受套餐限制
上传限额5 GB (Descript 免费版)
多轨音频仅第一音轨
成本$12–24/用户/月
Best for想在同一工具中编辑视频和文本记录的编辑。

定价和功能上限为 2026 年的近似值。Descript 和 VEED 的套餐名称变化频繁 — 请查看他们的网站了解最新限制。

MP4 特定问题

通用转录工具常见的三个坑。

MP4 是容器,不是编码 — 大多数转录工具把它当一个大音频块处理。这就是失误的根源。

常见问题

  1. 1多轨 MP4,同时有吊杆和领夹音轨。通用工具只抓第一音轨,忽视其余的,所以清晰的麦克风音质就浪费了。FCP 和 Premiere 输出时常见。
  2. 2视频博客和广告中的背景音乐会触发幻像词汇。识别器试图转录音乐床上的人声。
  3. 3SRT 时间戳漂移,当工具在导入时重新编码视频。到第 40 分钟时字幕已经差了一秒。

我们的解决方案

  1. 1上传 — 我们探测所有音频流并让你选择要转录哪一个。默认选择最高比特率的音轨。
  2. 2在任务表单上打开音乐抑制。我们用语音活动检测来限制识别器,使乐器部分保持空白。
  3. 3我们从不重新编码视频。音频以原始采样率提取,时间戳参考容器的编辑列表 — SRT 保持帧精度对齐。

MP4 推荐的任务设置

上传 MP4 时,这些选项默认打开。可在任务表单中按需覆盖。

音频提取
原始采样率,无重新编码
音轨选择
最高比特率流
发言人分离
声学 · 1-6 个说话人
音乐抑制
视频博客/广告预设时打开
SRT 格式
≤42 字符/行,最多 2 行
导出
SRT · VTT · DOCX · 带时间戳的 TXT

Accuracy · real-world numbers

清晰录制时 95% 准确。 音频质量下降时的诚实数据。

MP4 准确度由麦克风决定,不由编码决定。安静房间里的领夹麦永远胜过配置再好的 4K 摄像头的机载音频。下方数据来自真实客户 MP4,按音频采集设备分类。

96%+
演播室录制,领夹或枪式麦克风

领夹麦或吊杆麦接录音机,48 kHz AAC 192+ kbps,处理过的房间。最优情况。两人对话的发言人标签几乎完美。

93%
单反相机配机顶枪式麦克风

机顶麦距离说话人 2-4 英尺。带有环境音但语音清晰易懂。大多数 YouTube 创作者素材都在这个水平。

89%
屏幕录制 + USB 麦克风

OBS、Loom、Camtasia 输出。麦克风距离近但房间未处理,系统音频易混入。足以用于教程转录。

84%
用手机拍摄的视频博客,内置麦克风

手机内置麦克风,风噪或操作噪音,距离因镜头而异。单词可用,专有名词预计每分钟需要 1-2 处修改。

常见问题

关于 MP4 转录的 8 个常见问题。

01你会重新编码我的视频吗?+
不会。我们只从 MP4 容器中读取音频流。视频流永远不被触及、永远不会重新编码,任务完成后也不会存储 — 你的原始文件保持不变。
02MP4 内部支持哪些编码?+
标准 H.264 + AAC 是最常见的。我们也支持 HEVC/H.265、MP4 中的 ProRes,以及 MP3、Opus、ALAC 或 PCM 音频。只要 ffmpeg 能识别,我们就能转录。
03文件大小上限是多少?+
网页上传器单个上传 10 GB,通过 API 可达 50 GB(支持分块续传)。典型的 1 小时 1080p MP4 是 1-3 GB,所以大多数文件都可以直接用网页路径。
04SRT 会与我的原始视频对齐吗?+
会的 — 时间戳参考 MP4 的编辑列表和原始采样率。我们不重新编码,所以没有任何漂移。把 SRT 和 MP4 放在任何播放器或编辑软件中,字幕第一次加载就同步完美。
05我能把字幕烧制进视频里吗?+
不是在我们这边 — 我们输出 SRT,烧制交给你的编辑器处理。ffmpeg 单行命令、HandBrake、Premiere、DaVinci、Kapwing 都能接受我们生成的 SRT。我们不想也做编码工具。
06MOV、MKV、M4V、WebM 呢?+
全都支持,通过同一条流程。MOV 特别是 — MPEG-4 家族,提取路径完全相同。带多个音频流的 MKV 用和多轨 MP4 相同的流选择 UI。
07我能直接发送 YouTube 或 Vimeo 的 URL 吗?+
YouTube 可以 — 在上传界面粘贴公开链接,我们直接获取音频,无需下载 MP4。Vimeo 需要直接文件或签名下载链接,因为他们的播放器限制流访问。
08如果没有对白,只有音乐或素材呢?+
语音活动检测识别静音和纯音乐部分并跳过,所以你不用为环境素材付费。转录会把这些范围标记为 `[音乐]` 或 `[无语音]` 而不是凭空制造文字。

上传你的 MP4。得到转录文本 和 SRT 返回。

每月免费 30 分钟。无需卡片。音频在服务器端提取,发言人标签、帧精度 SRT — 全部包括。

开始免费使用