MP4動画をテキストに文字起こし。オーディオは自動抽出。

MP4ファイルをそのままドロップ — オーディオトラックをサーバー側から抽出し、タイムスタンプ付きトランスクリプトを返し、YouTube、Vimeo、またはNLEに直接戻すSRTを配信します。

音声または動画をドロップ

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

ブラウザから直接録音

サインアップは30秒 — その後すぐにダッシュボードで録音が開始されます。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTファイルは24時間後に自動削除

↓ 出力結果を見る

MP4を入力。 トランスクリプト + SRTを出力。

MP4はコンテナ形式 — オーディオストリームを直接読み込み、ビデオは再エンコードしません。タイムスタンプは元のタイムラインに対してフレーム正確に保たれるため、SRTは最初の��ンポート時に完全に同期します。

training-module-04.mp4REC 1080p · 22:14 · 412 MB
自動検出: en-USAAC 48 kHz ステレオ · 192 kbps
~90s
トランスクリプト · ストリーミング精度95%
S1

わかりました。このモジュールでは払い戻しワークフローを最初から最後まで説明します。

S2

始める前に質問ですが — 部分払い戻しにも適用されますか?

S1

いい指摘ですね。部分払い戻しは同じ画面を使いますが、別の理由コードです。

S2

わかりました。承認のしきい値はまだ200ドルですか?

クリーンな対話で95%SRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

3つの現実的な選択肢 · 正直な比較

ffmpegで自作。ビデオエディター。 あるいは当社で。

オーディオを自分で抽出してWhisperを実行することもできます。MP4をDescriptやVEEDにドラッグしてそのエディター内で作業することもできます。あるいはファイルをここにドロップしてトランスクリプト + SRTを取得。エディターへのロックインはありません。

Option 01

ffmpeg + Whisper

無料、ローカル、調整が必要。パイプラインとそのすべてのバグを所有します。

必要なものCLI + 10 GBモデル + GPU
スピーカー識別別ツール(pyannote)
SRT出力はい、手動フラグ
1時間のMP4での処理時間CPUで20〜90分
マルチトラックオーディオ手動でストリーム選択
コスト$0 + ハードウェア
Best forすでにWhisperをローカルで実行しており、その上に識別を接合することを気にしないエンジニア向け。
Option 02

Transcription.Solutions

MP4をドロップ。オーディオ抽出、スピーカー識別、SRT、概要 — 1パスで完了。

必要なものブラウザだけ
スピーカー識別組み込み、すべてのジョブ対応
SRT出力ソースにフレーム単位でアライン
1時間のMP4での処理時間約4分、ストリーミング
マルチトラックオーディオすべてのストリームを表示
コスト · 1分あたり$0.03
Best forビデオエディターやCLIを学ぶことなく、テキストとSRTが必要なMP4ユーザー向け。
Option 03

Descript / VEED

MP4をエディターに読み込み。トランスクリプトはタイムラインUIの一部として表示。

必要なものアカウント + エディターの学習曲線
スピーカー識別はい、英語チューニング
SRT出力プラン別にエクスポート制限
アップロード上限5 GB(Descript無料)
マルチトラックオーディオ最初のトラックのみ
コスト$12–24/ユーザー/月
Best forビデオとトランスクリプトを同じツールで編集したいエディター向け。

価格と機能制限は2026年時点の概算です。DescriptとVEEDのティア名は頻繁に変更されるため、現在の制限については各サイトをご確認ください。

MP4特有の問題

で引っかかる3つのこと。 一般的な文字起こしツール

MP4はコーデックではなくコンテナ形式 — ほとんどの文字起こしツールは1つの大きなオーディオブロブのように扱います。そこが見落としの原因です。

うまくいかないパターン

  1. 1ブームと ラペル の複数トラック MP4。一般的なツールはトラック1を取得してそれ以外は無視するため、クリーナーなマイクを失います。FCP と Premiere エクスポートで一般的です。
  2. 2ブログと広告の背景音楽は幽霊のような単語を引き起こします。レコグナイザーは音楽ベッドのボーカルを文字起こししようとします。
  3. 3SRTタイムスタンプが ドリフト — ツールが入力時にビデオを再エンコードすると発生します。40分ごろまでにキャプションは1秒ズレます。

ここで修正できること

  1. 1アップロード — すべてのオーディオストリームをプローブして、どのストリームを文字起こしするか選択できます。デフォルトは最大ビットレートトラック。
  2. 2ジョブフォームでミュージック サプレッションをオンにする。音声VADでレコグナイザーをゲートするため、楽器セクションは空のままです。
  3. 3ビデオを再エンコードしません。オーディオはネイティブサンプルレートで抽出され、タイムスタンプはコンテナの編集リストを参照 —SRTはフレーム単位で正確にアライン。

MP4推奨ジョブ設定

MP4をドロップするとこれらはデフォルトで有効になります。フォームからジョブごとにオーバーライドできます。

オーディオ抽出
ネイティブサンプルレート、再エンコードなし
トラック選択
最大ビットレートストリーム
スピーカー識別
アコースティック · 1〜6スピーカー
ミュージック サプレッション
ブログ/広告プリセットでオン
SRTフォーマット
≤42文字/行、最大2行
エクスポート
SRT · VTT · DOCX · タイムスタンプ付きTXT

Accuracy · real-world numbers

クリーンな撮影で95%。 オーディオが課題の時の正直な数字。

MP4の精度はマイクによって決まり、コーデックではありません。静かなセットのラペルマイクは毎回4Kカメラのオンボードオーディオに勝ります。以下の数字は実際の顧客MP4から取得したもので、オーディオをキャプチャしているものでソートされています。

96%+
スタジオ撮影、ラペルマイクまたはショットガンマイク

ラペルまたはブームをレコーダーに接続、48 kHz AAC 192 kbps以上、処理済みルーム。最高のケース。2人撮影ではスピーカーラベルが完璧に機能します。

93%
オンカメラショットガンマイク付きDSLR

カメラトップマイク、スピーカーから2〜4フィート。ルームトーンは多いですが音声は十分理解できます。ほとんどのYouTubeクリエーター映像はここに該当します。

89%
USBマイク付き画面録画

OBS、Loom、Camtasiaエクスポート。マイクは近いですがルームは無処理、しばしばシステムオーディオ混入。チュートリアル文字起こしには十分な品質です。

84%
スマートフォン撮影ブログ、内蔵マイク

スマートフォン内蔵マイク、風やハンドリングノイズ、フレームごとに距離は変動。単語は使用可能ですが、固有名詞は1分あたり1〜2箇所の修正が必要です。

よくある質問

人々が尋ねる8つのこと。 MP4文字起こしについて

01ビデオを再エンコードしますか?+
いいえ。MP4コンテナからオーディオストリームを読み込むだけです。ビデオストリームには触れず、再エンコードされず、ジョブが終了した後は保存されません — オリジナルファイルは変更されません。
02MP4内のどのコーデックに対応していますか?+
標準的なH.264 + AACが基本的なケースです。HEVC/H.265、ProRes-in-MP4、MP3、Opus、ALAC、またはPCM形式のオーディオにも対応しています。ffmpegでプローブできればI することができます。
03ファイルサイズの上限はいくらですか?+
Webアップローダーは1アップロードあたり10 GB、APIは再開可能なチャンク対応で50 GBです。典型的な1時間1080p MP4は1〜3 GBなので、ほとんどのファイルはWebパスで問題ありません。
04SRTはオリジナルビデオに同期しますか?+
はい — タイムスタンプはMP4の編集リストとネイティブサンプルレートを参照します。再エンコードしないため、ドリフトはありません。SRTをMP4の横に置いて任意のプレーヤーまたはNLEで再生し、キ���プションは最初のロード時に同期します。
05字幕をビデオに焼き込むことはできますか?+
当社側では不可 — SRTを出力してビデオへの焼き込みはエディター側で行います。ffmpeg one-liner、HandBrake、Premiere、DaVinci、Kapwing はすべて当社が生成するSRTに対応しています。エンコーディングツールでもあることは望みません。
06MOV、MKV、M4V、WebMについてはどうですか?+
すべて同じパイプラインで対応しています。特にMOV —同じMPEG-4ファミリー、同一の抽出パス。複数のオーディオトラックを持つMKVは、マルチトラックMP4と同じストリームピッカーUIを取得します。
07YouTubeまたはVimeoのURLを送信することはできますか?+
YouTubeについてはできます — アップロード画面にパブリックURLを貼り付けると、MP4ダウンロード不要で オーディオを直接取得します。Vimeoはプレーヤーがストリームをゲートするため、直接ファイルまたは署名済みダウンロードリンクが必要です。
08音声対話がなく、音楽またはB-rollだけの場合はどうなりますか?+
VADは無音と音楽のみのセクションを検出してスキップするため、環境フッテージには料金がかかりません。トランスクリプトはこれらの範囲を`[music]`または`[no speech]`としてマークし、言葉を作拵えません。

MP4をドロップ。トランスクリプト とSRTを取得。

毎月30分まで無料。カード不要。オーディオをサーバー側で抽出、スピーカーラベル、フレーム正確なSRT — すべて含まれます。

無料で始める