ffmpeg + Whisper
無料、ローカル、調整が必要。パイプラインとそのすべてのバグを所有します。
MP4ファイルをそのままドロップ — オーディオトラックをサーバー側から抽出し、タイムスタンプ付きトランスクリプトを返し、YouTube、Vimeo、またはNLEに直接戻すSRTを配信します。
↓ 出力結果を見る
MP4はコンテナ形式 — オーディオストリームを直接読み込み、ビデオは再エンコードしません。タイムスタンプは元のタイムラインに対してフレーム正確に保たれるため、SRTは最初の��ンポート時に完全に同期します。
わかりました。このモジュールでは払い戻しワークフローを最初から最後まで説明します。
始める前に質問ですが — 部分払い戻しにも適用されますか?
いい指摘ですね。部分払い戻しは同じ画面を使いますが、別の理由コードです。
わかりました。承認のしきい値はまだ200ドルですか?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
3つの現実的な選択肢 · 正直な比較
オーディオを自分で抽出してWhisperを実行することもできます。MP4をDescriptやVEEDにドラッグしてそのエディター内で作業することもできます。あるいはファイルをここにドロップしてトランスクリプト + SRTを取得。エディターへのロックインはありません。
無料、ローカル、調整が必要。パイプラインとそのすべてのバグを所有します。
MP4をドロップ。オーディオ抽出、スピーカー識別、SRT、概要 — 1パスで完了。
MP4をエディターに読み込み。トランスクリプトはタイムラインUIの一部として表示。
価格と機能制限は2026年時点の概算です。DescriptとVEEDのティア名は頻繁に変更されるため、現在の制限については各サイトをご確認ください。
MP4特有の問題
MP4はコーデックではなくコンテナ形式 — ほとんどの文字起こしツールは1つの大きなオーディオブロブのように扱います。そこが見落としの原因です。
MP4をドロップするとこれらはデフォルトで有効になります。フォームからジョブごとにオーバーライドできます。
Accuracy · real-world numbers
MP4の精度はマイクによって決まり、コーデックではありません。静かなセットのラペルマイクは毎回4Kカメラのオンボードオーディオに勝ります。以下の数字は実際の顧客MP4から取得したもので、オーディオをキャプチャしているものでソートされています。
ラペルまたはブームをレコーダーに接続、48 kHz AAC 192 kbps以上、処理済みルーム。最高のケース。2人撮影ではスピーカーラベルが完璧に機能します。
カメラトップマイク、スピーカーから2〜4フィート。ルームトーンは多いですが音声は十分理解できます。ほとんどのYouTubeクリエーター映像はここに該当します。
OBS、Loom、Camtasiaエクスポート。マイクは近いですがルームは無処理、しばしばシステムオーディオ混入。チュートリアル文字起こしには十分な品質です。
スマートフォン内蔵マイク、風やハンドリングノイズ、フレームごとに距離は変動。単語は使用可能ですが、固有名詞は1分あたり1〜2箇所の修正が必要です。
よくある質問