MP3 をテキストに文字起こし。話者ラベル付き、100 以上の言語。

MP3 ファイル を 64~320 kbps の任意のビットレートでアップロード。99 言語でタイムスタンプ付き、話者ラベル付きトランスクリプトを取得 — フォーマット変換なし、再エンコードなし、キュー待機なし。

音声または動画をドロップ

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

ブラウザから直接録音

サインアップは30秒 — その後すぐにダッシュボードで録音が開始されます。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTファイルは24時間後に自動削除

↓ 出力内容をご確認ください

MP3 を入力。 話者分離済みトランスクリプトを出力。

MP3 フレームヘッダー を直接読み取ります — VBR、CBR、ジョイントステレオ、任意のエンコーダー(LAME、Fraunhofer、FFmpeg)に対応。ファイルが独立したチャンネルのトゥルーステレオの場合、それを使用して音声を分離します。モノミックスはアコースティック話者分離にフォールバックします。

interview-tape-04.mp3REC 192 kbps · ステレオ · 38:42
自動検出 en-GB44.1 kHz · LAME 3.100
~90s
トランスクリプト · ストリーミング95% の精度
S1

So when did you first realise the archive was incomplete?

S2

Probably around 2019, when we started digitising the reel-to-reels.

S1

And the missing tapes — were they catalogued anywhere at all?

S2

There's a paper index from '78, but half of it's water-damaged.

192 kbps ステレオで 95%SRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

3 つの現実的な選択肢 · 正直な比較

無料ローカル Whisper。Otter または Sonix。 または当社。

技術的なスキルがあれば、Whisper をノートパソコンで無料で実行できます。Otter と Sonix はサブスクリプションダッシュボード内で MP3 アップロードを受け付けます。当社はファイルを受け取り、トランスクリプトを返却します。UI に閉じ込められることはありません。

Option 01

Whisper ローカル / オープンソース

GPU とスキマ時間があれば無料。ボックス外での話者分離は非対応。

セットアップPython + CUDA + 10 GB モデル
話者分離非対応(pyannote アドオン)
速度 · 1 時間 MP3コンシューマー GPU で 5~40 分
言語99、ただし小規模モデルは 80% 未満に低下
エクスポートTXT / SRT / VTT / JSON
コスト無料 + 電気代
Best for既に GPU を所有し、話者ラベルを不要とし、完全なローカルプライバシーが必要なエンジニア向け。
Option 02

Transcription.Solutions

MP3 をドロップ。話者ラベル付きテキストがほぼリアルタイム × 0.025 で返却。

セットアップドラッグ・アンド・ドロップ、試す際はアカウント不要
話者分離組み込み(Pro & Business プラン)
速度 · 1 時間 MP3約 90 秒
言語99、自動検出
エクスポートSRT · VTT · DOCX · TXT · JSON
分単価$0.03
Best forMP3 を持つ誰もが対象 — ジャーナリスト音声、ポッドキャストエクスポート、音声メモ、アーカイブ録音 — 要するに正確なテキストが必要な場合。
Option 03

Otter / Sonix

洗練されたダッシュボード、月間分数制限、英語チューニング。ファイルアップロードは副機能に見える。

セットアップアカウント + 有料プラン
話者分離アコースティック、英語寄り
速度 · 1 時間 MP3キュー内で 5~10 分
言語Otter は英語のみ。Sonix は約 40 言語
エクスポート有料層の背後にロック
コスト$17+/月 または $10+/時間(Sonix)
Best forトランスクリプトエディターとコラボレーション UI が必要なチーム向け(シンプルな API スタイルのファイル→テキストフローより)。

料金とサービス可用性は 2026 年 5 月時点。Whisper のパフォーマンスはモデルサイズとハードウェアによって異なります。

MP3 に固有

で人々を困らせる 3 つのこと。 汎用文字起こしツール

MP3 は記録スタイルではなくフォーマット — つまり、失敗モードは音声ではなくエンコーダーから来ます。

何が問題になるか

  1. 1VBR ヘッダーが誤解析される。 一部のツールは可変ビットレート MP3 を固定レートとして読み取り、期間を誤計算します — 1 時間のファイルに対してタイムスタンプが数分ドリフトします。
  2. 2ジョイントステレオはアップロード前処理中にモノに平坦化される。 ファイルに実際に存在していた話者あたりのチャンネル分離を失う。
  3. 3埋め込み ID3 アルバムアート がいくつかのアップローダーを混乱させます — 「純粋なオーディオではない」ファイルとして拒否するか、ストリップして再エンコードし、品質をさらに低下させます。

代わりに当社が行うこと

  1. 1Xing/LAME ヘッダー が存在する場合は使用し、存在しない場合はフレ��ム数フォールバックを使用します。VBR タイムスタンプは多時間ファイル全体で ±0.1 秒の精度を維持します。
  2. 2ジョイントステレオとトゥルーステレオ MP3 は 話者分離前に L/R PCM にデコード されます。スピーカーがパンされていた場合、分割を保持します。
  3. 3ID3v1、ID3v2、APE タグ、埋め込みアート — すべてそのままスルーされます。MP3 を再エンコードすることはありません。

MP3 アップロード用の推奨ジョブ設定

MP3 ファイルの約 80% に適合するデフォルト。ジョブごとにフォームから変更可能。

デコーダー
フレーム精度、再エンコードなし
話者分離
ステレオの場合チャンネル分離、それ以外はアコースティック
スピーカーモデル
自動 · 1~12 話者
言語
最初の 30 秒から自動検出
フィラーワード
削除(トグルで保持可能)
エクスポートバンドル
DOCX + SRT + タイムスタンプ付き TXT

Accuracy · real-world numbers

192 kbps ステレオで 95% 以上。 64 kbps モノまで利用可能。

MP3 の精度は エンコーダーが保持した内容 によって制限されます。当社ではなく。知覚圧縮は約 96 kbps 以上で音声の可聴性を非常に良好に保持しており、64 kbps 未満では、サビラント音と子音が崩壊し始めます。提示される数値は本番環境の実際のカスタマー MP3 から取得したものです。

96%
320 kbps ステレオ、スタジオソース

音声用ほぼロスレス。ポッドキャストマスター、口述筆記アプリエクスポート、プロフェッショナルインタビューリグ。話者が独立したチャンネルにある場合、話者分離がクリーン。

95%
192 kbps ステレオ、2~3 話者

スポークンワード MP3 の最も一般的なビットレート。Zoom エクスポート、Riverside ダウンロード、音声レコーダーのデフォルト。圧縮アーティファクトは認識エンジンには不可聴。

91%
128 kbps モノ、会話

ほとんどの携帯電話の音声メモデフォルト。アコースティック話者分離は 2~4 話者を処理。数字と固有名詞はちらっと確認が必要な場合があります。

84%
64 kbps モノ、アーカイブ / 電話ダンプ

古い留守電リップ、講演会アーカイブ、ナローバンドソース。高周波子音(f/s/sh)がぼやける。依然として読める — 校正予定を立てましょう。

よくある質問

人々が尋ねる 8 つのこと。 MP3 文字起こしについて

01使用可能なトランスクリプトを提供する MP3 の最小ビットレートは?+
64 kbps が実用的な下限です。それ以下では、サビラント音(s、sh、f)がノイズに圧縮され、単語誤り率が 20% を超えます。新たに録音する場合は、モノ 128 kbps またはステレオ 192 kbps をターゲット — それ以上は音声では過剰です。
02MP3 を最初に WAV に変換する必要があります?+
いいえ。MP3 → WAV の再エンコードはエンコーダーが破棄したデータは永遠に失われているため、精度の向上を加えません。MP3 を直接アップロードしてください。フレームをメモリ内でデコードし、PCM を認識エンジンに供給します。
03ステレオ MP3 はモノゼヨりも話者ラベルがより優れていますか?+
スピーカーが実際に独立したチャンネルに記録されている場合のみ — ほとんどのステレオ MP3 は両側で同じ音声を持つ(「デュアルモノ」)持ち、何も得られません。トゥルーチャンネル分割(例:Riverside エクスポート、2 マイク現場リグ)を使用すれば、アコースティック話者分離をスキップし、話者をほぼ完璧にラベル付けできます。
04受け付ける最大 MP3 ファイルサイズは?+
アップロードあたり 5 GB。これは 192 kbps で約 60 時間、または 128 kbps で約 90 時間です。ファイルが大きい場合、チャンク化されたアップロードが表示されます — 自分で分割する必要はありません。
0560 分の MP3 を文字起こしするのに どのくらい時間がかかりますか?+
通常 90 秒 (アップロード完了からトランスクリプト準備完了まで)、ビットレートに関係なく。MP3 フレームのデコードは高速。時間は認識エンジンに使用されます。話者分離は複数話者ファイルで 5~10 秒追加されます。
06MP3 にバックグラウンド音楽があります — トランスクリプトは台無しになりますか?+
音声の下での静かなベッド音楽は問題ありません。音声と競合する大きな音楽(イントロスティング、インタビュー下のスコアリング)は、重複する音節で時々誤認識をトリガーする場合があります。ジョブフォー���で 音楽抑制 をトグルして事前フィルタリングします。
07電話ボイスメールまたは自動応答装置からリッピングされた MP3 を処理できますか?+
はい。ただし、これらはしばしば 8 kHz ナローバンドが MP3 として再エンコードされます — オーディオ品質の天井は MP3 ラッパーではなく、元の PSTN キャプチャによって設定されます。そのソースで 78~85% の精度を期待してください。これは基礎となる呼び出しで取得するのと同じです。
08トランスクリプト完了後、MP3 を保持しますか?+
ファイルはデフォルトで 30 日後に削除されるか、ダッシュボード経由でリクエストによりすぐに削除されます。トランスクリプトは削除するまでアカウントに保持されます。カスタマーオーディオを使用してモデルをトレーニングすることはありません — 結論。

MP3 をドロップ。 90 秒でテキストを取得。

毎月 30 分無料。カード不要。話者ラベル付き、99 言語、すべてのエクスポート形式に対応。

無料で開始