Whisper ローカル / オープンソース
GPU とスキマ時間があれば無料。ボックス外での話者分離は非対応。
MP3 ファイル を 64~320 kbps の任意のビットレートでアップロード。99 言語でタイムスタンプ付き、話者ラベル付きトランスクリプトを取得 — フォーマット変換なし、再エンコードなし、キュー待機なし。
↓ 出力内容をご確認ください
MP3 フレームヘッダー を直接読み取ります — VBR、CBR、ジョイントステレオ、任意のエンコーダー(LAME、Fraunhofer、FFmpeg)に対応。ファイルが独立したチャンネルのトゥルーステレオの場合、それを使用して音声を分離します。モノミックスはアコースティック話者分離にフォールバックします。
So when did you first realise the archive was incomplete?
Probably around 2019, when we started digitising the reel-to-reels.
And the missing tapes — were they catalogued anywhere at all?
There's a paper index from '78, but half of it's water-damaged.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
3 つの現実的な選択肢 · 正直な比較
技術的なスキルがあれば、Whisper をノートパソコンで無料で実行できます。Otter と Sonix はサブスクリプションダッシュボード内で MP3 アップロードを受け付けます。当社はファイルを受け取り、トランスクリプトを返却します。UI に閉じ込められることはありません。
GPU とスキマ時間があれば無料。ボックス外での話者分離は非対応。
MP3 をドロップ。話者ラベル付きテキストがほぼリアルタイム × 0.025 で返却。
洗練されたダッシュボード、月間分数制限、英語チューニング。ファイルアップロードは副機能に見える。
料金とサービス可用性は 2026 年 5 月時点。Whisper のパフォーマンスはモデルサイズとハードウェアによって異なります。
MP3 に固有
MP3 は記録スタイルではなくフォーマット — つまり、失敗モードは音声ではなくエンコーダーから来ます。
MP3 ファイルの約 80% に適合するデフォルト。ジョブごとにフォームから変更可能。
Accuracy · real-world numbers
MP3 の精度は エンコーダーが保持した内容 によって制限されます。当社ではなく。知覚圧縮は約 96 kbps 以上で音声の可聴性を非常に良好に保持しており、64 kbps 未満では、サビラント音と子音が崩壊し始めます。提示される数値は本番環境の実際のカスタマー MP3 から取得したものです。
音声用ほぼロスレス。ポッドキャストマスター、口述筆記アプリエクスポート、プロフェッショナルインタビューリグ。話者が独立したチャンネルにある場合、話者分離がクリーン。
スポークンワード MP3 の最も一般的なビットレート。Zoom エクスポート、Riverside ダウンロード、音声レコーダーのデフォルト。圧縮アーティファクトは認識エンジンには不可聴。
ほとんどの携帯電話の音声メモデフォルト。アコースティック話者分離は 2~4 話者を処理。数字と固有名詞はちらっと確認が必要な場合があります。
古い留守電リップ、講演会アーカイブ、ナローバンドソース。高周波子音(f/s/sh)がぼやける。依然として読める — 校正予定を立てましょう。
よくある質問