WAVファイルを話者ラベル付きで文字に。ロスレス品質。

フィールドリグ、DAWバウンス、インタビューキットからWAV録音をそのままドロップ。24ビットのヘッドルームを保持したまま、生のPCMに対してダイアリゼーションを実行し、タイムスタンプ付きのトランスクリプトとSRTを数分で返します。

音声または動画をドロップ

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

ブラウザから直接録音

サインアップは30秒 — その後すぐにダッシュボードで録音が開始されます。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTファイルは24時間後に自動削除

↓ 出力結果を見る

生PCMを入力。 クリーンなトランスクリプトを出力。

ロスレスWAVはすべての摩擦音、破裂音、小さな声が完全に保存されるため、MP3が子音をにじませるようなことはありません。レコグナイザーはマイクが聞いた音をそのまま聞きます。ファイルがマルチトラック(チャンネルあたり1話者)の場合、音響ダイアリゼーションをスキップしてチャンネルレイアウトで分割します。

WAV · 48 kHz / 24-bitREC 2トラック · 1時間12分 · 743 MB
自動検出 en-GBステレオPCM · 無圧縮
~90s
トランスクリプト · ストリーミング97%精度
S1

あの朝に戻してよ。七十八年の — 電話がかかってきたのは何時だった?

S2

四時四十五分ぐらいかな。ケトルが沸いてたのは覚えてる。

S1

そこからすぐに港に向かったの?

S2

ボートヤードに直行。着いたときはまだ明かりが付いてた。

トラックあたりWAVで97%SRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

3つの現実的な選択肢 · 正直な比較

Adobe Audition。Descript。 それとも私たち。

AuditionのSpeech to Textはクリエイティブクラウドにバンドルされ、タイムライン内に留まります。Descriptはファイルを自分のエディタにインポートします。私たちはファイルをあるがままに受け取り、標準的なエクスポートを返し、プロジェクトをどこかに移すよう求めません。

Option 01

Adobe Audition / Premiere

Adobeタイムラインの内側にあるトランスクリプトパネル。クリエイティブクラウドとプロジェクトファイルに束縛される。

必要なものクリエイティブクラウドサブスクリプション
話者ダイアリゼーションあり、ミックスダウンのみ
マルチトラックWAVSTTの前にフラット化
エクスポートSRT · CSV · XML
言語18言語、手動選択
コスト~$23/月(単体アプリ)
Best for既にPremierenやAuditionで編集していて、キャプションをタイムラインに組み込みたいビデオエディター向け。
Option 02

Transcription.Solutions

WAVをドロップ。マルチトラックならチャンネルごとのダイアリゼーション。ソースを24時間で削除。

必要なもの何もなし — ファイルだけ
話者ダイアリゼーショントラックあたり、または音響
マルチトラックWAV最大16チャンネル
エクスポートSRT · VTT · DOCX · TXT · JSON
言語99言語、自動検出
コスト · 分あたり$0.03
Best for生のWAVを持つ誰もが対象 — フィールドレコーディスト、DAWからバウンスするポッドキャスター、オーラルヒストリーアーキビスト、研究者。
Option 03

Descript

WAVをDescriptのエディタにインポート。強力だが、その中で作業する必要がある。

必要なものDescriptアカウント + インポート
話者ダイアリゼーション音響、英語チューニング
マルチトラックWAV別のクリップとしてインポート
エクスポートTXT · SRT · DOCX
言語23言語、精度は異なる
コスト$16–24/ユーザー/月
Best forトランスクリプトを編集して音声を編集したいポッドキャストエディター — それがDescriptの本当の強み。

価格情報は2026年現在のもの。AdobeとDescriptの機���フラグは頻繁に変わります。コミットする前に最新ドキュメントを確認してください。

WAV固有の問題

人が引っかかる3つのこと。 汎用文字起こしツールで

ほとんどのアップローダーはレコグナイザーに送る前にあなたのWAVをサイレントにダウンサンプリングします。私たちはそうしません。

何がうまくいかないか

  1. 1マルチトラックWAVはフラット化される。 Sound DevicesのMixPreからの4チャンネルフィールド録音はSTTの前にモノにミックスダウンされます。あなたが購入したマイクごとの分離は捨てられます。
  2. 2Zoom FシリーズまたはMixPreの32ビットフロートWAVは完全に拒否されるか、16ビットにクリップしてヘッドルーム回復を失う。
  3. 396 kHz / 24-bitインタビューはツールがブラウザでMP3に再エンコードしてから送信する必要があるため、アップロードが遅くなる。

ここで切り替えることができるもの

  1. 1マルチトラックWAVをあるがままアップロード(最大16チャンネル)。WAVヘッダーからチャンネルレイ���ウトを読み取り、トラックあたり1話者を割り当てる — 音響推測なし。
  2. 232ビットフロートはネイティブで受け入れられます。レコグナイザーの正規化時にフロートのヘッドルームを保持するため、0 dBFSを超えるピークはクリップされない。
  3. 3直接バイナリアップロード、ブラウザでのトランスコードなし。2 GB WAVはフル帯域幅で移動し、最後のバイトが到着した瞬間に処理を開始する。

WAVの推奨ジョブ設定

WAVをドロップするとこれがデフォルトで有効になります。フォームからジョブごとにオーバーライドできます。

サンプルレート
ネイティブ(ダウンサンプルなし)
ビット深度
24-bit / 32-float保持
ダイアリゼーション
マル��トラックの場合はトラックあたり
スピーカーモデル
インタビュー · 2-8スピーカー
フィラーワード
保持(必要に応じてオフに切り替え)
エクスポート
DOCX · SRT · タイムスタンプ付きTXT

Accuracy · real-world numbers

トラックあたりWAVで97%以上。WAVはレコグナイザーにをもたらします。 最もクリーンな信号

WAVは知覚的圧縮なしで生のPCMを保存するため、MP3が圧縮してにじませるのと同じようにことはありません。レコグナイザーはマイクが聞いた音を聞きます。下の数字は本番環境の実際の顧客WAVジョブから得たもの。

98%
スタジオWAV · 単一話者

48 kHz / 24-bit、ラージダイアフラムコンデンサー、トリートメント済みルーム。ナレーション、オーディオブック、ボイスオーバーはここに該当。

96%
マルチトラックインタビューWAV

チャンネルあたり1話者(ラベマイクまたはバウンダリマイク)。ダイアリゼーションはチャンネルルーティング — テキストのみのエラー。

92%
ハンドヘルドフィールドレコーダー

Zoom H5、Tascam DR-40など。ステレオXYピックアップ、2-3話者、多少のルームリフレクション。ほとんどのポッドキャストWAVがここに相当。

85%
ノイズの多い環境フィールドWAV

屋外、カフェ、車内。ロスレスキャプチャが役に立ちます — ノイズは実物です、コーデックアーティファクトではなく — ただし重複スピーチでは精度が低下する。

よくある質問

人が質問する8つのこと。 WAV文字起こしについて

01WAVファイルの最大サイズはいくらですか?+
スタンダードプランでは1ファイルあたり5 GBで、これはおおよそステレオ48 kHz / 24-bitの8時間、または96 kHz / 24-bitの2.5時間です。より大きなファイルはチームプランで対応可能 — アップロード前に私たちに連絡してください。
02Zoom FシリーズやMixPreの32ビットフロートWAVに対応していますか?+
はい、ネイティブで対応しています。フロートサンプルを0 dBFSでクリップせずに読み取るため、ポストで引き下げるために計画した大きなトランジェントがクリーンに文字起こしされます。ほとんどの汎用アップローダーは最初に16ビットにサイレントダウンキャストします。
03フィールドレコーダーの4チャンネルWAVを持っています — 1つのマイクが1人あたり。ダイアリゼーションはそれを使用しますか?+
そうします。ポリフォニックWAVを直接アップロード(最初にステレオにバウンスしない)。WAVヘッダーからチャンネルレイアウトを解析し、トラックあたり1話者を割り当てる — 同様の声での音響ダイアリゼーションより信頼性が高い。
0496 kHz WAVをダウンサンプリングしますか?+
レコグナイザーは内部では16 kHzで実行されます — これが人間の音声インテリジェンスの上限です。ただし、元のファイルを変更しないでおき、ノイズゲートなどのポスト処理に使用します。エクスポートは元のタイムラインを参照します。
05WAVは本当に文字起こしではMP3より正確ですか?+
限定的にはい — クリーンスピーチではWERは通常1-2ポイント。より大きなギャップは摩擦音と低い部分で表れます。MP3の心理音響圧縮はレコグナイザーが使用した情報を破棄します。アーカイブまたはフォレンシック作業では、WAVが正しい選択です。
06BWFメタデータとタイムコードは保持されますか?+
BWFチャンク(bext、iXML)を読み取り、開始タイムコードを使用してトランスクリプトをセッションタイムラインに整列させます。元のWAVは変更されることはありません — 24時間以内に削除されるコピーで作業します。
07DAWセッションエクスポートからWAVファイルのフォルダをドロップできますか?+
できます。バッチアップロードは一度に最大50ファイルを受け付けます。各WAVは独自のジョブとトランスクリプトを取得します。セッションからのステムである場合、アップロード前に単一のマルチトラックWAVにマージすることもでき、チャンネルごとにダイアリゼーションします。
081時間のステレオWAVは実際にはどのくらい時間がかかりますか?+
アップロードが最も遅い部分です — 48 kHz / 24-bitのステレオ1時間WAVは約600 MB、一般的なブロードバンドで2-5分かかります。アップロード後、トランスクリプション自体は標準キューで約4-6分で実行されます。

WAVをドロップ。ロスレス品質を保持。 見てください。

毎月30分無料。カード不要。トラックあたりのダイアリゼ���ション、32ビットフロートサポート、ソースオーディオは24時間で削除。

無料で始める