轉錄長音檔。最長 10 小時。無逾時。

放入一個 長音檔 — 最長 10 小時,5 GB (Business 計畫)。我們並行分割,保持說話者 ID 始終一致,傳回單一轉錄稿而非編號資料夾。

把音訊或影片丟進來

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

直接在瀏覽器裡錄音

註冊只要 30 秒——進到後台立刻就能開始錄。

No card required~90s per 60-min fileSRT · VTT · DOCX · TXT檔案 24 小時後自動刪除

↓ 5 小時檔案,轉錄進行中

輸入數小時。 輸出單一乾淨檔案。

大多數工具在 90 分鐘左右逾時,或將你的 長錄音 分割成編號的部分,你必須自己拼接。我們以 12 分鐘的重疊視窗分割,並行處理,然後進行全局說話者識別重新組合。

董事會策略會議REC 3 位說話者·5:14:22·3.1 GB
自動偵測 en-GB44.1 kHz 立體聲·192 kbps
~90s
轉錄稿·單一檔案92% 準確度·t=3:14:08
S1

我們已經進行三個小時 — 讓我們回到上午會議的供應鏈要點。

S2

沒錯,越南製造業轉向。我認為我們忽略了交期風險。

S1

關稅變化後,交期從 14 天增加到 31 天。

S3

那還沒考慮長灘港口的擁堵。

整個 5 小時檔案準確度 92%DOCX·SRT·TXT·JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

三個真實選項·誠實的比較

Otter Pro。自助 Whisper 分割。 或是我們。

消費者工具限制檔案長度並無聲地截斷。Whisper API 有 25 MB 的每個請求限制,所以你得自己構建分割器。我們接受整個 10 小時檔案並傳回單一轉錄稿。

Option 01

Otter Pro

長檔案限制在每個錄音 4 小時。說話者標籤在 2 小時後漂移。

最大檔案長度4 小時 (Pro 計畫)
最大檔案大小約 1.5 GB 上傳
說話者 ID 始終一致在 2 小時後漂移
長檔案輸出單一文件,在限制處截斷
成本$16.99/使用者/月
可恢復上傳
Best for短於 2 小時的會議。長白天錄音時失敗。
Option 02

Transcription.Solutions

10 小時每個檔案。並行分割,全局說話者識別,傳出單一 DOCX。

最大檔案長度10 小時 (Pro & Business)
最大檔案大小2 GB Pro·5 GB Business
說話者 ID 始終一致全局嵌入識別
長檔案輸出單一檔案·DOCX/SRT/TXT
成本·每分鐘$0.03 固定,與長度無關
可恢復上傳分割式,可恢復掉線
Best for整天工作坊、法庭筆錄、董事會會議、口述歷史 — 任何超過 90 分鐘限制的內容。
Option 03

Whisper API + 自助分割

每分鐘最便宜。你自己構建分割器、說話者拼接和重試邏輯。

最大檔案長度每個請求 25 MB (約 25 分鐘)
最大檔案大小25 MB 硬體限制
說話者 ID 始終一致無 — 沒有說話者識別
長檔案輸出編號部分,你自己拼接
成本·每分鐘$0.006 (OpenAI Whisper)
工程時間每個管道數小時到數天
Best for想要原始文本分塊且不需要說話者、摘要或單一輸出的工程師。

定價和限制截至 2026 年 5 月準確。Otter Pro 長度限制最後在其公開定價頁面驗證。

特定於長檔案

三種泛用工具在 90 分鐘後失敗的方式。

大多數管道是為一小時會議構建的。長音檔以可預測的方式打破它們 — 以下是我們做的不同之處。

會出現什麼問題

  1. 190 分鐘時無聲逾時。 工作旋轉一小時,然後沒有有用的錯誤訊息就死亡。你無法重試。
  2. 2說話者 ID 在分割之間漂移。 第 1 小時的說話者 1 在第 3 小時變成說話者 4,因為每個分割都會隔離進行說話者識別。
  3. 3輸出是編號資料夾。 `transcript_part_01.txt` 到 `transcript_part_24.txt`,每個分割邊界都有時間碼重置。你自己拼接。

這裡要翻轉的內容

  1. 1可恢復分割式上傳。 上傳的第 2 小時時連線斷線?從最後完成的部分繼續。無須重新上傳 4 GB。
  2. 2全局說話者嵌入識別。 進行每個分割的說話者識別後,我們在整個檔案中聚類語音,所以說話者 3 在第 12 分鐘和第 487 分鐘是同一個人。
  3. 3帶小時標記的單一 DOCX。 一個檔案,連續時間碼,選項性每 60 分鐘一個章節分割。無分割。

長檔案的推薦工作設定

放入任何超過 90 分鐘的檔案,這些會自動啟用。從表單覆蓋每個工作。

分割策略
12 分鐘視窗·10 秒重疊
說話者識別
全局識別通過所有分割
說話者模型
長篇·2-20 位說話者
上傳
可恢復分割式
佇列
優先 (Business 計畫)
匯出
單一 DOCX·小時標記開啟

Accuracy · real-world numbers

92% 在整個 5 小時檔案中保持。 品質按小時保持平穩。

長音檔的難點不是模型 — 是從第 1 分鐘到第 600 分鐘保持準確度平穩。說話者漂移和分割邊界誤差 是大多數管道的殺手。下面的數字是根據完整長度的客戶檔案測量的,不是前 10 分鐘。

95%
錄音棚長篇,單一說話者

有聲書朗讀、獨播播客、聽寫文稿。6-10 小時乾淨語音,無室內噪音。無需說話者識別。

92%
董事會會議,2-6 位說話者

會議桌、適當的麥克風、3-5 小時。全局說話者識別將 ID 保持在整個檔案中穩定。

88%
全天工作坊,佩戴式麥克風

7-9 小時的培訓日,麥克風交接和觀眾問答。名字需要在說話者芯片上進行 5 分鐘識別。

82%
現場圓桌討論,8+ 位說話者

長口述歷史、焦點小組或有重疊語音和環境噪音的座談會。可用,但預期需要清理。

常見問題

8 個人們 對長音檔轉錄詢問的事項。

01實際檔案長度和大小限制是多少?+
Pro 和 Business 上每個檔案 10 小時。 Pro 將檔案大小限制在 2 GB,Business 5 GB。如果你有超過 10 小時的內容,在自然中斷處分割一次 — 如果你在同一專案中連續上傳它們,我們會保持說話者 ID 一致。
02我得到一個轉錄稿還是編號部分資料夾?+
一個檔案。總是。DOCX、SRT、TXT 或 JSON — 你選擇。時間碼從 00:00:00 連續運行到錄音結束,不在每個分割邊界重置。
036 小時檔案需要多長時間才能回傳?+
大約 Pro 佇列 18-25 分鐘,Business 優先 8-12 分鐘。我們並行處理 12 分鐘分割,所以掛鐘時間按次線性方式與檔案長度縮放,不是逐分鐘。
04說話者 ID 始終保持一致嗎?+
是的。進行每個分割的說話者識別後,全局嵌入識別會對整個檔案中的語音進行聚類。第 487 分鐘的說話者 3 與第 12 分鐘的說話者 3 相同。這是 DIY Whisper 管道出問題的主要原因。
05如果我的上傳在 4 GB 檔案的第 3 小時掉線該怎麼辦?+
可恢復分割式上傳從最後完成的部分繼續。你不必重新上傳前 3 GB。在不穩定的飯店 Wi-Fi 和行動數據「共用」上運行 — 我們已測試兩者。
06為什麼 Whisper API 在長檔案上失敗?+
OpenAI 的 Whisper 端點有 25 MB 每請求的硬體限制 — 約 25 分鐘的壓縮音檔。任何更長的需要你分割、並行轉錄,然後自己拼接轉錄稿並對齊說話者。我們在伺服器端做所有這些。
0710 小時檔案上的每分鐘價格與 10 分鐘檔案相同嗎?+
是的。每分鐘 $0.03 固定,與長度無關。10 小時檔案成本 $18。我們不像 Rev 那樣對長檔案加收費用 ($1.50/分鐘人工 × 10 小時 = $900)。
08我可以得到章節標記或每小時時間碼嗎?+
在工作表單切換「小時標記」開啟,DOCX 匯出時每 60 分鐘有一個標題分割。SRT 保持連續時間碼。JSON 同時有 — 章節陣列加上字詞級時間碼。

放入你的長檔案。 取回單一轉錄稿。

每月 30 免費分鐘。無需信用卡。檔案最長 10 小時,始終一致的說話者標籤,單一檔案匯出。

免費開始