ffmpeg + Whisper
免費、本地、操作繁瑣。你擁有整個流程及其每個漏洞。
直接放入 MP4 文件 — 我們在伺服器端提取音頻軌道,返回帶時間戳的��字稿,並提供可直接拖入 YouTube、Vimeo 或你的 NLE 的 SRT。
↓ 看看生成的內容
MP4 是容器 — 我們直接讀取音頻流,從不重新編碼視頻。時間戳在原始時間軸上保持幀精確,所以 SRT 在首次匯入時完全對齐。
好的,在這個模組中,我們要逐一走過退款工作流程。
開始前快速提問 — 這也適用於部分退款嗎?
好問題。部分退款使用相同的畫面,但是用不同的理由代碼。
明白了。核准門檻仍然是 200 美元嗎?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
三個真實選項 · 誠實比較
你可以自己提取音頻並執行 Whisper。你可以把 MP4 拖到 Descript 或 VEED 裡面,並待在他們的編輯器中。或者你可以把文件放在這裡,得到文字稿 + SRT,不受編輯器綁定。
免費、本地、操作繁瑣。你擁有整個流程及其每個漏洞。
放入 MP4。音頻提取、講者區分、SRT、摘要 — 單次完成。
將 MP4 載入編輯器。文字稿作為時間軸 UI 的一部分出現。
定價和功能上限約為 2026 年。Descript 和 VEED 方案名稱經常變化 — 查看他們的網站了解當前限制。
MP4 特有
MP4 是容器,不是編碼器 — 大多數轉錄工具把它當成一個大音頻塊。那就是漏洞的來源。
放入 MP4,這些預設會打開。每項工作從表單中覆蓋。
Accuracy · real-world numbers
MP4 準確度由麥克風決定,不是編碼器。安靜攝影棚中的領夾麥克風打敗配備車載音頻的 4K 攝像機每一次。下面的數字來自真實客戶的 MP4,按捕捉音頻的內容分類。
領夾或吊桿進入錄音機,48 kHz AAC 192+ kbps,處理過的房��。極限情況。在雙人錄製時講者標籤完美。
機頂麥克風距離講者 2-4 英尺。有些房間音但語音清晰。大多數 YouTube 創作者影片都在這一類。
OBS、Loom、Camtasia 匯出。麥克風很近但房間未處理,通常有系統音頻洩漏。對於教程文字稿來說相當不錯。
內置手機麥克風,有風聲或處理雜音,距離因鏡頭而異。詞語可用,每分鐘預期 1-2 處專有名詞修正。
常見問題