Chuyển đổi file WAV sang văn bản với nhãn người nói.Chất lượng không mất dữ liệu.

Tải một file ghi WAV trực tiếp từ thiết bị cầm tay, bounce DAW, hoặc bộ kit phỏng vấn của bạn. Chúng tôi giữ nguyên 24-bit headroom, chạy phân biệt người nói trên PCM thô, và trả lại bản ghi chép có dấu thời gian với SRT trong vài phút.

Thả audio hoặc video của bạn vào

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Ghi âm thẳng từ trình duyệt

Đăng ký mất 30 giây — ghi âm mở ra ngay sau đó, trong dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFile tự xoá sau 24h

↓ Xem kết quả ra sao

PCM thô vào. Bản ghi chép sạch ra.

WAV không mất dữ liệu có nghĩa là mỗi âm sibilant, plosive, và từ yếu đều được giữ nguyên — không bị mờ MP3 trên các phụ âm. Nếu file có nhiều track (một người nói trên mỗi kênh), chúng tôi bỏ qua phân biệt người nói dựa trên âm thanh và chia dựa trên bố cục kênh.

WAV · 48 kHz / 24-bitREC 2 tracks · 1h 12m · 743 MB
auto-detected en-GBstereo PCM · uncompressed
~90s
Bản ghi chép · phát trực tuyến97% độ chính xác
S1

Đưa tôi quay lại buổi sáng năm bảy mươi tám — cuộc gọi đến lúc mấy giờ?

S2

Khoảng năm giờ kém mười lăm phút. Ấm đang bật, tôi nhớ là thế.

S1

Và từ đó bạn lái xe thẳng xuống bến cảng?

S2

Thẳng tới xưởng tàu. Đèn vẫn sáng khi tôi vào.

97% trên WAV từng trackSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Ba lựa chọn thực tế · so sánh trung thực

Adobe Audition. Descript. Hoặc chúng tôi.

Speech to Text của Audition được đi kèm với Creative Cloud và ở lại bên trong dòng thời gian. Descript nhập WAV vào trình chỉnh sửa của nó. Chúng tôi nhận file như hiện tại, trả lại các xuất chuẩn, và không yêu cầu bạn di chuyển dự án của bạn đến bất kỳ đâu.

Option 01

Adobe Audition / Premiere

Bảng điều khiển bản ghi chép trong dòng thời gian Adobe. Được liên kết với Creative Cloud và file dự án.

Yêu cầuĐăng ký Creative Cloud
Phân biệt người nóiCó, chỉ hỗ trợ hỗn hợp
WAV nhiều trackĐược san phẳng trước STT
XuấtSRT · CSV · XML
Ngôn ngữ18, chọn thủ công
Chi phí~$23/tháng (ứng dụng đơn)
Best forBiên tập viên đang cắt trong Premiere hoặc Audition muốn chèn phụ đề vào dòng thời gian.
Option 02

Transcription.Solutions

Tải file WAV. Phân biệt người nói từng kênh nếu là đa track. Xóa file gốc trong 24h.

Yêu cầuKhông có gì — chỉ là file
Phân biệt người nóiTừng track hoặc dựa trên âm thanh
WAV nhiều trackLên tới 16 kênh
XuấtSRT · VTT · DOCX · TXT · JSON
Ngôn ngữ99, tự động phát hiện
Chi phí · mỗi phút$0.03
Best forBất kỳ ai có file WAV thô — người ghi âm cầm tay, podcaster bounce từ DAW, nhà lưu trữ lịch sử nói, nhà nghiên cứu.
Option 03

Descript

Nhập WAV của bạn vào trình chỉnh sửa Descript. Mạnh mẽ, nhưng bạn phải làm việc bên trong nó.

Yêu cầuTài khoản Descript + nhập
Phân biệt người nóiDựa trên âm thanh, được điều chỉnh EN
WAV nhiều trackNhập thành các clip riêng biệt
XuấtTXT · SRT · DOCX
Ngôn ngữ23, độ chính xác thay đổi
Chi phí$16–24/user/mo
Best forBiên tập viên podcast muốn chỉnh sửa âm thanh bằng cách chỉnh sửa bản ghi chép — siêu năng lực thực sự của Descript.

Giá chính xác tính đến 2026. Các tính năng Adobe và Descript thay đổi thường xuyên; kiểm tra tài liệu hiện tại trước khi cam kết.

Dành riêng cho WAV

Ba điều làm phiền mọi người với các công cụ chuyển đổi chung.

Hầu hết các bộ tải im lặng giảm mẫu WAV của bạn trước khi gửi tới trình nhận dạng. Chúng tôi không.

Những gì sai lầm

  1. 1WAV nhiều track bị san phẳng. Một bản ghi 4 kênh từ Sound Devices MixPre được trộn thành mono trước STT. Sự tách riêng từng microphone mà bạn đã trả tiền bị loại bỏ.
  2. 2các WAV 32-bit float từ Zoom F-series hoặc MixPre bị từ chối hoàn toàn, hoặc bị cắt thành 16-bit và mất khả năng phục hồi headroom.
  3. 3các phỏng vấn 96 kHz / 24-bit mất vô số thời gian tải lên vì công cụ mã hóa lại thành MP3 trong trình duyệt trước khi gửi.

Những gì cần đúc kết ở đây

  1. 1Tải lên WAV nhiều track như hiện tại (lên tới 16 kênh). Chúng tôi đọc bố cục kênh từ tiêu đề WAV và gán một người nói trên mỗi track — không đoán dựa trên âm thanh.
  2. 232-bit float được chấp nhận natively. Chúng tôi giữ lại headroom float khi chuẩn hóa cho trình nhận dạng, vì vậy các đỉnh cao trên 0 dBFS không bị cắt.
  3. 3Tải lên nhị phân trực tiếp, không transcode trong trình duyệt. Một WAV 2 GB di chuyển ở băng thông toàn bộ của bạn và bắt đầu xử lý ngay khi byte cuối cùng đến.

Cài đặt công việc được đề xuất cho WAV

Tải WAV và các cài đặt này bật theo mặc định. Ghi đè từng công việc từ biểu mẫu.

Tốc độ mẫu
Native (không giảm mẫu)
Độ sâu bit
24-bit / 32-float được bảo tồn
Phân biệt người nói
Từng kênh nếu đa track
Mô hình người nói
Phỏng vấn · 2-8 người nói
Từ chứa đầy
Được giữ lại (tắt nếu cần)
Xuất
DOCX · SRT · TXT có dấu thời gian

Accuracy · real-world numbers

97%+ trên WAV từng track. WAV cung cấp cho trình nhận dạng tín hiệu sạch nhất có thể.

Vì WAV lưu trữ PCM thô mà không nén cảm nhận, các phụ âm và âm sibilant không bị mờ theo cách MP3 làm mờ chúng. Trình nhận dạng nghe thấy những gì microphone đã nghe. Các con số dưới đây đến từ các công việc WAV của khách hàng thực tế trong sản xuất.

98%
WAV Studio · người nói đơn

48 kHz / 24-bit, condenser màng lớn, phòng xử lý. Lời tường thuật, sách nói, công việc dubbing đến đây.

96%
WAV phỏng vấn nhiều track

Một kênh trên mỗi người nói (lav hoặc boundary mic). Phân biệt người nói chỉ là định tuyến kênh — lỗi chỉ là văn bản.

92%
Máy ghi âm cầm tay

Zoom H5, Tascam DR-40, tương tự. Bộ thu stereo XY, 2-3 người nói, có phản xạ phòng. Hầu hết WAV podcast đến đây.

85%
WAV cầm tay môi trường ồn ào

Ngoài trời, quán cà phê, phương tiện. Ghi không mất dữ liệu giúp — tiếng ồn là thực, không phải hiện vật codec — nhưng độ chính xác vẫn giảm khi có tiếng nói chồng lấp.

Các câu hỏi thường gặp

8 điều mọi người hỏi về chuyển đổi WAV.

01Kích thước file WAV tối đa là bao nhiêu?+
5 GB trên file đối với gói tiêu chuẩn, tương đương khoảng 8 giờ stereo 48 kHz / 24-bit, hoặc 2,5 giờ 96 kHz / 24-bit. Các file lớn hơn cũng được với gói team — chỉ cần liên hệ chúng tôi trước khi tải lên.
02Bạn có hỗ trợ WAV 32-bit float từ Zoom F-series hoặc MixPre không?+
Có, natively. Chúng tôi đọc các mẫu float mà không cắt ở 0 dBFS, vì vậy các transient to mà bạn dự định kéo xuống trong post vẫn được chuyển đổi sạch sẽ. Hầu hết các bộ tải chung im lặng chuyển đổi xuống 16-bit trước.
03Tôi có một WAV 4 kênh từ máy ghi âm cầm tay — một microphone trên mỗi người. Phân biệt người nói có sử dụng điều đó không?+
Có. Tải lên WAV đa âm trực tiếp (đừng bounce sang stereo trước). Chúng tôi phân tích bố cục kênh từ tiêu đề WAV và gán một người nói trên mỗi track — đáng tin cậy hơn nhiều so với phân biệt người nói dựa trên âm thanh trên những giọng tương tự.
04Bạn có giảm mẫu WAV 96 kHz của tôi không?+
Trình nhận dạng chạy ở 16 kHz nội bộ — đó là giới hạn của khả năng hiểu được tiếng nói của con người. Nhưng chúng tôi giữ file gốc của bạn không thay đổi và sử dụng nó cho bất kỳ xử lý sau nào như gating tiếng ồn. Các xuất của bạn tham chiếu dòng thời gian gốc.
05WAV có thực sự chính xác hơn MP3 cho chuyển đổi không?+
Một chút, có — thường là 1-2 điểm WER trên tiếng nói sạch. Khoảng cách lớn hơn xuất hiện trên các âm sibilant và đoạn yên tĩnh, nơi nén psychoacoustic MP3 loại bỏ thông tin mà trình nhận dạng sẽ sử dụng. Đối với công việc lưu trữ hoặc pháp y, WAV là lựa chọn đúng.
06Metadata BWF và timecode có được bảo tồn không?+
Chúng tôi đọc các khối BWF (bext, iXML) và sử dụng timecode bắt đầu để căn chỉnh bản ghi chép với dòng thời gian phiên của bạn. WAV gốc không bao giờ được sửa đổi — chúng tôi làm việc trên một bản sao được xóa trong 24h.
07Tôi có thể tải một thư mục các file WAV từ xuất phiên DAW không?+
Có. Tải lên hàng loạt chấp nhận tối đa 50 file cùng một lúc. Mỗi WAV có công việc riêng và bản ghi chép riêng. Nếu chúng là stems từ một phiên, bạn cũng có thể hợp nhất chúng thành một WAV đa track duy nhất trước khi tải lên và chúng tôi sẽ phân biệt người nói từng kênh.
08Một WAV stereo 1 giờ thực sự mất bao lâu?+
Tải lên là phần chậm nhất — một WAV stereo 48 kHz / 24-bit 1 giờ là khoảng 600 MB và mất 2-5 phút trên broadband thông thường. Sau khi tải lên, chuyển đổi chính nó chạy trong khoảng 4-6 phút trên hàng đợi tiêu chuẩn.

Tải WAV của bạn. Giữ chất lượng không mất dữ liệu. Xem kết quả ra sao.

30 phút miễn phí mỗi tháng. Không cần thẻ. Phân biệt người nói từng track, 32-bit float được hỗ trợ, âm thanh gốc được xóa trong 24h.

Bắt đầu miễn phí