Phiên âm MP3 thành văn bản.Nhãn người nói, 100+ ngôn ngữ.

Thả một tệp MP3 ở bất kỳ bitrate nào từ 64 đến 320 kbps. Nhận được bảng điểm có dấu thời gian và nhãn người nói trong 99 ngôn ngữ — không chuyển đổi định dạng, không mã hóa lại, không chờ đợi hàng đợi.

Thả audio hoặc video của bạn vào

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Ghi âm thẳng từ trình duyệt

Đăng ký mất 30 giây — ghi âm mở ra ngay sau đó, trong dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFile tự xoá sau 24h

↓ Xem các kết quả

MP3 vào. Bảng điểm diarized ra.

Chúng tôi đọc MP3 frame headers trực tiếp — VBR, CBR, joint-stereo, bất kỳ bộ mã hóa nào (LAME, Fraunhofer, FFmpeg). Nếu tệp là stereo thực với những người nói trên các kênh riêng biệt, chúng tôi sử dụng điều đó để phân chia giọng nói. Hỗn hợp Mono quay trở lại diarization acoustic.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
en-GB tự động phát hiện44.1 kHz · LAME 3.100
~90s
Bảng điểm · streaming95% độ chính xác
S1

Vậy khi nào bạn nhận ra kho lưu trữ không đầy đủ?

S2

Có lẽ vào năm 2019, khi chúng tôi bắt đầu số hóa các cuộn băng.

S1

Và những cuộn băng còn thiếu — chúng có được lập danh mục ở bất cứ nơi nào không?

S2

Có một chỉ mục giấy từ năm 78, nhưng nửa nó bị hư hỏng bởi nước.

95% trên stereo 192 kbpsSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Ba tùy chọn thực tế · so sánh trung thực

Whisper cục bộ miễn phí. Otter hoặc Sonix. Hoặc chúng tôi.

Bạn có thể chạy Whisper trên máy tính xách tay của mình miễn phí nếu bạn có kỹ thuật. Otter và Sonix chấp nhận tải lên MP3 bên trong bảng điều khiển đăng ký. Chúng tôi lấy tệp, trả lại bảng điểm và không khiến bạn phải sống bên trong giao diện người dùng.

Option 01

Whisper cục bộ / mã nguồn mở

Miễn phí nếu bạn có GPU và một buổi chiều. Không có diarization người nói ngay từ hộp.

Thiết lậpPython + CUDA + 10 GB mô hình
Diarization người nóiKhông bao gồm (phụ trợ pyannote)
Tốc độ · 1 giờ MP35–40 phút trên GPU người tiêu dùng
Ngôn ngữ99, nhưng mô hình nhỏ giảm xuống dưới 80%
Xuất khẩuTXT / SRT / VTT / JSON
Chi phíMiễn phí + điện của bạn
Best forKỹ sư đã sở hữu GPU, không cần nhãn người nói và muốn quyền riêng tư cục bộ hoàn toàn.
Option 02

Transcription.Solutions

Thả MP3. Nhận văn bản được gắn nhãn người nói trở lại gần như theo thời gian thực × 0,025.

Thiết lậpKéo và thả, không cần tài khoản để thử
Diarization người nóiTích hợp sẵn (các gói Pro & Business)
Tốc độ · 1 giờ MP3~90 giây
Ngôn ngữ99, tự động phát hiện
Xuất khẩuSRT · VTT · DOCX · TXT · JSON
Chi phí · mỗi phút$0.03
Best forBất kỳ ai có MP3 — băng ghi âm nhà báo, xuất podcast, ghi âm giọng nói, bản dub lưu trữ — người chỉ muốn văn bản chính xác ở đầu kia.
Option 03

Otter / Sonix

Bảng điều khiển đánh bóng, giới hạn phút hàng tháng, điều chỉnh Tiếng Anh. Tải lên tệp cảm thấy như một tính năng bên.

Thiết lậpTài khoản + gói được trả tiền
Diarization người nóiAcoustic, EN-leaning
Tốc độ · 1 giờ MP35–10 phút trong hàng đợi
Ngôn ngữOtter EN-only; Sonix ~40
Xuất khẩuBị khóa phía sau các tiers được trả tiền
Chi phí$17+/tháng hoặc $10+/giờ (Sonix)
Best forCác nhóm muốn trình chỉnh sửa bảng điểm và giao diện cộng tác hơn là dòng API-style tệp→văn bản sạch.

Giá và tính khả dụng tính năng chính xác tính đến tháng 5 năm 2026. Hiệu suất Whisper khác nhau tùy theo kích thước mô hình và phần cứng.

Cụ thể cho MP3

Ba điều cố gắng người dùng trên các công cụ phiên âm chung.

MP3 là một định dạng, không phải một kiểu ghi âm — có nghĩa là các chế độ lỗi xuất phát từ bộ mã hóa, không phải lời nói.

Điều gì có thể sai

  1. 1VBR headers bị phân tích sai. Một số công cụ đọc MP3 bitrate đa biến dưới dạng tỷ lệ cố định và sai tính toán thời lượng — dấu thời gian trôi dạt bởi phút trong một tệp dài một giờ.
  2. 2Joint-stereo bị làm phẳng thành mono trong xử lý tải lên trước. Bạn mất sự tách kênh cho mỗi người nói thực sự có trong tệp.
  3. 3Nghệ thuật album ID3 được nhúng trip một vài nhà tải lên — họ từ chối tệp là 'không phải âm thanh tinh khiết' hoặc tước nó và mã hóa lại, giảm chất lượng hơn nữa.

Chúng tôi làm gì thay thế

  1. 1Chúng tôi sử dụng Xing/LAME header khi có và dự phòng frame-count khi không. Dấu thời gian VBR vẫn chính xác để ±0,1 s trên các tệp nhiều giờ.
  2. 2MP3 joint-stereo và true-stereo được giải mã thành L/R PCM trước diarization. Nếu những người nói của bạn được panning, chúng tôi giữ chúng tách biệt.
  3. 3ID3v1, ID3v2, APE tags, nghệ thuật nhúng — tất cả đều được thông qua nguyên vẹn. Chúng tôi không bao giờ mã hóa lại MP3 của bạn.

Cài đặt công việc được đề xuất cho tải lên MP3

Giá trị mặc định phù hợp với ~80% tệp MP3. Ghi đè mỗi công việc từ biểu mẫu.

Decoder
Frame-chính xác, không mã hóa lại
Diarization
Chia kênh nếu stereo, khác là acoustic
Mô hình người nói
Tự động · 1-12 người nói
Ngôn ngữ
Tự động phát hiện từ 30 giây đầu tiên
Từ điền khoảng trống
Đã xóa (chuyển đổi để giữ)
Gói xuất khẩu
DOCX + SRT + TXT có dấu thời gian

Accuracy · real-world numbers

95%+ trên stereo 192 kbps. Có thể sử dụng xuống 64 kbps mono.

Độ chính xác MP3 bị giới hạn bởi những gì bộ mã hóa giữ lại, không phải bởi chúng tôi. Nén cảm nhận trên ~96 kbps bảo tồn khả năng hiểu lời nói rất tốt; dưới 64 kbps, sibilants và phụ âm bắt đầu tan biến. Những con số dưới đây là từ các MP3 khách hàng thực tế trong sản xuất.

96%
Stereo 320 kbps, nguồn studio

Gần như không mất dữ liệu cho lời nói. Bản ghi podacst chính, xuất ứng dụng chính tả, các thiết bị ghi phỏng vấn chuyên nghiệp. Diarization sạch nếu những người nói trên các kênh riêng biệt.

95%
Stereo 192 kbps, 2-3 người nói

Bitrate phổ biến nhất cho MP3 nói lời. Xuất Zoom, tải Riverside, các bộ ghi âm giọng nói mặc định. Hiện tượng nén không thể nghe được bằng công nhân nhận dạng.

91%
Mono 128 kbps, hội thoại

Ghi âm giọng nói mặc định trên hầu hết các điện thoại. Diarization acoustic xử lý 2-4 người nói. Những con số và những cái tên riêng đôi khi cần nhìn.

84%
Mono 64 kbps, lưu trữ / tình huống điện thoại

Rips máy trả lời cũ, lưu trữ bài giảng, các nguồn dải hẹp. Các phụ âm tần số cao (f/s/sh) mờ. Vẫn có thể đọc — lên kế hoạch để kiểm tra lại.

Các câu hỏi phổ biến

8 điều mà mọi người hỏi về phiên âm MP3.

01Bitrate MP3 tối thiểu để vẫn cung cấp bảng điểm có thể sử dụng được là gì?+
64 kbps là sàn thực tế. Dưới điều đó, sibilants (s, sh, f) nén thành tiếng gầm và tỷ lệ lỗi từ leo lên trên 20%. Nếu bạn ghi hình tươi, hãy nhắm tới mono 128 kbps hoặc stereo 192 kbps — bất cứ thứ gì cao hơn cũng quá mức cho lời nói.
02Tôi có cần chuyển đổi MP3 của mình thành WAV trước không?+
Không. Mã hóa lại MP3 → WAV không thêm độ chính xác vì dữ liệu bộ mã hóa bỏ đã biến mất vĩnh viễn. Tải lên MP3 trực tiếp. Chúng tôi giải mã các frame trong bộ nhớ và cấp PCM cho công nhân nhận dạng.
03Stereo MP3 sẽ cung cấp cho tôi nhãn người nói tốt hơn so với mono?+
Chỉ nếu những người nói thực sự được ghi trên các kênh riêng biệt — hầu hết MP3 stereo có âm thanh giống nhau trên cả hai bên ('dual mono') và không được lợi gì. True channel-split (ví dụ: xuất Riverside, hai lô phòng trường) cho phép chúng tôi bỏ qua diarization acoustic và gắn nhãn cho những người nói gần như hoàn hảo.
04Kích thước tệp MP3 tối đa bạn chấp nhận là gì?+
5 GB mỗi lần tải lên, tương đương khoảng 60 giờ ở 192 kbps hoặc 90 giờ ở 128 kbps. Nếu tệp của bạn lớn hơn, chúng tôi sẽ hiển thị tải lên được chia thành các phần — không cần phải chia nó thành từng phần.
05Mất bao lâu để phiên âm MP3 60 phút?+
Thường là 90 giây từ hoàn tất tải lên đến bảng điểm sẵn sàng, bất kể bitrate. Giải mã khung MP3 nhanh; thời gian nằm trong công nhân nhận dạng. Diarization thêm 5-10 giây trên các tệp nhiều người nói.
06MP3 của tôi có nhạc nền — bảng điểm sẽ bị hỏng?+
Âm nhạc giường yên tĩnh dưới lời nói là tốt. Nhạc lớn cạnh tranh với giọng nói (intro stings, scoring dưới các phỏng vấn) đôi khi kích hoạt sai nhận dạng trên các âm tiết chồng chéo. Chuyển đổi tác nhân dập tắt nhạc trên biểu mẫu công việc để lọc trước.
07Bạn có thể xử lý MP3s được xé từ hoạt động thoại điện thoại hoặc máy trả lời tự động không?+
Có, mặc dù những cái này thường là 8 kHz narrow-band được mã hóa lại thành MP3 — trần chất lượng âm thanh được đặt bởi bản ghi PSTN gốc, không phải trình bao MP3. Mong đợi 78-85% độ chính xác trên loại nguồn đó, đó là những gì chúng tôi sẽ nhận được trên cuộc gọi cơ bản.
08Bạn giữ MP3 của tôi sau khi hoàn tất bảng điểm không?+
Các tệp bị xóa sau 30 ngày theo mặc định, hoặc ngay lập tức theo yêu cầu qua bảng điều khiển. Bảng điểm vẫn nằm trong tài khoản của bạn cho đến khi bạn xóa nó. Chúng tôi không sử dụng audio khách hàng để đào tạo bất kỳ mô hình nào — bao giờ.

Thả MP3 của bạn. Nhận văn bản trở lại trong 90 giây.

30 phút miễn phí mỗi tháng. Không cần thẻ. Nhãn người nói, 99 ngôn ngữ, mọi định dạng xuất khẩu bao gồm.

Bắt đầu miễn phí