Whisper cục bộ / mã nguồn mở
Miễn phí nếu bạn có GPU và một buổi chiều. Không có diarization người nói ngay từ hộp.
Thả một tệp MP3 ở bất kỳ bitrate nào từ 64 đến 320 kbps. Nhận được bảng điểm có dấu thời gian và nhãn người nói trong 99 ngôn ngữ — không chuyển đổi định dạng, không mã hóa lại, không chờ đợi hàng đợi.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Xem các kết quả
Chúng tôi đọc MP3 frame headers trực tiếp — VBR, CBR, joint-stereo, bất kỳ bộ mã hóa nào (LAME, Fraunhofer, FFmpeg). Nếu tệp là stereo thực với những người nói trên các kênh riêng biệt, chúng tôi sử dụng điều đó để phân chia giọng nói. Hỗn hợp Mono quay trở lại diarization acoustic.
Vậy khi nào bạn nhận ra kho lưu trữ không đầy đủ?
Có lẽ vào năm 2019, khi chúng tôi bắt đầu số hóa các cuộn băng.
Và những cuộn băng còn thiếu — chúng có được lập danh mục ở bất cứ nơi nào không?
Có một chỉ mục giấy từ năm 78, nhưng nửa nó bị hư hỏng bởi nước.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Ba tùy chọn thực tế · so sánh trung thực
Bạn có thể chạy Whisper trên máy tính xách tay của mình miễn phí nếu bạn có kỹ thuật. Otter và Sonix chấp nhận tải lên MP3 bên trong bảng điều khiển đăng ký. Chúng tôi lấy tệp, trả lại bảng điểm và không khiến bạn phải sống bên trong giao diện người dùng.
Miễn phí nếu bạn có GPU và một buổi chiều. Không có diarization người nói ngay từ hộp.
Thả MP3. Nhận văn bản được gắn nhãn người nói trở lại gần như theo thời gian thực × 0,025.
Bảng điều khiển đánh bóng, giới hạn phút hàng tháng, điều chỉnh Tiếng Anh. Tải lên tệp cảm thấy như một tính năng bên.
Giá và tính khả dụng tính năng chính xác tính đến tháng 5 năm 2026. Hiệu suất Whisper khác nhau tùy theo kích thước mô hình và phần cứng.
Cụ thể cho MP3
MP3 là một định dạng, không phải một kiểu ghi âm — có nghĩa là các chế độ lỗi xuất phát từ bộ mã hóa, không phải lời nói.
Giá trị mặc định phù hợp với ~80% tệp MP3. Ghi đè mỗi công việc từ biểu mẫu.
Accuracy · real-world numbers
Độ chính xác MP3 bị giới hạn bởi những gì bộ mã hóa giữ lại, không phải bởi chúng tôi. Nén cảm nhận trên ~96 kbps bảo tồn khả năng hiểu lời nói rất tốt; dưới 64 kbps, sibilants và phụ âm bắt đầu tan biến. Những con số dưới đây là từ các MP3 khách hàng thực tế trong sản xuất.
Gần như không mất dữ liệu cho lời nói. Bản ghi podacst chính, xuất ứng dụng chính tả, các thiết bị ghi phỏng vấn chuyên nghiệp. Diarization sạch nếu những người nói trên các kênh riêng biệt.
Bitrate phổ biến nhất cho MP3 nói lời. Xuất Zoom, tải Riverside, các bộ ghi âm giọng nói mặc định. Hiện tượng nén không thể nghe được bằng công nhân nhận dạng.
Ghi âm giọng nói mặc định trên hầu hết các điện thoại. Diarization acoustic xử lý 2-4 người nói. Những con số và những cái tên riêng đôi khi cần nhìn.
Rips máy trả lời cũ, lưu trữ bài giảng, các nguồn dải hẹp. Các phụ âm tần số cao (f/s/sh) mờ. Vẫn có thể đọc — lên kế hoạch để kiểm tra lại.
Các câu hỏi phổ biến
30 phút miễn phí mỗi tháng. Không cần thẻ. Nhãn người nói, 99 ngôn ngữ, mọi định dạng xuất khẩu bao gồm.
Bắt đầu miễn phí