Transkripsi MP3 ke teks.Label pembicara, 100+ bahasa.

Letakkan file MP3 pada bitrate apa saja dari 64 hingga 320 kbps. Dapatkan transkripsi dengan cap waktu dan label pembicara dalam 99 bahasa — tanpa konversi format, tanpa pengkodean ulang, tanpa menunggu antrian.

Lepas audio atau video kamu di sini

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Rekam langsung dari browser

Pendaftaran cuma 30 detik — perekaman terbuka langsung setelahnya, di dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFile hapus otomatis dalam 24 jam

↓ Lihat hasil yang keluar

MP3 masuk. Transkripsi berdiarisasi keluar.

Kami membaca header frame MP3 langsung — VBR, CBR, joint-stereo, encoder apa pun (LAME, Fraunhofer, FFmpeg). Jika file adalah stereo asli dengan pembicara di saluran terpisah, kami menggunakannya untuk memisahkan suara. Penurunan mono kembali ke diarisasi akustik.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Transkripsi · streamingAkurasi 95%
S1

Jadi kapan Anda pertama kali menyadari arsip tidak lengkap?

S2

Mungkin sekitar 2019, ketika kami mulai mendigitalkan reel-to-reel.

S1

Dan kaset yang hilang — apakah mereka dikatalogkan di mana saja?

S2

Ada indeks kertas dari '78, tapi setengahnya rusak air.

95% pada stereo 192 kbpsSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tiga pilihan nyata · perbandingan jujur

Whisper lokal gratis. Otter atau Sonix. Atau kami.

Anda dapat menjalankan Whisper di laptop Anda sendiri gratis jika Anda teknis. Otter dan Sonix menerima unggahan MP3 di dalam dashboard berlangganan. Kami mengambil file, mengembalikan transkripsi, dan tidak membuat Anda hidup di dalam UI.

Option 01

Whisper lokal / open source

Gratis jika Anda punya GPU dan waktu luang setengah hari. Tidak ada diarisasi pembicara dari kotak.

SetupPython + CUDA + model 10 GB
Diarisasi pembicaraTidak termasuk (add-on pyannote)
Kecepatan · MP3 1 jam5–40 menit pada GPU konsumen
Bahasa99, tapi model kecil turun di bawah 80%
EksporTXT / SRT / VTT / JSON
BiayaGratis + listrik Anda
Best forEngineer yang sudah memiliki GPU, tidak perlu label pembicara, dan menginginkan privasi lokal penuh.
Option 02

Transcription.Solutions

Letakkan MP3. Dapatkan teks berlabel pembicara kembali dalam waktu nyata × 0,025.

SetupSeret dan lepas, tidak perlu akun untuk mencoba
Diarisasi pembicaraBuilt in (paket Pro & Business)
Kecepatan · MP3 1 jam~90 detik
Bahasa99, terdeteksi otomatis
EksporSRT · VTT · DOCX · TXT · JSON
Biaya · per menit$0,03
Best forSiapa saja dengan MP3 — tape jurnalis, podcast export, voice memo, dubbing arsip — yang hanya menginginkan teks akurat keluar dari ujung lain.
Option 03

Otter / Sonix

Dashboard yang dipoles, batas menit bulanan, disetel untuk bahasa Inggris. Unggahan file terasa seperti fitur sampingan.

SetupAkun + rencana berbayar
Diarisasi pembicaraAkustik, cenderung EN
Kecepatan · MP3 1 jam5–10 menit dalam antrian
BahasaOtter EN-saja; Sonix ~40
EksporTerkunci di belakang tier berbayar
Biaya$17+/bulan atau $10+/jam (Sonix)
Best forTim yang menginginkan editor transkripsi dan UI kolaborasi lebih dari alur bersih file→teks gaya API.

Harga dan ketersediaan fitur akurat per Mei 2026. Kinerja Whisper bervariasi menurut ukuran model dan perangkat keras.

Khusus untuk MP3

Tiga hal yang menggigit orang pada alat transkripsi generik.

MP3 adalah format, bukan gaya perekaman — yang berarti mode kegagalan berasal dari enkoder, bukan ucapan.

Apa yang salah

  1. 1Header VBR diparsing dengan salah. Beberapa alat membaca MP3 bitrate variabel sebagai bitrate tetap dan salah menghitung durasi — sidik jari waktu bergeser berkat menit selama file sejam.
  2. 2Joint-stereo diratakan menjadi mono selama preprocessing unggahan. Anda kehilangan pemisahan saluran per-pembicara yang sebenarnya ada di file.
  3. 3ID3 album art tertanam membuat beberapa uploader tersandung — mereka menolak file sebagai 'bukan audio murni' atau melepasnya dan mengkodekannya ulang, menjatuhkan kualitas lebih jauh.

Apa yang kami lakukan malah

  1. 1Kami menggunakan header Xing/LAME jika ada dan fallback penghitungan frame jika tidak. Sidik jari waktu VBR tetap akurat hingga ±0,1 detik di seluruh file multi-jam.
  2. 2Joint-stereo dan MP3 stereo asli didekode ke PCM L/R sebelum diarisasi. Jika pembicara Anda dipan, kami tetap membagi mereka.
  3. 3ID3v1, ID3v2, tag APE, art tertanam — semua dilewati tidak tersentuh. Kami tidak pernah mengkodekan MP3 Anda ulang.

Pengaturan pekerjaan yang disarankan untuk unggahan MP3

Default yang sesuai ~80% file MP3. Timpa per-pekerjaan dari formulir.

Decoder
Akurat frame, tidak ada pengkodean ulang
Diarisasi
Pemisahan saluran jika stereo, lainnya akustik
Model pembicara
Otomatis · 1-12 pembicara
Bahasa
Deteksi otomatis dari 30 detik pertama
Kata pengisi
Dihapus (toggle untuk menyimpan)
Bundel ekspor
DOCX + SRT + TXT bertanda waktu

Accuracy · real-world numbers

95%+ pada stereo 192 kbps. Dapat digunakan hingga 64 kbps mono.

Akurasi MP3 dibatasi oleh apa yang disimpan enkoder, bukan oleh kami. Kompresi persepsi di atas ~96 kbps mempertahankan kecerdasan ucapan dengan sangat baik; di bawah 64 kbps, sibilant dan konsonan mulai larut. Angka di bawah ini dari MP3 pelanggan nyata dalam produksi.

96%
320 kbps stereo, sumber studio

Hampir bebas kehilangan untuk ucapan. Master podcast, ekspor aplikasi dikto, rig wawancara profesional. Diarisasi bersih jika pembicara di saluran terpisah.

95%
192 kbps stereo, 2-3 pembicara

Bitrate paling umum untuk MP3 spoken-word. Ekspor Zoom, unduhan Riverside, standar perekam suara. Artefak kompresi tidak terdengar oleh pengenal.

91%
128 kbps mono, percakapan

Voice memo default pada sebagian besar ponsel. Diarisasi akustik menangani 2-4 pembicara. Angka dan nama diri kadang-kadang membutuhkan pandangan.

84%
64 kbps mono, arsip / dump telepon

Rips mesin penjawab lama, arsip kuliah, sumber narrow-band. Konsonan frekuensi tinggi (f/s/sh) blur. Masih dapat dibaca — rencanakan proofread.

Pertanyaan umum

8 hal yang ditanyakan orang tentang transkripsi MP3.

01Berapa bitrate MP3 minimum yang masih memberikan transkripsi yang dapat digunakan?+
64 kbps adalah lantai praktis. Di bawah itu, sibilant (s, sh, f) terkompresi menjadi noise dan word error rate mendaki melampaui 20%. Jika Anda merekam segar, targetkan 128 kbps mono atau 192 kbps stereo — apa pun yang lebih tinggi adalah berlebihan untuk ucapan.
02Apakah saya perlu mengonversi MP3 saya ke WAV terlebih dahulu?+
Tidak. Pengkodean ulang MP3 → WAV menambah akurasi nol karena data yang enkoder buang hilang selamanya. Unggah MP3 langsung. Kami mendekode frame dalam memori dan memberi makan PCM ke pengenal.
03Apakah MP3 stereo akan memberi saya label pembicara yang lebih baik daripada mono?+
Hanya jika pembicara benar-benar direkam di saluran terpisah — sebagian besar MP3 stereo memiliki audio yang sama di kedua sisi ('dual mono') dan tidak mendapatkan apa pun. Pemisahan saluran asli (misalnya ekspor Riverside, rig lapangan dua-mikrofon) memungkinkan kami melewati diarisasi akustik dan label pembicara hampir sempurna.
04Berapa ukuran file MP3 maksimal yang Anda terima?+
5 GB per unggahan, yang kira-kira 60 jam pada 192 kbps atau 90 jam pada 128 kbps. Jika file Anda lebih besar kami akan menunjukkan unggahan chunked — tidak perlu membaginya sendiri.
05Berapa lama transkripsi MP3 60 menit?+
Biasanya 90 detik dari unggahan lengkap hingga transkripsi siap, terlepas dari bitrate. Mendekode frame MP3 cepat; waktunya ada di pengenal. Diarisasi menambah 5-10 detik pada file multi-pembicara.
06MP3 saya memiliki musik latar belakang — apakah transkripsi akan rusak?+
Bed musik yang tenang di bawah ucapan tidak apa-apa. Musik keras yang bersaing dengan suara (stings intro, scoring di bawah wawancara) kadang-kadang memicu kesalahpahaman pada suku kata yang tumpang tindih. Aktifkan penekan musik di formulir pekerjaan untuk pra-filter.
07Bisakah Anda menangani MP3 yang dirip dari pesan suara ponsel atau mesin penjawab?+
Ya, meskipun ini sering kali 8 kHz narrow-band dikodekan ulang sebagai MP3 — plafon kualitas audio ditetapkan oleh penangkapan PSTN asli, bukan pembungkus MP3. Harapkan akurasi 78-85% pada sumber semacam itu, yang sama dengan yang kami dapatkan pada panggilan yang mendasarinya.
08Apakah Anda menyimpan MP3 saya setelah transkripsi selesai?+
File dihapus setelah 30 hari secara default, atau segera atas permintaan melalui dashboard. Transkripsi tetap di akun Anda sampai Anda menghapusnya. Kami tidak menggunakan audio pelanggan untuk melatih model apa pun — pernah.

Letakkan MP3 Anda. Dapatkan teks kembali dalam 90 detik.

30 menit gratis setiap bulan. Tidak perlu kartu. Label pembicara, 99 bahasa, setiap format ekspor disertakan.

Mulai gratis