Transkripsi MP3 ke teks.Label pembicara, 100+ bahasa.

Lepaskan fail MP3 pada kadar bit mana-mana dari 64 hingga 320 kbps. Dapatkan transkrip bertanda masa dengan label pembicara dalam 99 bahasa — tiada penukaran format, tiada pengekodan semula, tiada menunggu dalam giliran.

Letak audio atau video anda

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Rakam terus dari pelayar anda

Daftar ambil 30 saat — rakaman buka terus selepas itu, dalam dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFail auto-padam dalam 24 jam

↓ Lihat apa yang keluar

MP3 masuk. Transkrip berdiarisasi keluar.

Kami membaca tajuk bingkai MP3 secara langsung — VBR, CBR, stereo-bersama, pengenkod mana-mana (LAME, Fraunhofer, FFmpeg). Jika fail itu adalah stereo tulen dengan pembicara pada saluran berasingan, kami menggunakannya untuk membahagikan suara. Penurunan mono kembali ke diarisasi akustik.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
dikesan secara automatik en-GB44.1 kHz · LAME 3.100
~90s
Transkrip · penstrimanKetepatan 95%
S1

Jadi bilakah anda sedar-akan bahawa arkib itu tidak lengkap?

S2

Mungkin sekitar 2019, apabila kami mula mendigitalkan gulungan-gulungan.

S1

Dan pita-pita yang hilang — adakah ia dicatat dalam katalog di mana-mana?

S2

Ada indeks kertas dari '78, tetapi separuhnya rosak air.

Ketepatan 95% pada 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tiga pilihan nyata · perbandingan jujur

Whisper setempat percuma. Otter atau Sonix. Atau kami.

Anda boleh menjalankan Whisper pada komputer riba anda sendiri percuma jika anda teknikal. Otter dan Sonix menerima muat naik MP3 dalam papan pemuka langganan. Kami mengambil fail, mengembalikan transkrip, dan tidak membuat anda tinggal di dalam UI.

Option 01

Whisper setempat / sumber terbuka

Percuma jika anda mempunyai GPU dan petang. Tiada diarisasi pembicara secara terkunci.

PenyediaanPython + CUDA + model 10 GB
Diarisasi pembicaraTidak disertakan (tambahan pyannote)
Kelajuan · 1 jam MP35–40 min pada GPU pengguna
Bahasa99, tetapi model kecil jatuh di bawah 80%
EksportTXT / SRT / VTT / JSON
KosPercuma + elektrik anda
Best forJurutera yang sudah memiliki GPU, tidak memerlukan label pembicara, dan mahukan privasi setempat penuh.
Option 02

Transcription.Solutions

Lepaskan MP3. Dapatkan teks berlabel pembicara kembali dalam masa nyata kira-kira × 0.025.

PenyediaanSeret-dan-lepaskan, tiada akaun diperlukan untuk mencuba
Diarisasi pembicaraDibina dalam (pelan Pro & Business)
Kelajuan · 1 jam MP3~90 saat
Bahasa99, dikesan secara automatik
EksportSRT · VTT · DOCX · TXT · JSON
Kos · per minit$0.03
Best forSesiapa sahaja dengan MP3 — pita wartawan, eksport podcast, memo suara, dub arkib — yang hanya mahu teks yang tepat keluar dari hujung yang lain.
Option 03

Otter / Sonix

Papan pemuka yang diperhalus, modal minit setiap bulan, dimasuki ke bahasa Inggeris. Muat naik fail terasa seperti ciri sampingan.

PenyediaanAkaun + pelan berbayar
Diarisasi pembicaraAkustik, EN-cenderung
Kelajuan · 1 jam MP35–10 min dalam giliran
BahasaOtter EN-sahaja; Sonix ~40
EksportDikunci di sengketa pelan berbayar
Kos$17+/bulan atau $10+/jam (Sonix)
Best forPasukan yang mahukan penyunting transkrip dan UI kolaborasi lebih daripada aliran gaya API fail→teks yang bersih.

Harga dan ketersediaan ciri tepat setakat Mei 2026. Prestasi Whisper berbeza mengikut saiz model dan perkakasan.

Khusus untuk MP3

Tiga perkara yang menggigit orang ramai pada alat transkripsi generik.

MP3 adalah format, bukan gaya rakaman — yang bermaksud mod kegagalan datang daripada pengenkod, bukan ucapan.

Apa yang salah

  1. 1Tajuk VBR tidak dihuraikan. Sesetengah alat membaca MP3 kadar bit berubah-ubah sebagai kadar tetap dan salah kira tempoh — cap masa terapung dengan minit dalam fail satu jam.
  2. 2Stereo-bersama diratakan kepada mono semasa pemprosesan pra-muat naik. Anda kehilangan pemisahan saluran per-pembicara yang sebenarnya ada dalam fail.
  3. 3Seni album ID3 terbenam mengelirukan beberapa pengunggah — mereka menolak fail sebagai 'bukan audio tulen' atau menanggalkannya dan mengenkod semula, menjatuhkan kualiti lebih jauh.

Apa yang kami buat sebaliknya

  1. 1Kami menggunakan tajuk Xing/LAME apabila ada dan sandaran kiraan bingkai apabila tidak. Cap masa VBR tetap tepat kepada ±0.1 s merentasi fail berbilang jam.
  2. 2MP3 stereo-bersama dan stereo tulen adalah disahkan kepada PCM L/R sebelum diarisasi. Jika pembicara anda disungkup asah, kami memastikan ia tetap terpecah.
  3. 3ID3v1, ID3v2, teg APE, seni terbenam — semua dilepaskan tanpa menyentuh. Kami tidak pernah mengenkod semula MP3 anda.

Tetapan pekerjaan yang disyorkan untuk muat naik MP3

Lalai yang sesuai ~80% fail MP3. Ganti setiap pekerjaan daripada borang.

Penyahkod
Telus ke bingkai, tiada pengekodan semula
Diarisasi
Pemisahan saluran jika stereo, atau akustik
Model pembicara
Auto · 1-12 pembicara
Bahasa
Pengesanan otomatis daripada 30 s pertama
Perkataan pengisi
Dibuang (togol untuk memastikan)
Bundel eksport
DOCX + SRT + TXT bertanda masa

Accuracy · real-world numbers

95%+ pada 192 kbps stereo. Boleh digunakan sehingga 64 kbps mono.

Ketepatan MP3 dibatasi oleh apa yang disimpan oleh pengenkod, bukan oleh kami. Pemampatan persepsi di atas ~96 kbps mengekalkan kebolehtahanan ucapan dengan sangat baik; di bawah 64 kbps, sibilant dan konsonan mula larut. Nombor di bawah adalah daripada MP3 pelanggan nyata dalam pengeluaran.

96%
320 kbps stereo, sumber studio

Hampir tidak hilang untuk ucapan. Induk podcast, eksport aplikasi ujaran, ruang wawancara profesional. Diarisasi bersih jika pembicara pada saluran berasingan.

95%
192 kbps stereo, 2-3 pembicara

Kadar bit paling biasa untuk MP3 perkataan lisan. Eksport Zoom, muat turun Riverside, perakam suara lalai. Artifak pemampatan tidak dapat dilihat kepada pengiktiraf.

91%
128 kbps mono, perbualan

Memo suara lalai pada kebanyakan telefon. Diarisasi akustik mengendalikan 2-4 pembicara. Nombor dan nama watak kadang-kadang memerlukan pandangan.

84%
64 kbps mono, arkib / telepon-longgokan

Rips mesin jawab lama, arkib kuliah, sumber jalur sempit. Konsonan frekuensi tinggi (f/s/sh) kabur. Masih boleh dibaca — rancang proofread.

Soalan biasa

8 perkara yang ditanya orang ramai tentang transkripsi MP3.

01Apakah kadar bit MP3 minimum yang masih memberikan transkrip yang boleh digunakan?+
64 kbps adalah lantai praktikal. Di bawah itu, sibilant (s, sh, f) dimampatkan menjadi bising dan kadar ralat kata mendaki meninggalkan 20%. Jika anda merakam segar, sasaran 128 kbps mono atau 192 kbps stereo — apa-apa yang lebih tinggi adalah berlebihan untuk ucapan.
02Adakah saya perlu menukar MP3 saya kepada WAV terlebih dahulu?+
Tidak. Pengekodan semula MP3 → WAV menambah ketepatan sifar kerana data yang dibuang pengenkod hilang untuk selamanya. Muat naik MP3 secara langsung. Kami menyahkod bingkai dalam memori dan memberi MP3 kepada pengiktiraf.
03Adakah stereo MP3 akan memberikan saya label pembicara yang lebih baik daripada mono?+
Hanya jika pembicara sebenarnya dirakam pada saluran berasingan — kebanyakan MP3 stereo mempunyai audio yang sama pada kedua-dua belah ('mono dwi') dan tidak memperoleh apa-apa. Pemisahan saluran tulen (cth. eksport Riverside, ruang dua mikrofon) membenarkan kami melangkau diarisasi akustik dan label pembicara hampir sempurna.
04Apakah saiz fail MP3 maksimum yang anda terima?+
5 GB setiap muat naik, iaitu kira-kira 60 jam pada 192 kbps atau 90 jam pada 128 kbps. Jika fail anda lebih besar kami akan menunjukkan muat naik potong — tiada perlu memisahkannya sendiri.
05Berapa lama masa yang diperlukan untuk mentranskripsi MP3 selama 60 minit?+
Biasanya 90 saat daripada muat naik selesai hingga transkrip siap, tanpa mengira kadar bit. Penyan decoding bingkai MP3 adalah cepat; masa adalah dalam pengiktiraf. Diarisasi menambah 5-10 saat pada fail berbilang pembicara.
06MP3 saya mempunyai muzik latar — adakah transkrip akan rosak?+
Muzik katil senyap di bawah ucapan adalah baik-baik saja. Muzik kuat yang bersaing dengan suara (stings intro, pemarkahan di bawah wawancara) kadang-kadang mencetuskan salah taraf pada suku kata bertindih. Togol supresi muzik pada borang pekerjaan untuk penyaring pra.
07Bolehkah anda mengendalikan MP3 yang dirip daripada suara peti mel telefon atau mesin jawab?+
Ya, walaupun ini sering 8 kHz jalur sempit dikodkan semula sebagai MP3 — siling kualiti audio ditetapkan oleh tangkapan PSTN asal, bukan pembungkus MP3. Jangkakan ketepatan 78-85% pada jenis sumber itu, yang sama dengan apa yang kami dapat pada panggilan asas.
08Adakah anda menyimpan MP3 saya selepas transkrip selesai?+
Fail dipadamkan selepas 30 hari secara lalai, atau segera atas permintaan melalui papan pemuka. Transkrip tetap dalam akaun anda sehingga anda memadamkannya. Kami tidak menggunakan audio pelanggan untuk melatih mana-mana model — pernah.

Lepaskan MP3 anda. Dapatkan teks kembali dalam 90 saat.

30 minit percuma setiap bulan. Tiada kad diperlukan. Label pembicara, 99 bahasa, setiap format eksport disertakan.

Mulai dengan percuma