ລາຍອອກ MP3 ເປັນຂໍ້ຄວາມ.ປ້າຍລໍາພູ່, 100+ ພາສາ.

ວາງ ແຟ້ມ MP3 ໃນອັດຕາໃດໜຶ່ງ ຈາກ 64 ຫາ 320 kbps. ໄດ້ຮັບເອກະສານອ້າງອີງເວລາ ມີປ້າຍລໍາພູ່ ໃນ 99 ພາສາ — ບໍ່ຕ້ອງແປງຮູບແບບ, ບໍ່ຕ້ອງເຊີນໃໝ່, ບໍ່ຕ້ອງລໍາຕົວ.

ວາງໄຟລ໌ສຽງ ຫຼື ວິດີໂອຂອງເຈົ້າລົງມາ

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

ບັນທຶກໂດຍກົງຈາກບຣາວເຊີຂອງເຈົ້າ

ສະໝັກໃຊ້ເວລາ 30 ວິນາທີ — ການບັນທຶກເປີດທັນທີຫຼັງຈາກນັ້ນ, ໃນແດຊບອດ.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTໄຟລ໌ລົບອັດຕະໂນມັດໃນ 24 ຊມ.

↓ ເບິ່ງວ່າໄດ້ຫຍັງອອກມາ

MP3 ເຂົ້າ. ເອກະສານທີ່ໄດ້ຈັດລໍາພູ່ອອກ.

ພວກເຮົາອ່ານ ຫົວ MP3 ໂດຍກົງ — VBR, CBR, joint-stereo, encoder ໃດໜຶ່ງ (LAME, Fraunhofer, FFmpeg). ຖ້າວ່າແຟ້ມເປັນ stereo ທີ່ແທ້ຈິງ ມີລໍາພູ່ໃນຊ່ອງໂຊ່ວແຍກຕ່າງຫາກ, ພວກເຮົາໃຊ້ສິ່ງນັ້ນເພື່ອແບ່ງສຽງ. Mono mix-down ກັບຄືນເປັນ acoustic diarization.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
ຕັດສິນ en-GB ໂດຍອັດຕະ���ນມັດ44.1 kHz · LAME 3.100
~90s
ເອກະສານ · streamingຄວາມຖືກຕ້ອງ 95%
S1

ເມື່ອໃດທີ່ທ່ານເລີ່ມຮູ້ວ່າ archive ບໍ່ສົມບູນ?

S2

ອາດຈະປະມານ 2019, ເມື່ອພວກເຮົາເລີ່ມລາຍອອກ reel-to-reels.

S1

ແລະ ແຟ້ມທີ່ຫາຍໄປ — ມີການບັນທຶກໄວ້ບ່ໍ?

S2

ມີ index ເຈ້ຍລາຍລະອຽດ ຈາກ '78, ແຕ່ເຄິ່ງນຶ່ງຖືກນ້ໍາເສຍຫາຍ.

ຄວາມຖືກຕ້ອງ 95% ໃນ 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

ສາມທາງເລືອກທີ່ແທ້ຈິງ · ການປຽບທຽບທີ່ຊື່ສັດ

Whisper ຟຣີ. Otter ຫຼື Sonix. ຫຼື ພວກເຮົາ.

ທ່ານສາມາດເລີ່ມຕົ້ນ Whisper ໃນ laptop ຂອງທ່ານເອງ ຟຣີ ຖ້າທ່ານມີທັກສະ. Otter ແລະ Sonix ຍອມຮັບ MP3 ອັບໂຫລດ ໃນ dashboard ສະ subscription. ພວກເຮົາເອົາແຟ້ມ, ສົ່ງເອກະສານ, ແລະ ບໍ່ບັງຄັບໃຫ້ທ່ານອາໄສຢູ່ໃນ UI.

Option 01

Whisper local / open source

ຟຣີ ຖ້າທ່ານມີ GPU ແລະ ບ່າຍບາງໂມງ. ບໍ່ມີ speaker diarization ໂດຍຄົ່ນດຽວ.

ການຕັ້ງຄ່າPython + CUDA + ແບບ 10 GB
ການຈັດລໍາພູ່ບໍ່ລວມ (pyannote add-on)
ຄວາມໄວ · MP3 1 ຊົ່ວໂມງ5–40 ນາທີ ໃນ GPU consumer
ພາສາ99, ແຕ່ຕົວໜ້ອຍ ຕ່ໍາກວ່າ 80%
ExportTXT / SRT / VTT / JSON
ລາຄາຟຣີ + ໄຟຟ້າຂອງທ່ານ
Best forວິສະວະກອນ ທີ່ມີ GPU ແລ້ວ, ບໍ່ຕ້ອງປ້າຍລໍາພູ່, ແລະ ຕ້ອງການຄວາມເປັນສ່ວນຕົວຢ່າງເຕັມສ່ວນ.
Option 02

Transcription.Solutions

ວາງ MP3. ໄດ້ຮັບເອກະສານທີ່ມີປ້າຍລໍາພູ່ ເກືອບເວລາຈິງ × 0.025.

ການຕັ້ງຄ່າລາກແລະວາງ, ບໍ່ຕ້ອງບັນຊີເພື່ອລອງ
ການຈັດລໍາພູ່ສ້າງໄວ້ (ແຜນ Pro & Business)
ຄວາມໄວ · MP3 1 ຊົ່ວໂມງປະມານ 90 ວິນາທີ
ພາສາ99, ຕັດສິນໂດຍອັດຕະໂນມັດ
ExportSRT · VTT · DOCX · TXT · JSON
ລາຄາ · ຕໍ່ນາທີ$0.03
Best forຜູ້ໃດກໍ່ຕາມ ມີ MP3 — ບົດບັນທຶກວາງສື, podcast export, voice memo, archival dub — ອາກາດຕ້ອງການຂໍ້ຄວາມທີ່ຖືກຕ້ອງ ອອກມາ.
Option 03

Otter / Sonix

Dashboard ທີ່ເລື່ອມລ층, ສາຍເດືອນ cap, ສໍາລັບພາສາ English. ການອັບໂຫລດຟາຍ ຮູ້ສຶກເສມືອນວ່າເປັນລັກສະນະດ້ານຂ້າງ.

ການຕັ້ງຄ່າບັນຊີ + ແຜນຮ້າຍທາງສາຍ
ການຈັດລໍາພູ່Acoustic, ມີຄວາມໂອ້ຍກັນ EN
ຄວາມໄວ · MP3 1 ຊົ່ວໂມງ5–10 ນາທີ ໃນ queue
ພາສາOtter EN ຕໍ່ເທົ່ານັ້ນ; Sonix ປະມານ 40
Exportລັອກຫຼັງ paid tier
ລາຄາ$17+/ວ ຫຼື $10+/ຊົ່ວໂມງ (Sonix)
Best forທີມ ທີ່ຕ້ອງການ editor transcript ແລະ UI ຮ່ວມມືຫຼາຍກວ່າ ໄຟລ໌→ຂໍ້ຄວາມ API-style.

ລາຄາ ແລະ ຄວາມພ້ອມໃຈຂອງ feature ຖືກຕ້ອງ ປະມານ May 2026. ປະສິດຕິພາບ Whisper ແຕກຕ່າງກັນ ຕາມຂະໜາດ model ແລະ hardware.

ໂດຍສະເພາະ ກັບ MP3

ສາມສິ່ງ ທີ່ໄກ່ຜູ້ໃຊ້ ໃນ generic transcription tools.

MP3 ເປັນ format, ບໍ່ແມ່ນ recording style — ໂຄ, ທໍາ failure modes ມາ��າກ encoder, ບໍ່ແມ່ນ speech.

ສິ່ງທີ່ຜິດພາດ

  1. 1VBR headers ຖືກອ່ານຜິດ. ສາມຫຼາຍ tool ອ່ານ variable-bitrate MP3 ເປັນ fixed-rate ແລະ miscalculate duration — timestamps ລອຍໄປໄກ ຈາກ minute ໃນ hour-long file.
  2. 2Joint-stereo ຖືກ flatten ເປັນ mono ໃນ upload preprocessing. ທ່ານສູນເສຍ per-speaker channel separation ທີ່ຕົວຈິງ ແຕ່ໃນ file.
  3. 3Embedded ID3 album art ແລກ uploaders ບາງບົ່ວ — ພວກເຂົາປະຕິເສດ file ເປັນ 'ບໍ່ pure audio' ຫຼື strip ມັນ ແລະ re-encode, ຫຼຸດ quality ເພີ່ມ.

ສິ່ງທີ່ພວກເຮົາເຮັດແທນ

  1. 1ພວກເຮົາໃຊ້ Xing/LAME header ເມື່ອຢູ່ໄປ ແລະ frame-count fallback ບໍ່ແມ່ນ. VBR timestamps ຍັງເປັນ accurate ເປັນ ±0.1 s ໃນ multi-hour files.
  2. 2Joint-stereo ແລະ true-stereo MP3 ເປັນ decoded ເປັນ L/R PCM ກ່ອນ diarization. ຖ້າວ່າ speaker ຂອງທ່ານ ໄດ້ panned, ພວກເຮົາ keep ພວກມັນ split.
  3. 3ID3v1, ID3v2, APE tags, embedded art — ທັງຫມົດ passed through untouched. ພວກເຮົາບໍ່ຜ່ຜຸ່ນ re-encode MP3 ຂອງທ່ານ.

ການຕັ້ງຄ່���ວຽກ ແນະນໍາ ສໍາລັບ MP3 uploads

Default ທີ່ fit ປະມານ 80% ຂອງ MP3 files. Override per-job ຈາກ form.

Decoder
Frame-accurate, ບໍ່ re-encode
ການຈັດລໍາພູ່
Channel split ຖ້າ stereo, ອື່ນ acoustic
Speaker model
Auto · 1-12 speakers
ພາສາ
Auto-detect ຈາກ 30 s ທໍາອິດ
ຄໍາຕື່ມ
ຖືກລຸບ (toggle ເພື່ອ keep)
ພຣີລາກ export
DOCX + SRT + timestamped TXT

Accuracy · real-world numbers

95%+ ໃນ 192 kbps stereo. ຕໍ່ເນື່ອງໃຊ້ໄດ້ ລົງໄປ 64 kbps mono.

ຄວາມຖືກຕ້ອງ MP3 ຖືກຜູກມັດ ໂດຍ ສິ່ງທີ່ encoder ຮັກສາໄວ້, ບໍ່ແມ່ນໂດຍພວກເຮົາ. ການບີບອັດ perceptual ຂ້າງເທິງ ປະມານ 96 kbps ຮັກສາ speech intelligibility ໍ່ຫຼາຍ; ຕ່ໍາກວ່າ 64 kbps, sibilants ແລະ consonants ເລີ່ມລະລາຍ. ຕົວເລ��� ລຸ່ມນີ້ ມາຈາກ customer MP3 ທີ່ແທ້ຈິງ ໃນ production.

96%
320 kbps stereo, studio source

ກາບໃກ້ lossless ສໍາລັບ speech. Podcast master, dictation app exports, interview rig ວິສະວະກຳ. Diarization ສະອາດ ຖ້າວ່າ speaker ຢູ່ໃນ channel ແຍກຕ່າງຫາກ.

95%
192 kbps stereo, 2-3 speakers

ອັດຕາບິດທົ່ວໄປທີ່ສຸດ ສໍາລັບ spoken-word MP3. Zoom exports, Riverside downloads, voice recorder default. ສິ່ງປະດິດ compression ບໍ່ໄດ້ຍິນ ໂດຍ recognizer.

91%
128 kbps mono, conversational

Voice memo default ໃນ phone ສ່ວນຫຼາຍ. Acoustic diarization ຈັດການ 2-4 speakers. ຕົວເລກ ແລະ ຊື່ເພື່ອຕົວ ບາງຄັ້ງ ຕ້ອງການ glance.

84%
64 kbps mono, archival / phone-dump

ປະໂຫຍກກ່ົາວເກົ່າ answering-machine, lecture archives, narrow-band sources. ສຽງ consonant ຄວາມຖີ່ສູງ (f/s/sh) ມົວ. ຍັງສາມາດອ່ານໄດ້ — ວາງແຜນ proofread.

ຄໍາຖາມທົ່ວໄປ

8 ສິ່ງ ທີ່ຜູ້ໃຊ້ຖາມ ກ່ຽວກັບ MP3 transcription.

01ອັດຕາ MP3 ຕ່ໍາສຸດ ທີ່ຍັງໃຫ້ transcript ທີ່ສາມາດໃຊ້ໄດ້ ແມ່ນຫຍັງ?+
64 kbps ເປັນພື້ນຖານທີ່ປະຕິບັດໄດ້. ຕ່ໍາກວ່ານັ້ນ, sibilants (s, sh, f) compress ເປັນ noise ແລະ word error rate ປີນ ຜ່ານ 20%. ຖ້າທ່ານບັນທຶກໃໝ່, ເປົ້າຫມາຍ 128 kbps mono ຫຼື 192 kbps stereo — ໃດໜຶ່ງສູງກວ່າ ເກີນຄວາມຕ້ອງການ ສໍາລັບ speech.
02ຂ້ອຍຕ້ອງແປງ MP3 ເປັນ WAV ກ່ອນບໍ?+
ບໍ່. Re-encoding MP3 → WAV ເພີ່ມ ຄວາມຖືກຕ້ອງ ເດັກເສື້ອຟ້າ ເພາະວ່າ ຂໍ້ມູນ ທີ່ encoder ຫຼຸດໄປ ເຊົາໍ່ສຽວ ຕໍ່ໄປ. ອັບໂຫລດ MP3 ໂດຍກົງ. ພວກເຮົາ decode frame ໃນ memory ແລະ feed PCM ເປັນ recognizer.
03MP3 stereo ຈະໃຫ້ໃຈຕ່ໍາພູ່ speaker ດີກວ່າ mono ບໍ?+
ພຽງແຕ່ ຖ້າວ່າ speaker ທີ່ຕົວຈິງ ໄດ້ບັນທຶກ ວ່າ channel ແຍກຕ່າງຫາກ — ສ່ວນຫຼາຍ stereo MP3 ມີ ສຽງດຽວກັນ ທັງສອງອົກ ('dual mono') ແລະ gain ບໍ່ມີຫຍັງ. True channel-split (ຕົວຢ່າງ Riverside exports, two-mic field rigs) ໃຫ້ພວກເຮົາ skip acoustic diarization ແລະ label speakers ໃກ້ຮຸ້ວລ줄້ຽง.
04ຂະໜາດ MP3 file ສູງສຸດ ທີ່ທ່ານ accept ແມ່ນຫຍັງ?+
5 GB ຕໍ່ upload, ເຊິ່ງ ປະມານ 60 ຊົ່ວໂມງ ທີ່ 192 kbps ຫຼື 90 ຊົ່ວໂມງ ທີ່ 128 kbps. ຖ້າ file ຂອງທ່ານໃຫຍ່ກວ່າ ພວກເຮົາຈະສະແດງ chunked upload — ບໍ່ຕ້ອງ split ມັນເອງ.
05MP3 60 ນາທີຈະລາຍອອກ ໃຊ້ເວລາດົນໂພ?+
ປົກະຕິ 90 ວິນາທີ ຈາກ upload-complete ເປັນ transcript-ready, ບໍ່ສົນ ອັດຕາບິດ. Decoding MP3 frame ໄວ;ເວລາ ໃນ recognizer. Diarization ເພີ່ມ 5-10 ວິນາທີ ໃນ multi-speaker files.
06MP3 ຂອງຂ້ອຍ ມີ background music — transcript ຈະໄດ້ເສຍໄປບໍ?+
Quiet bed music ພາຍໃຕ້ speech ໜຽບໂอ. Loud music ທີ່ຊະງານລົ້ວ voice (intro stings, scoring under interviews) ບາງຄັ້ງ trigger misrecognitions ໃນ overlapping syllables. Toggle music suppression ໃນ job form ເພື່ອ pre-filter.
07ທ່ານສາມາດຈັດການ MP3 ripped ຈາກ phone voicemail ຫຼື answering machines ບໍ?+
ແມ່ນແລ້ວ, ໂຕກໍ່ເສມືອນວ່າ 8 kHz narrow-band re-encoded ເປັນ MP3 — ພື້ນຜິວ ຄວາມຕໍ່າ ອາວາສ ຖືກກໍານົດ ໂດຍຕົວຈິງ PSTN capture, ບໍ່ MP3 wrapper. count 78-85% accuracy ໃນ source, ທີ່ຄືກັບ ອັນທີ່ພວກເຮົາ ໄດ້ທີ່ຂໍ້ມູນ call.
08ທ່ານ keep MP3 ຂອງຂ້ອຍ ຫຼັງຈາກ transcript ຈົບບໍ?+
File ຖືກ ລົບ ຫຼັງ 30 ວັນ ໂດຍ default, ຫຼື ໄວ ເພື່ອ request ໂດຍ dashboard. Transcript ຢູ່ໃນ account ຈົນກວ່າທ່ານ ລົບມັນ. ພວກເຮົາບໍ່ໃຊ້ customer audio ເພື່ອ train ທຸກ model — ບໍ່ເລີຍ.

ວາງ MP3 ຂອງທ່ານ. ໄດ້ຮັບຂໍ້ຄວາມ ເວັ້ນ 90 ວິນາທີ.

ຟຣີ 30 ນາທີ ທຸກໆເດືອນ. ບໍ່ຕ້ອງບັດ. ປ້າຍລໍາພູ່, 99 ພາສາ, ທຸກ export format ລວມ.

ເລີ່ມຟຣີ