ឆ្លងកាត់ MP3 ទៅអត្ថបទ។ស្លាក អ្នកនិយាយ, ភាសា 100+។

ទម្លាក់ ឯកសារ MP3 នៅ bitrate ណាក៏ដោយចាប់ពី 64 ដល់ 320 kbps។ ទទួលបាន transcript ដែលមាន timestamp និង speaker labels នៅ ភាសា 99 — គ្មាន format conversion, គ្មាន re-encoding, គ្មាន ការរង់ចាំក្នុង queue។

ទម្លាក់សំឡេង ឬវីដេអូរបស់អ្នក

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

ថតផ្ទាល់ពី browser របស់អ្នក

ចុះឈ្មោះត្រឹម ៣០ វិនាទី — បន្ទាប់មកការថតបើកភ្លាមនៅក្នុង dashboard។

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTឯកសារលុបស្វ័យប្រវត្តិក្នុង ២៤ ម៉ោង

↓ មើលលទ្ធផល

MP3 ចូល។ Diarized transcript ចេញ។

យើ្ងអាន MP3 frame headers ដោយផ្ទាល់ — VBR, CBR, joint-stereo, encoder ណាក៏ដោយ (LAME, Fraunhofer, FFmpeg)។ ប្រសិនបើឯកសារគឺ true stereo ដែលមាន speakers នៅ channels ខុសៗគ្នា, យើ្ងប្រើរឿងនេះដើម្បីបែងចែក voices។ Mono mix-down ធ្វើឱ្យវិលត្រឡប់ទៅ acoustic diarization។

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Transcript · streamingភាពត្រឹមត្រូវ 95%
S1

ដូច្នេះ តើពេលណាដែលអ្នក​ដឹង​ថា archive មិនពេញលេញ?

S2

ប្រហែលនៅឆ្នាំ 2019, នៅពេលដែលយើ្ងចាប់ផ្តើម digitizing reel-to-reels។

S1

ហើយ tapes ដែលបាត់ — តើវាត្រូវបាននៅលើក្តីគណនាកន្លែងណាក៏ដោយឬ?

S2

មាន paper index ពីឆ្នាំ '78, ប៉ុន្តែពាក់ក្នុងមួយវិនាទីវាស្ថិតក្នុងស្ថានភាព damage ដោយទឹក។

95% នៅលើ 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

ជម្រើស ពិតប្រាកដ 3 · ការប្រៀបធៀប ស្មោះត្រង់

Whisper free local។ Otter ឬ Sonix។ ឬ យើ្ង។

អ្នកអាចដំណើរការ Whisper នៅលើ laptop ផ្ទាល់ខ្លួនឥតគិតថ្លៃ ប្រសិនបើអ្នកមានបច្ចេកទេស។ Otter និង Sonix ទទួលយក MP3 uploads ក្នុង subscription dashboards។ យើ្งយក file, ត្រឡប់ transcript, ហើយមិនធានាឱ្យអ្នក ស្នាក់នៅក្នុង UI។

Option 01

Whisper local / open source

ឥតគិតថ្លៃ ប្រសិនបើអ្នកមាន GPU និងពេលថ្ងៃ។ គ្មាន speaker diarization ពីក្នុងប្រអប់។

SetupPython + CUDA + 10 GB models
Speaker diarizationមិនរួមបញ្ចូល (pyannote add-on)
ល្បឿន · 1 ម៉ោង MP35–40 នាទីន���លើ consumer GPU
ភាសា99, ប៉ុន្តែ tiny model ធ្លាក់ ក្រោម 80%
រីកចម្លងTXT / SRT / VTT / JSON
រូបិយប័ណ្ណឥតគិតថ្លៃ + អគ្គិសនីរបស់អ្នក
Best forវិស្វករ ដែលមាន GPU រួចហើយ, មិនត្រូវការ speaker labels, និងចង់បាន full local privacy។
Option 02

Transcription.Solutions

ទម្លាក់ MP3។ ទទួលបាន speaker-labeled text ត្រឡប់មកវិញក្នុងពេលវេលា ដែលជិតដូចជា real-time × 0.025

SetupDrag-and-drop, គ្មាន account សាកល្បង
Speaker diarizationរាប់បញ្ចូល (Pro & Business plans)
ល្បឿន · 1 ម៉ោង MP3~90 វិនាទី
ភាសា99, auto-detected
រីកចម្លងSRT · VTT · DOCX · TXT · JSON
រូបិយប័ណ្ណ · នៅលើ នាទី$0.03
Best forមនុស្សម្នាក់ដែលមាន MP3 — tape ដែលសាក្សី, podcast export, voice memo, archival dub — ដែលគ្រាន់តែចង់បាន accurate text ចេញមកម្ខាង។
Option 03

Otter / Sonix

Dashboard ក្រិតគ្រាប់, ដែនកំណត់ម៉ោងប្រចាំខែ, English-tuned។ File upload មាន احساس ដូចជា side feature។

SetupAccount + paid plan
Speaker diarizationAcoustic, EN-leaning
ល្បឿន · 1 ម៉ោង MP35–10 នាទីក្នុង queue
ភាសាOtter EN-only; Sonix ~40
រីកចម្លងLocked ក្រោយ paid tiers
រូបិយប័ណ្ណ$17+/ខែ ឬ $10+/ម៉ោង (Sonix)
Best forTeams ដែលចង់បាន transcript editor និង collaboration UI ច្រើនជាង clean API-style file→text flow។

ថ្លៃលើកលែង និង feature availability ត្រឹមត្រូវដូច្នេះ ខែឧសភា 2026។ ការងារ Whisper ខុសគ្នា ដោយ model size និង hardware។

ពិសេស ទៅលើ MP3

រឿង ៣ ដែលក្រៀមប្រឹង ក្នុងការ generic transcription tools។

MP3 គឺ ទម្រង់, មិនមែន recording style — ដែលមានន័យថា failure modes មក ពី encoder, មិនមែន speech។

អ្វីដែលបង្ក្រមក

  1. 1VBR headers ត្រូវបាន mis-parsed។ ឧបករណ៍មួយចំនួន អាន variable-bitrate MP3s ដូចជា fixed-rate ហើយ miscalculate រយៈពេល — timestamps ដើរបង្វែល ដោយ នាទីលើ hour-long file។
  2. 2Joint-stereo ត្រូវបាន flattened ទៅ mono ក្នុង upload preprocessing។ អ្នក បាត់បង់ per-speaker channel separation ដែលពិតប្រាកដ នៅក្នុង file។
  3. 3Embedded ID3 album art ផ្តួល uploader មួយចំនួន — ពួកគេ reject file ដូចជា 'not pure audio' ឬ strip និង re-encode, ទម្លាក់ quality ច្រើនទៀត។

តើយើ្ងធ្វើយ៉ាងដូចម្តេច

  1. 1យើ្ងប្រើប្រាស់ Xing/LAME header នៅពេលដែលមាន និង frame-count fallback នៅពេលដែលមិន។ VBR timestamps ស្នាក់នៅក្នុង accurate ទៅ ±0.1 s ឆ្លងកាត់ multi-hour files។
  2. 2Joint-stereo និង true-stereo MP3s គឺ decoded ទៅ L/R PCM មុន diarization។ ប្រសិនបើ speakers របស់អ្នក ត្រូវបាន panned, យើ្ង ទុក ពួកគេ ផ្នែក។
  3. 3ID3v1, ID3v2, APE tags, embedded art — គឺ passed through unchanged។ យើ្ង មិនដែល re-encode MP3 របស់អ្នក។

ការ​កំណត់​ការងារ​ដែល​ផ្តល់​ជូន​សម្រាប់ MP3 uploads

Defaults ដែលសមស្របលើ ~80% នៃ MP3 files។ Override ក្នុង-job ពីប្រពៃណ័។

Decoder
Frame-accurate, គ្មាន re-encode
Diarization
Channel split ប្រសិនបើ stereo, បើមិនដូច្នេះ acoustic
Speaker model
Auto · 1-12 speakers
ភាសា
Auto-detect ពី first 30 s
Filler words
Removed (toggle ដើម្បីរក្សា)
Export bundle
DOCX + SRT + timestamped TXT

Accuracy · real-world numbers

95%+ នៅលើ 192 kbps stereo។ ប្រើប្រាស់បាននៅលើ 64 kbps mono។

MP3 accuracy ត្រូវបាន bounded ដោយ អ្វីដែល encoder បានរក្សា, មិនមែន ដោយ យើ្ង។ Perceptual compression លើសពី ~96 kbps រក្សា speech intelligibility ល្អ ក្នុងលក្ខណៈច្រើន; ក្រោម 64 kbps, sibilants និង consonants ចាប់ផ្តើម dissolving។ លេខច្រើនដូចខាងក្រោម គឺ ពី real customer MP3s ក្នុង production។

96%
320 kbps stereo, studio source

ដែលជិត-lossless សម្រាប់ speech។ Podcast masters, dictation app exports, professional interview rigs។ Diarization ស្អាត ប្រសិនបើ speakers នៅលើ separate channels។

95%
192 kbps stereo, 2-3 speakers

Bitrate ដែលលេចឡើង ច្រើនបំផុត សម្រាប់ spoken-word MP3s។ Zoom exports, Riverside downloads, voice recorders default។ Compression artifacts inaudible ទៅ recognizer។

91%
128 kbps mono, conversational

Voice memo defaults នៅ phones ភាគច្រើន។ Acoustic diarization ក្បាល 2-4 speakers។ លេខ និង proper nouns ពេលខ្លះត្រូវការ glance។

84%
64 kbps mono, archival / phone-dump

Old answering-machine rips, lecture archives, narrow-band sources។ High-frequency consonants (f/s/sh) 흐려។ នៅតែ legible — ទ្រង់ទ្រាយ proofread។

សំណួរលេចធ្លាក់

រឿង ៨ ដែលមនុស្ស សួរ អំពី MP3 transcription។

01តើ MP3 bitrate લઘુતમ ដែលនៅតែផ្ដល់ transcript ប្រើប្រាស់ की?+
64 kbps គឺ practical floor។ ក្រោម, sibilants (s, sh, f) compress ទៅក្នុង noise ហើយ word error rate កើនឡើង លើសពី 20%។ ប្រសិនបើអ្នក កត់ត្រាថ្មី, គោលដៅ 128 kbps mono ឬ 192 kbps stereo — អ្វីដែលលើស គឺ overkill សម្រាប់ speech។
02តើ ខ្ញុំត្រូវ convert MP3 ទៅ WAV ដំបូងឬ?+
ទេ។ Re-encoding MP3 → WAV បន្ថែម ០ accuracy ដោយសារតែ data ដែល encoder បាន discarded គឺ gone រួច។ Upload MP3 ដោយផ្ទាល់។ យើ្ង decode frames នៅក្នុង memory ហើយ feed PCM ទៅលើ recognizer។
03តើ stereo MP3 នឹង ផ្តល់ឱ្យ ខ្ញុំ better speaker labels ជាង mono?+
តែប៉ុណ្ណាក្នុងករណីដែល speakers ត្រូវបាន recorded នៅលើ separate channels ដែលពិតប្រាកដ — ភាគច្រើន stereo MP3s មាន same audio នៅលើ sides ទាំងពីរ ('dual mono') ហើយ gain ឥតលុះ។ True channel-split (ឧ. Riverside exports, two-mic field rigs) អនុញ្ញាត ឱ្យយើ្ង skip acoustic diarization ហើយ label speakers near-perfectly។
04តើ MP3 file size អតិបរមា ដែលអ្នក ទទួលយក គឺចង្អុល?+
5 GB ក្នុង upload, ដែលរង្វាយជា ~60 ម៉ោង នៅ 192 kbps ឬ 90 ម៉ោង នៅ 128 kbps។ ប្រសិនបើ file ធំជាង យើ្ង នឹង បង្ហាញ chunked upload — គ្មាន ត្រូវការ split វា ដោយខ្លួនឯង។
05តើ 60-minute MP3 ត្រូវ transcribe រយៈពេលប៉ុន្មាន?+
ជាធម្មតា 90 វិនាទី ពី upload-complete ដល់ transcript-ready, មិនឲ្យ bitrate។ Decoding MP3 frames លឿន; រយៈពេល គឺ recognizer។ Diarization បន្ថែម 5-10 វិនាទីលើ multi-speaker files។
06MP3 របស់ ខ្ញុំ មាន background music — តើ transcript ត្រូវ ruined?+
Quiet bed music ក្រោម speech តាលគ្រាន់។ Loud music ដែល competes ជាមួយ voice (intro stings, scoring នៅក្រោម interviews) ពេលខ្លះ triggers misrecognitions នៅលើ overlapping syllables។ Toggle music suppression នៅលើ job form ដើម្បី pre-filter។
07តើអ្នក អាច ដោះស្រាយ MP3s ripped ពី phone voicemail ឬ answering machines?+
បាទ, ទោះបីជា អ្វីឯងើ ជា ភាគច្រើន 8 kHz narrow-band re-encoded ដូច MP3 — ceiling ល្បឿន រូបរាង វិទ្យា ដោយលើក ដើ OOriginal PSTN capture, មិនមែន MP3 wrapper។ ទទួលយក 78-85% accuracy នៅលើ ប្រភេទ source ដែលដូច្នេះ, ដែលដូចគ្នាយើ្ង នឹង ទទួលបាន លើ ក្រោយ call។
08តើ អ្នក រក្សា MP3 របស់ខ្ញុំ បន្ទាប់ពី transcript គឺ ធ្វើ?+
Files ត្រូវទៅ deleted បន្ទាប់ពី 30 ថ្ងៃ ដោយ default, ឬ ភ្លាមៗ នៅលើ request តាម dashboard។ Transcript ស្នាក់នៅ ក្នុង account របស់អ្នក រហូត សូត្រ delete។ យើ្ង មិនប្រើប្រាស់ customer audio ដើម្បី ក្ដាប់ ណាក៏ដោយ — कभি។

ទម្លាក់ MP3 របស់អ្នក។ ទទួលបាន text ត្រឡប់ក្នុង 90 វិនាទី។

30 នាទី ឥតគិតថ្លៃ រៀងរាល់ខែ។ គ្មាន card ត្រូវការ។ Speaker labels, ភាសា 99, រូបរាង export រួម។

ចាប់ផ្តើម ឥតគិតថ្លៃ