I-transcribe ang MP3 sa teksto.Speaker labels, 100+ wika.

I-drop ang MP3 file sa kahit anong bitrate mula 64 hanggang 320 kbps. Kumuha ng timestamped, speaker-labeled transcript sa 99 wika — walang format conversion, walang re-encoding, walang paghihintay sa queue.

I-drop ang audio o video mo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Mag-record diretso mula sa browser mo

30 segundo lang ang sign up — bubukas agad ang recording sa dashboard pagkatapos.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTAwtomatikong nabubura ang files sa 24h

↓ Tingnan kung ano ang lumalabas

MP3 papasok. Transcript na may diarization lumalabas.

Binabasa namin ang MP3 frame headers nang direkta — VBR, CBR, joint-stereo, anumang encoder (LAME, Fraunhofer, FFmpeg). Kung ang file ay tunay na stereo na may nagsasalita sa hiwalay na channels, ginagamit namin yan para paghiwayin ang mga tinig. Mono mix-down ay umaasa sa acoustic diarization.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
automatic na nalalaman en-GB44.1 kHz · LAME 3.100
~90s
Transcript · streaming95% accuracy
S1

Kaya kailan mo unang nalaman na hindi kumpleto ang archive?

S2

Malamang sa paligid ng 2019, noong nagsama kami ng pag-digitise sa reel-to-reels.

S1

At ang mga nawawalang tapes — naka-catalogue ba sila kahit saan man?

S2

May paper index mula '78, pero kalahati ay water-damaged.

95% sa 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tatlong tunay na option · tapat na paghahambing

Libre local na Whisper. Otter o Sonix. O kami.

Maaari mong i-run ang Whisper sa sarili mong laptop nang libre kung technical ka. Tinatanggap ng Otter at Sonix ang MP3 uploads sa loob ng subscription dashboards. Tinatanggap namin ang file, ibabalik namin ang transcript, at hindi ka ginagawang mamuhay sa loob ng UI.

Option 01

Whisper local / open source

Libre kung mayroon kang GPU at hapon. Walang speaker diarization out of the box.

SetupPython + CUDA + 10 GB models
Speaker diarizationHindi kasama (pyannote add-on)
Speed · 1 hr MP35–40 min sa consumer GPU
Languages99, pero maliit na model ay bumababa sa ibaba ng 80%
ExportTXT / SRT / VTT / JSON
CostLibre + ang iyong kuryente
Best forMga engineer na may GPU na, hindi kailangan ng speaker labels, at gusto ng full local privacy.
Option 02

Transcription.Solutions

I-drop ang MP3. Kumuha ng speaker-labeled text pabalik sa humigit-kumulang real-time × 0.025.

SetupDrag-and-drop, walang account na kailangan para subukan
Speaker diarizationBuilt in (Pro & Business plans)
Speed · 1 hr MP3~90 segundo
Languages99, automatic na nalalaman
ExportSRT · VTT · DOCX · TXT · JSON
Cost · per min$0.03
Best forSinuman na may MP3 — journalist tape, podcast export, voice memo, archival dub — na gusto lang ng accurate na teksto sa kabilang dulo.
Option 03

Otter / Sonix

Polished dashboard, monthly minutes cap, English-tuned. File upload ay pakiramdam na side feature.

SetupAccount + paid plan
Speaker diarizationAcoustic, EN-leaning
Speed · 1 hr MP35–10 min sa queue
LanguagesOtter EN-only; Sonix ~40
ExportNakatali sa likod ng paid tiers
Cost$17+/mo o $10+/hr (Sonix)
Best forMga team na gusto ng transcript editor at collaboration UI kaysa sa clean API-style file→text flow.

Pricing at feature availability accurate mula Mayo 2026. Whisper performance ay nag-iiba depende sa model size at hardware.

Specific sa MP3

Tatlong bagay na gumagawa ng problema sa mga tao sa generic transcription tools.

MP3 ay format, hindi recording style — kaya ang failure modes ay galing sa encoder, hindi sa speech.

Kung ano ang napapahuli

  1. 1VBR headers ay napapahirap-hirap. Ang ilan sa mga tool ay nagbabasa ng variable-bitrate MP3s bilang fixed-rate at maling-malinaw ang duration — timestamps ay gumagalaw ng ilang minuto sa loob ng isang oras-mahabang file.
  2. 2Joint-stereo ay binabawasan sa mono sa panahon ng upload preprocessing. Nawala mo ang per-speaker channel separation na tunay na nasa file.
  3. 3Embedded ID3 album art ay nakakasakit sa ilang mga uploader — itinatapon nila ang file bilang 'hindi purong audio' o inalis nila at nag-re-encode, na bumubuwas pa ng kalidad.

Kung ano ang ginagawa namin sa halip

  1. 1Ginagamit namin ang Xing/LAME header kapag present at frame-count fallback kung hindi. VBR timestamps ay nananatiling accurate sa ±0.1 s sa multi-hour files.
  2. 2Joint-stereo at true-stereo MP3s ay na-decode sa L/R PCM bago ang diarization. Kung ang iyong mga nagsasalita ay naka-pan, pinapanatili namin ang hiwalay.
  3. 3ID3v1, ID3v2, APE tags, embedded art — lahat ay ipinagdaan nang walang pagbabago. Hindi kami nag-re-encode ng iyong MP3.

Inirekomendang job settings para sa MP3 uploads

Mga default na akma sa ~80% ng MP3 files. I-override per-job mula sa form.

Decoder
Frame-accurate, walang re-encode
Diarization
Channel split kung stereo, kung hindi acoustic
Speaker model
Auto · 1-12 speakers
Language
Auto-detect mula sa unang 30 s
Filler words
Tinanggal (toggle para manatili)
Export bundle
DOCX + SRT + timestamped TXT

Accuracy · real-world numbers

95%+ sa 192 kbps stereo. Gamit hanggang 64 kbps mono.

Ang MP3 accuracy ay hanggat ng kung ano ang nag-alok ng encoder, hindi kami. Perceptual compression sa itaas ng ~96 kbps ay pinapanatili ang speech intelligibility ng maayos; sa ibaba ng 64 kbps, ang sibilants at consonants ay nagsisimulang lumabo. Ang mga numero sa ibaba ay galing sa tunay na customer MP3s sa production.

96%
320 kbps stereo, studio source

Halos-lossless para sa speech. Podcast masters, dictation app exports, professional interview rigs. Diarization clean kung speakers sa hiwalay na channels.

95%
192 kbps stereo, 2-3 speakers

Pinakasyadong bitrate para sa spoken-word MP3s. Zoom exports, Riverside downloads, voice recorders default. Compression artifacts hindi naririnig ng recognizer.

91%
128 kbps mono, conversational

Voice memo defaults sa karamihan ng phones. Acoustic diarization ay humahawak ng 2-4 speakers. Mga numero at proper nouns minsan ay kailangan ng tingin.

84%
64 kbps mono, archival / phone-dump

Lumang answering-machine rips, lecture archives, narrow-band sources. High-frequency consonants (f/s/sh) ay nag-blur. Basta legible pa — magplano ng proofread.

Mga karaniwang tanong

8 bagay na itinatanong ng mga tao tungkol sa MP3 transcription.

01Ano ang minimum MP3 bitrate na nagbibigay pa rin ng gamit na transcript?+
64 kbps ang practical floor. Sa ibaba nito, ang sibilants (s, sh, f) ay nag-compress sa ingay at ang word error rate ay umakyat ng lampas 20%. Kung nag-record ka ng bago, target ang 128 kbps mono o 192 kbps stereo — sinuman sa itaas ay sobra para sa speech.
02Kailangan ko ba i-convert ang MP3 ko sa WAV muna?+
Hindi. Pag-re-encode MP3 → WAV ay walang dagdag na accuracy dahil ang data na ibinahagi ng encoder ay gone for good. I-upload ang MP3 nang direkta. Nag-decode kami ng frames sa memory at nag-feed ng PCM sa recognizer.
03Magbibigay ba ng mas magandang speaker labels ang stereo MP3 kaysa mono?+
Tanging kung ang mga nagsasalita ay tunay na naka-record sa hiwalay na channels — karamihan ng stereo MP3s ay may parehong audio sa dalawang panig ('dual mono') at walang nakukuhang advantage. Tunay na channel-split (e.g. Riverside exports, two-mic field rigs) ay nagpapahintulot sa amin na tanggapin ang acoustic diarization at malapit na perpektong label ng speakers.
04Ano ang maximum MP3 file size na tinatanggap ninyo?+
5 GB per upload, na humigit-kumulang 60 oras sa 192 kbps o 90 oras sa 128 kbps. Kung ang file mo ay mas malaki ipapakita namin ang chunked upload — walang kailangan mong ihiwalay nang sarili.
05Gaano katagal ang pag-transcribe ng 60-minuto na MP3?+
Karaniwang 90 segundo mula sa upload-complete hanggang transcript-ready, anuman ang bitrate. Ang pag-decode ng MP3 frames ay mabilis; ang oras ay nasa recognizer. Diarization ay nagdadagdag ng 5-10 segundo sa multi-speaker files.
06Ang MP3 ko ay may background music — masisira ba ang transcript?+
Ang quiet bed music sa ilalim ng speech ay OK. Malakas na musika na nakipaglaban sa boses (intro stings, scoring sa ilalim ng mga interview) ay minsan ay nagtrigger ng misrecognitions sa overlapping syllables. I-toggle ang music suppression sa job form para mag-pre-filter.
07Kayang-kaya ninyo ang MP3s na na-rip mula sa phone voicemail o answering machines?+
Oo, bagaman ang mga ito ay kadalasan 8 kHz narrow-band na nag-re-encode bilang MP3 — ang audio quality ceiling ay nakatakda ng original PSTN capture, hindi ng MP3 wrapper. Inaasahan ang 78-85% accuracy sa ganitong klase ng source, na kapareho ng makukuha namin sa underlying call.
08Nanatili ba ang MP3 ko pagkatapos ng transcript?+
Tinatanggal ang mga file pagkatapos ng 30 araw bilang default, o kaagad sa request sa dashboard. Ang transcript ay nananatili sa iyong account hanggang baguhin mo ito. Hindi kami gumagamit ng customer audio para mag-train ng anumang model — hindi kailanman.

I-drop ang MP3. Kumuha ng teksto pabalik sa 90 segundo.

30 libreng minuto tuwing buwan. Walang card na kailangan. Speaker labels, 99 wika, bawat export format kasama.

Magsimula ng libre