MP3 کي متن ۾ ترجمان ڪريو.Speaker labels، 100+ ٻولي.

ھڪ MP3 فائل 64 کان 320 kbps پوري درجي ۾ ڪري. ھڪ timestamped، speaker-labeled transcript 99 ٻولين ۾ حاصل ڪريو — ڪوبه format conversion، ڪوبه re-encoding، ڪوبه queue تي انتظار.

پنهنجو آڊيو يا وڊيو هتي ڇڏيو

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

سڌو پنھنجي برائوزر مان رڪارڊ ڪريو

سائن اپ 30 سيڪنڊن ۾ ٿئي ٿو — ان بعد سڌو ڊيش بورڊ ۾ رڪارڊنگ کلي ٿي.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTفائلون 24 ڪلاڪن ۾ خودڪار ڊليٽ ٿي وڃن ٿيون

↓ ڏسو ڇا نڪرندو آهي

MP3 اندر. Diarized transcript ٻاهر.

اسان MP3 frame headers سڌو سڌو پڙهندا آهيون — VBR، CBR، joint-stereo، ڪوبه encoder (LAME، Fraunhofer، FFmpeg). جيڪڏهن فائل سچو stereo آهي speakers الڳ الڳ channels تي، اسان ان کي voice split ڪرڻ لاء استعمال ڪندا آهيون. Mono mix-down acoustic diarization تي واپس ڪندو آهي.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Transcript · streaming95% accuracy
S1

تر جڏهن توهان پهريون ڀيرو محسوس ڪيو ته آرڪائيو نامڪمل هو؟

S2

شايد 2019 ڦيٹي، جڏهن اسان reel-to-reels digitise ڪرڻ شروع ڪيو.

S1

۽ گمشدہ tapes — ڇا اهي ڪٿي catalog ٿيلا هئا؟

S2

'78 وٽ ھڪ paper index آهي، پر اسان جو اڌ پاڻي نقصان آهي.

95% تي 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

ٽي حقيقي اختيار · ايمان دار موازنو

مفت لوڪل Whisper. Otter يا Sonix. يا اسان.

توهان Whisper اپنے laptop تي مفت تي چلا سگهو ٿا جيڪڏهن توهان technical ئو. Otter ۽ Sonix subscription dashboards اندر MP3 uploads قبول ڪندا آهن. اسان فائل وٺندا آهيون، transcript واپس ڪندا آهيون، ۽ توهان کي UI اندر رهڻ لاء مجبور نٿا ڪندا.

Option 01

Whisper لوڪل / اوپن سورس

مفت جيڪڏهن توهان وٽ GPU ۽ ھڪ afternoon آهي. ڪوبه speaker diarization باڪس کان ٻاهر.

SetupPython + CUDA + 10 GB ماڊلز
Speaker diarizationشامل نه (pyannote شامل)
رفتار · 1 hr MP35–40 منٹ consumer GPU تي
ٻولي99، پر ننڙو ماڊل 80% کان گهٹ ڌڪ
ExportTXT / SRT / VTT / JSON
قيمتمفت + توهان جي بجلي
Best forانجنيئرز جن وٽ اڳ کان GPU آهي، speaker labels جي ضرورت نه، ۽ مڪمل local privacy چاهندا.
Option 02

Transcription.Solutions

MP3 ڪريو. Speaker-labeled متن واپس حاصل ڪريو تقريبن real-time × 0.025 ۾.

SetupDrag-and-drop، ڪوبه account ضروري نه برآمد ڪرڻ لاء
Speaker diarizationشامل (Pro & Business plans)
رفتار · 1 hr MP3~90 سيڪنڊ
ٻولي99، auto-detected
ExportSRT · VTT · DOCX · TXT · JSON
قيمت · في منٹ$0.03
Best forڪنهن بہ MP3 سان — صحافي tape، podcast export، voice memo، archival dub — جيڪي صرف دوسري پاسي تي صحيح متن چاهندا.
Option 03

Otter / Sonix

Polished dashboard، monthly منٹز cap، English-tuned. File upload ھڪ ضمني feature جهڙو محسوس ٿو.

SetupAccount + paid plan
Speaker diarizationAcoustic، EN-leaning
رفتار · 1 hr MP35–10 منٹ queue ۾
ٻوليOtter EN-only; Sonix ~40
ExportLocked paid tiers جي پويان
قيمت$17+/mo يا $10+/hr (Sonix)
Best forTeams جيڪي سانچو transcript editor ۽ collaboration UI چاهندا آهن صاف API-style file→text جريان کان وڌيڪ.

قيمت ۽ feature دستيابي درست May 2026 جي طور تي. Whisper performance ماڊل سائز ۽ hardware جي لحاظ سان مختلف ٿو.

MP3 لاء مخصوص

ٽي شيون جيڪي عام نوشتي اوزار تي ماڻهو کي کاون.

MP3 ھڪ format آهي، نه ھڪ recording سٹائل — جيڪو مطلب آهي failure modes encoder کان آيندو آهين، نه speech کان.

ڇا غلط ٿندو آهي

  1. 1VBR headers غلط parse ٿين ويندا. ڪجهه اوزار variable-bitrate MP3s کي fixed-rate جرم پڙهندا آهن ۽ duration غلط calculate ڪندا — timestamps hour-long فائل ۾ منٹز سے drift ڪندا.
  2. 2Joint-stereo upload preprocessing دوران mono ۾ پيڻ ويندو آهي. توهان per-speaker channel separationُ ڪڙديو جيڪو فائل ۾ اصل ۾ هو.
  3. 3Embedded ID3 البم art ڪجهه uploaders کي ٽريپ ڪندو آهي — اهي فائل کي 'نه خالص audio' طور reject ڪندا يا ان کي strip ڪندا ۽ re-encode ڪندا، اضافي معيار ڪڙديندا.

اسان بجاء ڇا ڪندا آهيون

  1. 1اسان Xing/LAME header استعمال ڪندا آهيون جڏهن موجود ۽ frame-count fallback جڏهن نه. VBR timestamps multi-hour فائل پوري ±0.1 s تي صحيح رهندا.
  2. 2Joint-stereo ۽ true-stereo MP3s diarization کان پهريان L/R PCM ۾ decode ٿين ويندا. جيڪڏهن توهان جا speaker panned هئا، اسان انهن کو split رکندا.
  3. 3ID3v1، ID3v2، APE tags، embedded art — سڀ untouched ذريعي ڪيلا. اسان توهان جا MP3 ڪڏهي بہ re-encode نٿا ڪريون.

MP3 uploads لاء تجويز ڪيل job settings

Defaults جيڪي ~80% MP3 فائلز کي fit ٿين. فارم سان per-job override ڪريو.

Decoder
Frame-accurate، نه re-encode
Diarization
Channel split جيڪڏهن stereo، ٻي صورت acoustic
Speaker ماڊل
Auto · 1-12 speakers
ٻولي
پهريون 30 s سان auto-detect
Filler لفظ
هٽايل (رکڻ لاء toggle)
Export bundle
DOCX + SRT + timestamped TXT

Accuracy · real-world numbers

95%+ تي 192 kbps stereo. قابل استعمال 64 kbps mono تي.

MP3 accuracy محدود جو encoder رکيو، اسان جي طرفان نه. Perceptual compression ~96 kbps کان مٿي speech intelligibility بہت سٺي محفوظ رکندو آهي; 64 kbps کان گهٹ، sibilants ۽ consonants ڦهلي گڏڻ شروع. ڊاٽا هيٺ حقيقي customer MP3s سان production ۾.

96%
320 kbps stereo، studio ذريعو

تقريبن lossless speech لاء. Podcast ماسٽرز، dictation app exports، professional interview rigs. Diarization صاف اگر speakers الڳ الڳ channels تي.

95%
192 kbps stereo، 2-3 speaker

سب سے عام bitrate spoken-word MP3s لاء. Zoom exports، Riverside downloads، voice recorders default. Compression artifacts ناقابل شناخت recognizer لاء.

91%
128 kbps mono، conversation

Voice memo defaults اڪثر فونز تي. Acoustic diarization 2-4 speakers سنڀاليندو ��هي. نمبر ۽ proper nouns بسا ھڪ نظر دي ضرورت.

84%
64 kbps mono، archival / phone-dump

پراڻا answering-machine rips، lecture archives، narrow-band ذرائع. High-frequency consonants (f/s/sh) ڦهليندا. اڃا تائين legible — ھڪ proofread منصوبو.

عام سوالات

8 شيون جيڪي ماڻهو MP3 نوشتي باري پڇندن.

01ڪيڏي گهٽ ترين MP3 bitrate آهي جيڪو اڃا طريقو اڻ transcript ڏيندو آهي؟+
64 kbps عملي فرش آهي. انجام کان گهٽ، sibilants (s, sh, f) compress آڏائندا آهن ۽ word error rate 20% پاسي چڙهندو آهي. جيڪڏهن توهان تازو record ڪري رهيا آهيو، 128 kbps mono يا 192 kbps stereo target ڪريو — ڪجهه بہ speech لاء overkill آهي.
02ڇا مون پهريان MP3 کو WAV ۾ convert ڪرڻو پوندو؟+
نه. MP3 → WAV re-encoding صفر accuracy شامل ڪندو آهي ڇاڪاڻ ته encoder جو ڪڙديو ڊاٽا هميش لاء ڪڙيو آهي. MP3 سڌو سڌو upload ڪريو. اسان frames memory ۾ decode ڪندا آهيون ۽ PCM recognizer لاء feed ڪندا.
03ڇا stereo MP3 مون کي mono کان بہتر speaker labels ڏيندو؟+
صرف جيڪڏهن speakers فسلا الڳ ��لڳ channels تي record ٿيا — اڪثر stereo MP3s دونهن پاسن تي ساڳيو آڊيو آهي ('dual mono') ۽ ڪجهه حاصل نٿا ڪندا. حقيقي channel-split (مثال Riverside exports، two-mic field rigs) اسان کي acoustic diarization ڪڇڻ ڏيندو ۽ speaker label تقريبن بہترين.
04ڪيڏي زياده سے زياده MP3 فائل سائز توهان قبول ڪندو؟+
5 GB في upload، جيڪو تقريبن 60 ڪلاڪ 192 kbps تي يا 90 ڪلاڪ 128 kbps تي. جيڪڏهن توهان جي فائل وڌيڪ آهي اسان ھڪ chunked upload ڏيکاريندا — ان کي پاڻ سان split ڪرڻ جي ضرورت نه.
0560-منٹ MP3 کو ترجمان ڪرڻ لاء ڪيتل وقت لڳندو آهي؟+
عام طور تي 90 سيڪنڊ upload-complete سان transcript-ready تائين، bitrate جي laqual سان. MP3 frames decode ڪرڻ تيز آهي; وقت recognizer ۾ آهي. Diarization multi-speaker فائلز تي 5-10 سيڪنڊ شامل ڪندو.
06منهنجي MP3 بند موسيقي آهي — ڇا transcript خراب ٿي ويندو؟+
خاموش bed موسيقي speech هيٺان ٺيڪ آهي. زور سے موسيقي جيڪو voice سان ڪنڍندو آهي (intro stings، scoring under interviews) بعض اوقات overlapping syllables تي misrecognitions trigger ڪندو. موسيقي suppression job form تي toggle ڪريو پري-filter لاء.
07ڇا توهان phone voicemail يا answering machines سان rip MP3s handle ڪري سگهو؟+
ٿي، اگرچه اهي اڪثر 8 kHz narrow-band re-encoded MP3 جي روپ ۾ — audio معيار ceiling اصل PSTN capture جي طرفان set ٿو، نه MP3 wrapper. 78-85% accuracy اس قسم جي ذريعو تي توقع ڪريو، جيڪو ساڳيو اسان کو بنيادي call تي ملندو.
08ڇا توهان منهنجو MP3 بعد transcript مڪمل ڪري ڪژديو؟+
فائلون 30 ڏينهن بعد default سان هٹايا ويندا، يا dashboard ذريعان فوری درخواست تي. Transcript توهان جي account ۾ رهندو آهي جھان تائين توهان ان کي هٹا ڏيو. اسان customer audio استعمال نٿا ڪندا ڪنهن model تي train ڪرڻ لاء — ڪڏهي نه.

توهان جو MP3 ڪريو. متن واپس 90 سيڪنڊن ۾ حاصل ڪريو.

30 مفت منٽز ھر ماہ. ڪوبه ڪارت ضروري نه. Speaker labels، 99 ٻولي، ھر export format شامل.

مفت شروع ڪريو