Speaker label সহ WAV ফাইল transcript কৰক।Lossless quality।

আপোনাৰ field rig, DAW bounce, আৰু interview kit ৰ পৰা WAV recording সরাসরি drop কৰক। আমৰা 24-bit headroom বজায় ৰাখো, raw PCM ত diarization চলাই, আৰু timestamp transcript সহ SRT মিনিটত ঘূৰাই দিও।

আপোনাৰ অডিঅ' বা ভিডিঅ' ড্ৰপ কৰক

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

চিধাই ব্ৰাউজাৰৰ পৰাই ৰেকৰ্ড কৰক

Sign up ত ৩০ ছেকেণ্ড লাগে — তাৰ পিছতেই ডেশ্ববৰ্ডত ৰেকৰ্ডিং খোল খায়।

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTফাইল ২৪ ঘণ্টাত স্বয়ংক্ৰিয়ভাৱে মচা যায়

↓ আউটপুট চাওক

Raw PCM আসে। পৰিষ্কাৰ transcript আউট হয়।

Lossless WAV মানে প্রতিটা sibilant, plosive, আৰু নিস্তব্ধ কথা অক্ষত থাকে — কোনো MP3 smear consonant ত নাই। ফাইল যদি multi-track (এক speaker প্রতি channel), আমৰা acoustic diarization সম্পূর্ণভাৱে বাদ দিও আৰু channel layout ত বিভাজন কৰো।

WAV · 48 kHz / 24-bitREC 2 track · 1h 12m · 743 MB
auto-detect en-GBstereo PCM · uncompress
~90s
Transcript · streaming97% accuracy
S1

এতিয়াই সেই ৰাতিপুৱালৈ নিয়ে যাওক — phone call অহা ঘন্টা কিমান আছিল?

S2

পঞ্চাশ মিনিট চাৰটাৰ আগত, প্রায়। Kettle চালু আছিল, সেটা মনত আছে।

S1

আৰু তাৰ পৰা আপুনি সরাসরি harbour লৈ চলি গ'ল?

S2

Boatyard লৈ সরাসরি। আলো এখনো জ্বলি আছিল যেতিয়া মই আহ।

97% per-track WAV তSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

তিনটা বাস্তৱ বিকল্প · নিষ্কপট তুলনা

Adobe Audition। Descript। নাইবা আমরা।

Audition ৰ Speech to Text Creative Cloud ৰ সাথে বান্ডিল থাকে আৰু timeline ৰ ভিতৰত থাকে। Descript WAV নিজৰ editor লৈ import কৰে। আমৰা ফাইল যেনে আছে তেনেই ল'ও, standard export ঘূৰাই দিও, আৰু আপোনাৰ project কোনোপ্রান্তে নিয়ে যাব নকলো।

Option 01

Adobe Audition / Premiere

Adobe timeline ৰ ভিতৰত Transcript panel। Creative Cloud subscription আৰু project file ৰ সাথে bind থাকে।

প্রয়োজনCreative Cloud subscription
Speaker diarizationহয়, শুধুমাত্র mixed-down
Multi-track WAVSTT ৰ আগত flatten কৰা হয়
ExportSRT · CSV · XML
ভাষা18, manual select
খরচ~$23/mo (single app)
Best forPremiere আৰু Audition ত editing কৰা editor যারা caption timeline ত যুক্ত কৰিব বিচাৰে।
Option 02

Transcription.Solutions

WAV drop কৰক। Multi-track হলে per-channel diarization। Source 24h ত delete হয়।

প্রয়োজনএকো নাই — শুধুমাত্র ফাইল
Speaker diarizationPer-track অথবা acoustic
Multi-track WAV16 পর্যন্ত channel
ExportSRT · VTT · DOCX · TXT · JSON
ভাষা99, auto-detect
খরচ · প্রতি min$0.03
Best forযে কোনো ব্যক্তি raw WAV ধৰি আছে — field recordist, DAW ত বাউন্স কৰা podcaster, oral history archivist, গবেষক।
Option 03

Descript

আপোনাৰ WAV Descript ৰ editor লৈ import কৰে। শক্তিশালী, কিন্তু আপোনাৰ ভিতৰত কাম কৰিব লাগে।

প্রয়োজনDescript account + import
Speaker diarizationAcoustic, EN-tuned
Multi-track WAVSeparate clip হিচাপে import
ExportTXT · SRT · DOCX
ভাষা23, accuracy পৰিৱৰ্তিত হয়
খরচ$16–24/user/mo
Best forPodcast editor যারা transcript সম্পাদন কৰি audio সম্পাদন কৰিব বিচাৰে — Descript ৰ প্রকৃত শক্তি।

মূল্য 2026 অনুযায়ী নির্ভুল। Adobe আৰু Descript feature flag প্রায়ই পৰিৱৰ্তিত হয়; commit কৰাৰ আগত বৰ্তমান docs পৰীক্ষা কৰক।

WAV ৰ বাবে specific

তিনটা কথা যি মানুহক generic transcription tools ত কামোৰ দেয়।

বেশিভাগ uploader নিৰব ভাৱে আপোনাৰ WAV recognizer লৈ পঠাৱাৰ আগত downsample কৰে। আমৰা নকৰো।

কি ভুল হয়

  1. 1Multi-track WAV flatten কৰা হয়। Sound Devices MixPre ৰ পৰা 4-channel field recording STT ৰ আগত mono লৈ mix হয়। Per-mic বিভাজন যাৰ বাবে আপুনি অর্থ দিছিলেন সেটা ফেলি দিওয়া হয়।
  2. 232-bit float WAV Zoom F-series বা MixPre ৰ পৰা সম্পূর্ণভাৱে reject হয়, অথবা 16-bit লৈ clip হয় আৰু headroom recovery হারায়।
  3. 396 kHz / 24-bit interview upload ত চিৰস্থায়ী সময় লয় কারণ tool browser ত MP3 লৈ re-encode কৰে পঠাৱাৰ আগত।

এখানে কি flip কৰিব

  1. 1Multi-track WAV যেনে আছে তেনেই upload কৰক (16 পর্যন্ত channel)। আমৰা WAV header ৰ পৰা channel layout পড়ো আৰু প্রতি track এক speaker নির্ধারণ কৰো — কোনো acoustic অনুমান নাই।
  2. 232-bit float natively গ্রহণযোগ্য। আমৰা float headroom preserve কৰো recognizer ৰ বাবে normalise কৰি, সেই peak 0 dBFS ত নাই clip নহয়।
  3. 3সরাসরি binary upload, browser ত কোনো transcode নাই। 2 GB WAV আপোনাৰ সম্পূর্ণ bandwidth ত সরিয়া তোলে আৰু শেষ byte অবতৰণ হোৱাৰ মুহূর্তত processing শুৰু হয়।

WAV ৰ বাবে প্রস্তাবিত job সেটিং

WAV drop কৰক আৰু এটা default ৰ দ্বাৰা on হয়। প্রতি-job form ৰ পৰা override কৰক।

Sample rate
Native (no downsample)
Bit depth
24-bit / 32-float preserve
Diarization
Per-channel যদি multi-track
Speaker model
Interview · 2-8 speaker
Filler word
Kept (toggle off প্রয়োজন হলে)
Export
DOCX · SRT · timestamped TXT

Accuracy · real-world numbers

Per-track WAV ত 97%+। WAV recognizer ক সবচেয়ে প্রষ্টুত সম্ভাব্য signal প্রদান কৰে।

কারণ WAV raw PCM ৰ সাথে কোনো perceptual compression নাই, consonant আৰু sibilant এমনভাৱে smear নহয় যেনে MP3 তোলে। Recognizer শোনে যি microphone শুনিছিল। নিচৰ সংখ্যা production ত বাস্তৱ customer WAV কাজ ৰ পৰা আসে।

98%
Studio WAV · একক speaker

48 kHz / 24-bit, large-diaphragm condenser, treated ৰুম। Narration, audiobook, voice-over booking এখানে অবস্থান করে।

96%
Multi-track interview WAV

প্রতি channel এক speaker (lav অথবা boundary mic)। Diarization শুধুমাত্র channel routing — text-only ত্রুটি।

92%
Handheld field recorder

Zoom H5, Tascam DR-40, একই রকম। Stereo XY pickup, 2-3 speaker, কিছু ৰুম reflection। বেশিভাগ podcast WAV এখানে অবস্থান করে।

85%
শব্দময় পরিবেশ field WAV

বাইরে, café, vehicle। Lossless capture সাহায্য কৰে — শব্দ প্রকৃত, codec artefact নয় — কিন্তু overlapping speech ত accuracy এখনো কমে।

সাধারণ প্রশ্ন

WAV transcription সম্পৰ্কে 8টা কথা মানুহে সোধে।

01WAV ফাইল ৰ সর্বোচ্চ আকার কিমান?+
Standard plan ত প্রতি file 5 GB, যি roughy 8 ঘন্টা stereo 48 kHz / 24-bit, বা 2.5 ঘন্টা 96 kHz / 24-bit। বৃহত্তর ফাইল team plan ত ভালো — upload ৰ আগত আমাক contact কৰক।
02আপুনি Zoom F-series বা MixPre ৰ পৰা 32-bit float WAV support কৰেন?+
হয়, natively। আমৰা float নিদৰ্শন পড়ো 0 dBFS ত clip নোহোৱাকৈ, সেই জোৰেৰ transient যি আপুনি post ত pull down কৰিব পরিকল্পনা কৰিছিলেন এখনো পৰিষ্কাৰভাৱে transcript হয়। বেশিভাগ generic uploader নিৰবচ্ছিন্ন 16-bit লৈ down-cast কৰে প্রথম।
03মোৰ field recorder ৰ পৰা 4-channel WAV আছে — প্রতি ব্যক্তি এক mic। Diarization সেটা ব্যৱহাৰ কৰবে?+
হবে। Polyphonic WAV সরাসরি upload কৰক (প্রথম stereo লৈ bounce নকৰিব)। আমৰা WAV header ৰ পৰা channel layout parse কৰো আৰু প্রতি track এক speaker নির্ধারণ কৰো — একই ভয়েস ত acoustic diarization তকৈ বেশি নির্ভরযোগ্য।
04আপুনি মোৰ 96 kHz WAV downsample কৰবেন?+
Recognizer 16 kHz ত চলে internally — সেটা মানুহ বক্তৃতা intelligibility ৰ ceiling। কিন্তু আমৰা আপোনাৰ original file অক্ষত ৰাখো আৰু noise gating ৰ দৰো post-processing ৰ বাবে ব্যৱহাৰ কৰো। আপোনাৰ export original timeline reference কৰে।
05WAV transcription ৰ বাবে MP3 তকৈ প্রকৃতকৈ বেশি accurate?+
Marginally, হয় — সাধারণত clean speech ত 1-2 point WER। বৃহত্তর gap sibilant আৰু quiet passage ত দেখা যায়, যেখানে MP3 ৰ psychoacoustic compression recognizer ব্যৱহাৰ কৰত থকা তথ্য বাদ দেয়। Archival অথবা forensic কাজৰ বাবে, WAV সঠিক call।
06BWF metadata আৰু timecode preserve হবেন?+
আমৰা BWF chunk পড়ো (bext, iXML) আৰু start timecode transcript আপোনাৰ session timeline লৈ align কৰিব ব্যৱহাৰ কৰো। Original WAV কখনো modify নহয় — আমৰা copy ত কাম কৰো যি 24h ৰ মাজত delete হয়।
07আমি DAW session export ৰ পৰা WAV ফোল্ডাৰ drop কৰিব পাৰেন?+
হয়। Batch upload একেবাৰে 50 file পৰ্যন্ত গ্রহণ কৰে। প্রতিটি WAV নিজৰ job আৰু transcript পায়। যদি এক session ৰ পৰা stem থাকে, আপুনি সেজেক multi-track WAV লৈ একত্রিত কৰিব পাৰেন upload ৰ আগত আৰু আমৰা per channel diarize কৰবো।
081-ঘন্টা stereo WAV প্রকৃতকৈ কিমান সময় লয়?+
Upload সবচেয়ে ধীৰ অংশ — 1-ঘন্টা 48 kHz / 24-bit stereo WAV মোটামুটি 600 MB আৰু typical broadband ত 2-5 মিনিট লয়। Upload হোৱাৰ পৰে, transcription নিজে standard queue ত roughly 4-6 মিনিট চলে।

আপোনাৰ WAV drop কৰক। Lossless quality ৰাখক। আউটপুট চাওক।

প্রতিমাসে 30 মিনিট বিনামূল্যে। কোনো card নাই। Per-track diarization, 32-bit float support, source audio 24h ত delete।

বিনামূল্যে শুৰু কৰক