Whisper স্থানীয় / ওপেন সোর্স
বিনামূল্যে যদি আপনার GPU এবং একটা বিকেল থাকে। স্পিকার ডায়ারাইজেশন বাক্সের বাইরে অন্তর্ভুক্ত নেই।
যেকোনো বিটরেট 64 থেকে 320 kbps তে একটি MP3 ফাইল ড্রপ করুন। ৯৯ ভাষায় একটি সময় চিহ্নিত, স্পিকার-লেবেল যুক্ত ট্রান্সক্রিপ্ট পান — কোনো ফর্ম্যাট রূপান্তর, কোনো পুনঃএনকোডিং, কোনো কিউতে অপেক্ষা নেই।
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ দেখুন কী বেরিয়ে আসে
আমরা MP3 ফ্রেম হেডার সরাসরি পড়ি — VBR, CBR, জয়েন্ট-স্টেরিও, যেকোনো এনকোডার (LAME, Fraunhofer, FFmpeg)। ফাইল সত্যিকারের স্টেরিও হলে আলাদা চ্যানেলে স্পিকার থাকলে, আমরা সেটা ব্যবহার করে কণ্ঠস্বর ভাগ করি। মোনো মিক্স-ডাউন অ্যাকোস্টিক ডায়ারাইজেশনে ফিরে পড়ে।
তো আপনি কখন বুঝলেন যে আর্কাইভ অসম্পূর্ণ?
সম্ভবত ২০১৯ এর দিকে, যখন আমরা রিল-টু-রিল ডিজিটাইজ করতে শুরু করি।
আর যে টেপগুলো হারিয়ে গেছে — সেগুলো কোথাও ক্যাটালগ করা ছিল?
'৭৮ থেকে একটা কাগজের ইনডেক্স আছে, কিন্তু অর্ধেক পানির ক্ষতি।
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
তিনটি বাস্তব অপশন · সৎ তুলনা
আপনি দক্ষ হলে আপনার নিজের ল্যাপটপে বিনামূল্যে Whisper চালাতে পারেন। Otter এবং Sonix সাবস্ক্রিপশন ড্যাশবোর্ডের ভিতরে MP3 আপলোড গ্রহণ করে। আমরা ফাইল নিই, ট্রান্সক্রিপ্ট ফেরত দিই, এবং আপনাকে একটি UI এর ভিতরে থাকতে বাধ্য করি না।
বিনামূল্যে যদি আপনার GPU এবং একটা বিকেল থাকে। স্পিকার ডায়ারাইজেশন বাক্সের বাইরে অন্তর্ভুক্ত নেই।
MP3 ড্রপ করুন। প্রায় রিয়েল-টাইম × 0.025 এ স্পিকার-লেবেল যুক্ত টেক্সট ফিরে পান।
পালিশড ড্যাশবোর্ড, মাসিক মিনিট ক্যাপ, ইংরেজি-টিউনড। ফাইল আপলোড একটা পাশের বৈশিষ্ট্যের মতো অনুভব করে।
মূল্য নির্ধারণ এবং বৈশিষ্ট্য প্রাপ্যতা মে ২০২৬ অনুযায়ী সঠিক। Whisper কর্মক্ষমতা মডেল আকার এবং হার্ডওয়্যার দ্বারা পরিবর্তিত হয়।
MP3 এর জন্য নির্দিষ্ট
MP3 একটা ফর্ম্যাট, রেকর্ডিং শৈলী নয় — যার অর্থ ব্যর্থতার মোড এনকোডার থেকে আসে, কণ্ঠস্বর থেকে নয়।
ডিফল্ট যা ~80% MP3 ফাইলের জন্য উপযুক্ত। ফর্ম থেকে প্রতি-কাজ ওভাররাইড করুন।
Accuracy · real-world numbers
MP3 নির্ভুলতা এনকোডার যা রেখেছে তা দ্বারা সীমাবদ্ধ, আমাদের দ্বারা নয়। ~96 kbps এর উপরে পারসেপচুয়াল কম্প্রেশন কণ্ঠস্বর বুদ্ধিমত্তা খুব ভাল সংরক্ষণ করে; 64 kbps এর নিচে, স্বরবর্ণ এবং ব্যঞ্জনবর্ণ দ্রবীভূত হতে শুরু করা। নিচের সংখ্যাগুলো উৎপাদনে বাস্তব গ্রাহক MP3 থেকে।
কণ্ঠস্বরের জন্য প্রায়-নিরোধক। পডকাস্ট মাস্টার, ডিক্টেশন অ্যাপ এক্সপোর্ট, পেশাদার সাক্ষাৎকার রিগ। ডায়ারাইজেশন পরিষ্কার যদি স্পিকার আলাদা চ্যানেলে থাকে।
সবচেয়ে সাধারণ উচ্চারিত-শব্দ MP3 বিটরেট। Zoom এক্সপোর্ট, Riverside ডাউনলোড, ভয়েস রেকর্ডার ডিফল্ট। কম্প্রেশন আর্টিফ্যাক্ট রিকগনাইজারের কাছে অশ্রাব্য।
বেশিরভাগ ফোনের ভয়েস মেমো ডিফল্ট। অ্যাকোস্টিক ডায়ারাইজেশন 2-4 স্পিকার পরিচালনা করে। সংখ্যা এবং যথাযথ নাম মাঝেমধ্যে একটা দৃষ্টি প্রয়োজন।
পুরানো অ্যানসারিং-মেশিন রিপ, লেকচার আর্কাইভ, সংকীর্ণ-ব্যান্ড উৎস। উচ্চ-ফ্রিকোয়েন্সি ব্যঞ্জনবর্ণ (f/s/sh) অস্পষ্ট। এখনও পাঠযোগ্য — একটা প্রুফরিড পরিকল্পনা করুন।
সাধারণ প্রশ্ন
প্রতি মাসে ৩০ মিনিট বিনামূল্যে। কোনো কার্ড লাগবে না। স্পিকার লেবেল, ৯৯ ভাষা, প্রতিটি এক্সপোর্ট ফর্ম্যাট অন্তর্ভুক্ত।
বিনামূল্যে শুরু করুন