Whisper محلی / منبع باز
رایگان اگر GPU داشته باشید و یک بعدازظهر وقت داشته باشید. دیاریزاسیون سخنران در جعبهی اصلی گنجانیده نشده است.
فایل MP3 را در هر نرخ بیتی از 64 تا 320 kbps رها کنید. نسخهخوانی با مهر زمانی و برچسب سخنران در 99 زبان دریافت کنید — بدون تبدیل فرمت، بدون کدگذاری مجدد، بدون انتظار در صف.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ نتیجه را ببینید
ما هدرهای فریم MP3 ر�� میخوانیم — VBR، CBR، joint-stereo، هر کدکنندهای (LAME، Fraunhofer، FFmpeg). اگر فایل استریوی واقعی باشد و سخنرانان در کانالهای جداگانهای باشند، از آن برای تفکیک صدا استفاده میکنیم. مونو mix-down بر دیاریزاسیون آکوستیک بازمیگردد.
پس چه وقت متوجه شدید که آرشیو ناقص است؟
احتمالاً حوالی 2019، وقتی شروع کردیم به دیجیتالیسازی نوارهای صوتی.
و نوارهای گمشده — آیا جایی فهرستبندی شده بودند؟
یک فهرست کاغذی از سال 78 وجود دارد، اما نیمیاش آبخورده است.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
سه گزینه واقعی · مقایسه صادقانه
شما میتوانید Whisper را بر روی لپتاپ خود رایگان اجرا کنید اگر تکنیکی باشید. Otter و Sonix آپلود MP3 را درون داشبوردهای subscription قبول میکنند. ما فایل را میگیریم، نسخهخوانی را برمیگردانیم، و شما را مجبور نمیکنیم درون یک UI زندگی کنید.
رایگان اگر GPU داشته باشید و یک بعدازظهر وقت داشته باشید. دیاریزاسیون سخنران در جعبهی اصلی گنجانیده نشده است.
فایل را رها کنید. متن برچسبشده به دست بیاورید در حدود زمان واقعی × 0.025.
داشبورد لطیفمنظر، سقف دقیقههای ماهانه، تنظیمشده برای انگلیسی. آپلود فایل احساس میکند یک ویژگی جانبی.
قیمتگذاری و دسترسی ویژگیها تا می 2026 دقیق هستند. عملکرد Whisper بسته به اندازه مدل و سختافزار متغیر است.
خاص برای MP3
MP3 یک فرمت است، نه یک سبک ضبط — که به این معنی است که حالتهای شکست از کدکننده میآید، نه از گفتار.
پیشفرضهای بخش~80% فایلهای MP3. فی شغل از فرم override کنید.
Accuracy · real-world numbers
دقت MP3 توسط آن چیزی که کدکننده نگهداشت محدود است، نه توسط ما. فشرسازی ادراکی بالای ~96 kbps خوانایی گفتار را بسیار خوب حفظ میکند؛ در زیر 64 kbps، sibilantها و همخوانها شروع به حل شدن میکنند. اعداد زیر از MP3 واقعی مشتری در تولید هستند.
تقریباً بدون تلفات برای گفتار. استودیوهای پادکست، صادرات برنامه دیکته، ریگهای مصاحبه حرفهای. دیاریزاسیون تمیز اگر سخنرانان در کانالهای جداگانهای باشند.
متداولترین نرخ بیتی برای MP3 گفتاری. صادرات Zoom، دانلود Riverside، رکردرهای صوتی پیشفرض. اصطلاحات فشرسازی نامشنوس برای تشخیصکننده.
پیشفرض یادداشت صوتی بر روی بیشتر تلفنها. دیاریزاسیون آکوستیک 2-4 سخنران را کنترل میکند. اعداد و نامهای خاص گاهگاه نیاز به یک نگاه.
ریپهای دستگاه پاسخدهنده قدیمی، آرشیوهای سخنرانی، منابع باندمحدود. همخوانهای فرکانس بالا (f/s/sh) تار میشوند. هنوز خوانایی — یک proofread برنامهریزی کنید.
سؤالات معمول
هر ماه 30 دقیقه رایگان. بدون کارت مورد نیاز. برچسبهای سخنران، 99 زبان، تمام فرمتهای صادرات شامل.
شروع رایگان