رونویسی MP3 به متن.برچسب‌های سخنران، 100+ زبان.

فایل MP3 را در هر نرخ بیتی از 64 تا 320 kbps رها کنید. نسخه‌خوانی با مهر زمانی و برچسب سخنران در 99 زبان دریافت کنید — بدون تبدیل فرمت، بدون کدگذاری مجدد، بدون انتظار در صف.

صدا یا ویدیویتان را رها کنید

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

مستقیم از مرورگر ضبط کنید

ثبت‌نام ۳۰ ثانیه طول می‌کشد — بلافاصله بعدش، ضبط داخل داشبورد باز می‌شود.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTفایل‌ها در ۲۴ ساعت خودکار حذف می‌شوند

↓ نتیجه را ببینید

MP3 ورودی. نسخه‌خوانی جدایی‌شده خروجی.

ما هدرهای فریم MP3 ر�� می‌خوانیم — VBR، CBR، joint-stereo، هر کدکننده‌ای (LAME، Fraunhofer، FFmpeg). اگر فایل استریوی واقعی باشد و سخنرانان در کانال‌های جداگانه‌ای باشند، از آن برای تفکیک صدا استفاده می‌کنیم. مونو mix-down بر دیاریزاسیون آکوستیک بازمی‌گردد.

interview-tape-04.mp3REC 192 kbps · استریو · 38:42
تشخیص خودکار en-GB44.1 kHz · LAME 3.100
~90s
رونویسی · پخش مستقیمدقت 95%
S1

پس چه وقت متوجه شدید که آرشیو ناقص است؟

S2

احتمالاً حوالی 2019، وقتی‌ شروع کردیم به دیجیتالی‌سازی نوار‌های صوتی.

S1

و نوار‌های گمشده — آیا جایی فهرست‌بندی شده بودند؟

S2

یک فهرست کاغذی از سال 78 وجود دارد، اما نیمی‌اش آب‌خورده است.

95% روی 192 kbps استریوSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

سه گزینه واقعی · مقایسه صادقانه

Whisper رایگان محلی. Otter یا Sonix. یا ما.

شما می‌توانید Whisper را بر روی لپ‌تاپ خود رایگان اجرا کنید اگر تکنیکی باشید. Otter و Sonix آپلود MP3 را درون داشبوردهای subscription قبول می‌کنند. ما فایل را می‌گیریم، نسخه‌خوانی را برمی‌گردانیم، و شما را مجبور نمی‌کنیم درون یک UI زندگی کنید.

Option 01

Whisper محلی / منبع باز

رایگان اگر GPU داشته باشید و یک بعدازظهر وقت داشته باشید. دیاریزاسیون سخنران در جعبه‌ی اصلی گنجانیده نشده است.

راه‌اندازیPython + CUDA + مدل‌های 10 GB
دیاریزاسیون سخنرانگنجانیده نشده (افزونه pyannote)
سرعت · 1 ساعت MP35–40 دقیقه روی GPU مصرف‌کننده
زبان‌ها99، اما مدل کوچک زیر 80% می‌افتد
صادراتTXT / SRT / VTT / JSON
هزینهرایگان + برق شما
Best forمهندسانی که از قبل GPU دارند، برچسب سخنران نمی‌خواهند، و می‌خواهند حریم‌خصوصی کامل محلی.
Option 02

Transcription.Solutions

فایل را رها کنید. متن برچسب‌شده به دست بیاورید در حدود زمان واقعی × 0.025.

راه‌اندازیکشش و رها کردن، حساب نیازی نیست برای امتحان
دیاریزاسیون سخنرانداخلی (پلن‌های Pro و Business)
سرعت · 1 ساعت MP3~90 ثانیه
زبان‌ها99، تشخیص خودکار
صادراتSRT · VTT · DOCX · TXT · JSON
هزینه · فی دقیقه$0.03
Best forهر کسی با MP3 — نوار خبرنگاری، صادرات پادکست، یادداشت صوتی، دوبله آرشیو — که می‌خواهد متن دقیق در خروجی.
Option 03

Otter / Sonix

داشبورد لطیف‌منظر، سقف دقیقه‌های ماهانه، تنظیم‌شده برای انگلیسی. آپلود فایل احساس می‌کند یک ویژگی جانبی.

راه‌اندازیحساب + پلن پولی
دیاریزاسیون سخنرانآکوستیک، EN-oriented
سرعت · 1 ساعت MP35–10 دقیقه در صف
زبان‌هاOtter تنها انگلیسی؛ Sonix ~40
صادراتدرپشت لایه‌های پولی
هزینه$17+/ماه یا $10+/ساعت (Sonix)
Best forتیم‌هایی که می‌خواهند ویرایشگر رونویسی و UI همکاری بیش‌تر از جریان پاک file→text.

قیمت‌گذاری و دسترسی ویژگی‌ها تا می 2026 دقیق هستند. عملکرد Whisper بسته به اندازه مدل و سخت‌افزار متغیر است.

خاص برای MP3

سه مسئله‌ی ابزارهای رونویسی عام‌الغرض.

MP3 یک فرمت است، نه یک سبک ضبط — که به این معنی است که حالت‌های شکست از کدکننده می‌آید، نه از گفتار.

چه می‌رود اشتباه

  1. 1هدرهای VBR درخوانی اشتباه می‌شوند. برخی ابزارها MP3 متغیر-نرخ‌بیتی را به صورت نرخ‌بیتی ثابت می‌خوانند و مدت را نادرست محاسبه می‌کنند — مهرهای زمانی در طول فایل یک ساعت‌ای با دقایق درایو می‌کنند.
  2. 2Joint-stereo به مونو تخت می‌شود در پیش‌پردازش آپلود. شما تقسیم کانال فی-سخنران را از دست می‌دهید که واقعاً در فایل بود.
  3. 3هنر آلبوم تعبیه‌شده ID3 برخی آپلوردها را سفربان می‌زند — آنها فایل را به عنوان 'صدای خالص نیست' رد می‌کنند یا آن را رمزگذاری و کدگذاری مجدد می‌کنند، کیفیت را بیش‌تر کاهش می‌دهند.

ما درعوض چه انجام می‌دهیم

  1. 1ما هدر Xing/LAME را هنگام ارائه استفاده می‌کنیم و شمارش فریم بازگشت هنگام نه. مهرهای زمانی VBR در سرتاسر فایل‌های چند ساعت‌ای دقیق تا ±0.1 ثا باقی می‌مانند.
  2. 2MP3 joint-stereo و true-stereo به PCM L/R قبل از دیاریزاسیون رمزگشایی می‌شوند. اگر سخنرانان شما panned بودند، ما آنها را تقسیم‌شده نگاه می‌داریم.
  3. 3برچسب‌های ID3v1، ID3v2، APE، هنری تعبیه‌شده — همه دست‌نخورده عبور می‌کنند. ما هرگز MP3 شما را کدگذاری مجدد نمی‌کنیم.

تنظیمات شغل توصیه‌شده برای آپلود‌های MP3

پیش‌فرض‌های بخش~80% فایل‌های MP3. فی شغل از فرم override کنید.

رمزگشای
دقیق فریم، بدون کدگذاری مجدد
دیاریزاسیون
تقسیم کانال اگر استریو، else آکوستیک
مدل سخنران
خودکار · 1-12 سخنران
زبان
تشخیص خودکار از 30 ثانیه اول
کلمات پر
حذف‌شده (تغییر برای نگهداری)
بسته صادرات
DOCX + SRT + TXT با مهر زمانی

Accuracy · real-world numbers

95%+ روی 192 kbps استریو. قابل استفاده تا 64 kbps مونو.

دقت MP3 توسط آن چیزی که کدکننده نگهداشت محدود است، نه توسط ما. فشرسازی ادراکی بالای ~96 kbps خوانایی گفتار را بسیار خوب حفظ می‌کند؛ در زیر 64 kbps، sibilant‌ها و همخوان‌ها شروع به حل شدن می‌کنند. اعداد زیر از MP3 واقعی مشتری در تولید هستند.

96%
320 kbps استریو، منبع استودیو

تقریباً بدون تلفات برای گفتار. استودیو‌های پادکست، صادرات برنامه دیکته، ریگ‌های مصاحبه حرفه‌ای. دیاریزاسیون تمیز اگر سخنرانان در کانال‌های جداگانه‌ای باشند.

95%
192 kbps استریو، 2-3 سخنران

متداول‌ترین نرخ بیتی برای MP3 گفتاری. صادرات Zoom، دانلود Riverside، رکردرهای صوتی پیش‌فرض. اصطلاحات فشرسازی نامشنوس برای تشخیص‌کننده.

91%
128 kbps مونو، مکالمه

پیش‌فرض یادداشت صوتی بر روی بیشتر تلفن‌ها. دیاریزاسیون آکوستیک 2-4 سخنران را کنترل می‌کند. اعداد و نام‌های خاص گاه‌گاه نیاز به یک نگاه.

84%
64 kbps مونو، آرشیو / archive / تخلیه تلفن

ریپ‌های دستگاه پاسخ‌دهنده قدیمی، آرشیوهای سخنرانی، منابع باند‌محدود. همخوان‌های فرکانس بالا (f/s/sh) تار می‌شوند. هنوز خوانایی — یک proofread برنامه‌ریزی کنید.

سؤالات معمول

8 سؤالی که مردم پرسند. درباره رونویسی MP3

01حداقل نرخ بیتی MP3 که هنوز رونویسی قابل استفاده است؟+
64 kbps کف عملی است. در زیر آن، sibilant‌ها (s، sh، f) به نویز فشرسازی می‌شوند و خطای کلمه به بالای 20% می‌رود. اگر record جدید می‌کنید، 128 kbps مونو یا 192 kbps استریو را هدف قرار دهید — هر چیز بالاتر برای گفتار بیش‌تر از حد کافی است.
02آیا باید MP3 خود را به WAV تبدیل کنم؟+
نه. کدگذاری مجدد MP3 → WAV دقت صفر می‌افزاید زیرا داده‌ای که کدکننده دور ریخت برای همیشه رفته است. MP3 را مستقیماً آپلود کنید. ما فریم‌ها را درحافظه رمزگشایی می‌کنیم و PCM را به تشخیص‌کننده تغذیه می‌کنیم.
03آیا استریوی MP3 برچسب‌های سخنران بهتر از مونو دریافت می‌دارند؟+
تنها اگر سخنرانان واقعاً روی کانال‌های ج��اگانه‌ای ضبط شوند — بیشتر MP3‌های استریو صدایی یکسان در هر دو طرف دارند ('dual mono') و چیز بهتری کسب نمی‌کنند. تقسیم کانال واقعی (به عنوان مثال صادرات Riverside، ریگ‌های دو میکروفن) ما را اجازه می‌دهد دیاریزاسیون آکوستیک را رد کنیم و سخنرانان را تقریباً کامل برچسب‌دار کنیم.
04حداکثر اندازه فایل MP3 که قبول می‌کنید؟+
5 GB در هر آپلود، که تقریباً 60 ساعت در 192 kbps یا 90 ساعت در 128 kbps است. اگر فایل بزرگ‌تر باشد آپلود به‌صورت چند‌بخشی را نشان می‌دهیم — نیازی نیست خود را تقسیم کنید.
05یک MP3 60 دقیقه‌ای چقدر طول می‌کشد تا رونویسی شود؟+
معمولاً 90 ثانیه از آپلود-تکمیل تا رونویسی-آماده، صرف‌نظر از نرخ بیتی. رمزگشایی فریم‌های MP3 سریع است؛ زمان در تشخیص‌کننده است. دیاریزاسیون 5-10 ثانیه در فایل‌های چند سخنران می‌افزاید.
06MP3 من موسیقی پس‌زمینه دارد — آیا رونویسی خراب خواهد شد؟+
موسیقی خاموش تحت گفتار خوب است. موسیقی بلند که با صدا رقابت می‌کند (آهنگ‌های intro، scoring زیر مصاحبه) گاه‌گاه خطأهای تشخیص‌دهی را روی حروف م‌تداخل‌کننده مشعل می‌زند. تغییر سرکوبی موسیقی را روی فرم شغل toggle کنید برای پیش‌فیلتر کردن.
07آیا می‌توانید MP3‌های ریپ‌شده از صدای تلفن یا دستگاه پاسخ‌دهنده را مدیریت کنید؟+
بله، اگرچه این اغلب 8 کیلوهرتز باند‌محدود و کدگذاری مجدد به عنوان MP3 هستند — سقف کیفیت صدا توسط ضبط PSTN اصلی تنظیم می‌شود، نه پوسته MP3. دقت 78-85% را در این نوع منبع انتظار داشته باشید، که همان است که در تماس زیرِ درونی کسب می‌کنیم.
08آیا MP3 من را بعد از انجام رونویسی نگاه می‌دارید؟+
فایل‌ها به صورت پیش‌فرض پس از 30 روز حذف می‌شوند، یا بلافاصله با درخواست از طریق داشبورد. رونویسی تا زمان حذف آن در حساب شما باقی می‌ماند. ما از صدای مشتری برای آموزش هیچ مدلی استفاده نمی‌کنیم — هرگز.

MP3 خود را رها کنید. متن را در 90 ثانیه دریافت کنید.

هر ماه 30 دقیقه رایگان. بدون کارت مورد نیاز. برچسب‌های سخنران، 99 زبان، تمام فرمت‌های صادرات شامل.

شروع رایگان