ถอดเสียง WAV พร้อมชื่อผู้พูดคุณภาพเต็มดั้งเดิม

นำ บันทึก WAV มาจากอุปกรณ์บันทึกสนาม DAW หรือชุดสัมภาษณ์ของคุณ เราเก็บส่วนหัว 24-bit ไว้ ใช้อัลกอริทึมแยกผู้พูดกับ PCM ดิบ และส่งคืนข้อความพร้อมสแตมป์เวลาและ SRT ในเวลาไม่กี่นาที

วางไฟล์เสียงหรือวิดีโอของคุณ

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

อัดเสียงจากเบราว์เซอร์ได้ทันที

สมัครภายใน 30 วินาที — เปิดอัดเสียงในแดชบอร์ดได้เลย

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTไฟล์ลบอัตโนมัติใน 24 ชม.

↓ ดูผลลัพธ์ที่ได้

PCM ดิบเข้าไป ข้อความสะอาดออกมา

WAV ไม่สูญเสียหมายความว่า ทุกเสียงเสี้ยน, ระเบิด และคำพูดเบาๆ ยังคงสมบูรณ์ — ไม่มีการเบลอ MP3 บนพยัญชนะ ถ้าไฟล์มีหลายแทร็ก (ผู้พูดคนหนึ่งต่อแชนเนล) เราข้ามการแยกผู้พูดด้วยเสียงแล้วแยกตามเลย์เอาต์แชนเนล

WAV · 48 kHz / 24-bitREC 2 แทร็ก · 1ช. 12น. · 743 MB
ตรวจพบอัตโนมัติ en-GBสเตอริโอ PCM · ไม่บีบอัด
~90s
ข้อความ · สตรีมมิงความแม่นยำ 97%
S1

พาฉันกลับไปวันเช้านั้นในปีเจ็ดเอ — เวลากี่โมงที่สายเข้ามา

S2

สี่ครั่ง ประมาณนั้นแหละ กาน้ำเดือดอยู่ ฉันจำได้

S1

แล้วจากนั่นคุณขับรถไปท่าเรือเลย

S2

ไปที่ลานต่อเรืองานเดิม ไฟยังติดอยู่เวลาฉันเข้าไป

ความแม่นยำ 97% บน WAV ต่อแทร็กSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

สามตัวเลือกจริง · เปรียบเทียบที่ตรงไป

Adobe Audition Descript หรือพวกเรา

Speech to Text ของ Audition มาพร้อมกับ Creative Cloud และอยู่ในไทม์ไลน์ Descript นำเข้า WAV เข้าไปในอินเทอร์เฟซของตัวเอง เราใช้ไฟล์ตามสภาพจริง ส่งคืนส่วนประกอบมาตรฐาน และไม่ขอให้คุณย้ายโปรเจกต์ไปไหน

Option 01

Adobe Audition / Premiere

แผงข้อความในไทม์ไลน์ Adobe พันธะกับ Creative Cloud และไฟล์โปรเจกต์

ต้องการCreative Cloud subscription
แยกผู้พูดใช่ ผสมลงเท่านั้น
WAV หลายแทร็กถูกปรับให้เป็นแบบเรียบก่อน STT
ส่วนประกอบSRT · CSV · XML
ภาษา18 เลือกด้วยตนเอง
ราคา~$23/เดือน (แอปเดียว)
Best forบรรณาธิการที่ตัดแต่งอยู่ใน Premiere หรือ Audition และต้องการคำบรรยายติดกับไทม์ไลน์
Option 02

Transcription.Solutions

วาง WAV ลง แยกผู้พูดต่อแชนเนลถ้าเป็นหลายแทร็ก ลบต้นฉบับใน 24 ชั่วโมง

ต้องการไม่มีอะไร — เพียงแค่ไฟล์
แยกผู้พูดต่อแทร็กหรือด้วยเสียง
WAV หลายแทร็กสูงสุด 16 แชนเนล
ส่วนประกอบSRT · VTT · DOCX · TXT · JSON
ภาษา99 ตรวจพบอัตโนมัติ
ราคา · ต่อนาที$0.03
Best forใครก็ได้ที่ถือไฟล์ WAV — ผู้บันทึกสนาม พอดแคสเตอร์ที่อัดจาก DAW ผู้เก็บรวบรวมประวัติศาสตร์ด้วยปากเปล่า นักวิจัย
Option 03

Descript

นำเข้า WAV เข้าไปในตัวแก้ไข Descript มีประสิทธิภาพ แต่คุณต้องทำงานอยู่ในนั้น

ต้องการบัญชี Descript + นำเข้า
แยกผู้พูดด้วยเสียง ปรับแต่งสำหรับ EN
WAV หลายแทร็กนำเข้าเป็นคลิปแยก
ส่วนประกอบTXT · SRT · DOCX
ภาษา23 ความแม่นยำแตกต่างกัน
ราคา$16–24/ผู้ใช้/เดือน
Best forบรรณาธิการพอดแคสต์ที่ต้องการแก้ไขเสียงโดยแก้ไขข้อความ — สูperพาวเวอร์ที่แท้จริงของ Descript

ราคาถูกต้องใจถ้า 2026 Adobe และ Descript เปลี่ยนฟีเจอร์บ่อย ตรวจสอบเอกสารปัจจุบันก่อนตัดสินใจ

เฉพาะ WAV

สามสิ่งที่ทำให้คนมีปัญหากับ เครื่องมือถอดเสียงทั่วไป

ผู้อัปโหลดส่วนใหญ่ลอบข่มขัน WAV ของคุณลง샘pling ก่อนส่งไปที่อัลกอริทึม เราไม่ทำ

สิ่งที่ผิดพลาด

  1. 1WAV หลายแทร็กถูกปรับให้เป็นแบบเรียบ บันทึกสนาม 4 แชนเนลจาก Sound Devices MixPre ถูกผสมเป็นโมโนก่อน STT การแยกต่อไมค์ที่คุณจ่ายสำหรับถูกทิ้งไป
  2. 2WAV 32-bit float จาก Zoom F-series หรือ MixPre ถูกปฏิเสธอย่างตรงไป หรือตัดให้ 16-bit และสูญเสียหัวห้องการกู้คืนของพวกมัน
  3. 3สัมภาษณ์ 96 kHz / 24-bit ใช้เวลานานในการอัปโหลดเพราะเครื่องมือ re-encode ไปที่ MP3 ในเบราว์เซอร์ก่อนส่ง

สิ่งที่ต้องเปลี่ยนที่นี่

  1. 1อัปโหลด WAV หลายแทร็ก ตามสภาพจริง (สูงสุด 16 แชนเนล) เราอ่านเลย์เอาต์แชนเนลจากส่วนหัว WAV และกำหนดผู้พูดคนหนึ่งต่อแทร็ก — ไม่มีการทำนายอะคูสติก
  2. 232-bit float ถูกยอมรับเพราะไม่มีอื่น เรา เก็บรักษาหัวห้องแบบ float เมื่อทำให้เป็นปกติสำหรับอัลกอริทึม เพื่อไม่ให้ยอดแจ็กน้อย 0 dBFS ไม่ตัด
  3. 3อัปโหลดไบนารีโดยตรง ไม่มี transcode ในเบราว์เซอร์ WAV 2 GB เคลื่อนที่ที่แบนด์วิดท์เต็มของคุณและเริ่มการประมวลผลในขณะที่ไบต์สุดท้ายลงมา

การตั้งค่างานที่แนะนำสำหรับ WAV

วาง WAV และสิ่งเหล่านี้เปิดโดยค่าเริ่มต้น เขียนทับต่อการงานจากแบบฟอร์ม

อัตราการสุ่มตัวอย่าง
เนทีฟ (ไม่มี downsample)
ความลึกบิต
24-bit / 32-float บันทึกไว้
การแยกผู้พูด
ต่อแชนเนลถ้าหลายแทร็ก
รูปแบบผ��้พูด
สัมภาษณ์ · 2-8 ผู้พูด
คำว่างเปล่า
เก็บไว้ (ปิดหากต้องการ)
ส่วนประกอบ
DOCX · SRT · TXT พร้อมสแตมป์เวลา

Accuracy · real-world numbers

97%+ บน WAV ต่อแทร็ก WAV ให้แก่อัลกอริทึมจดจำเสียง สัญญาณเบสที่สุด

เพราะ WAV เก็บ PCM ดิบโดยไม่มีการบีบอัดเสียง พยัญชนะและเสียงเสี้ยนไม่ถูกทำให้เบลอแบบที่ MP3 ทำการบีบอัด อัลกอริทึมจดจำเสียงได้ยินสิ่งที่ไมโครโฟนได้ยิน ตัวเลขด้านล่างมาจากงาน WAV ของลูกค้าจริงในการใช้งาน

98%
Studio WAV · ผู้พูดเดียว

48 kHz / 24-bit ไมโครโฟนแบบไดอะแฟรมขนาดใหญ่ ห้องที่มีการดูแล บทวงจร หนังสือเสียง การจองเสียงพูดอยู่ตรงนี้

96%
สัมภาษณ์ WAV หลายแทร็ก

แชนเนลหนึ่งต่อผู้พูด (ไมค์ หรือไมค์ขอบ) การแยกผู้พูดเป็นเพียงการกำหนดทางของไมค์ — ข้อผิดพลาดด้านข้อความเท่านั้น

92%
อุปกรณ์บันทึกสนามแบบใช้มือ

Zoom H5 Tascam DR-40 คล้ายกัน การรับสัญญาณ XY แบบสเตอริโอ 2-3 ผู้พูด เสียงสะท้อนของห้องบ้าง WAV ของพอดแคสต์ส่วนใหญ่อยู่ตรงนี้

85%
WAV สนามสภาพแวดล้อม嘈杂

กลางแจ้ง คาเฟ่ ยานพาหนะ การrับสัญญาณไม่สูญเสียช่วย — เสียงรบกวนเป็นของจริง ไม่ใช่สิ่งประดิษฐ์อัลกอริทึม — แต่ความแม่นยำยังคงลดลงในการพูดซ้อนกัน

คำถามทั่วไป

8 สิ่งที่คนถาม เกี่ยวกับการถอดเสียง WAV

01ขนาดไฟล์ WAV สูงสุดคืออะไร+
5 GB ต่อไฟล์ในแผนมาตรฐาน ซึ่งประมาณ 8 ชั่วโมงของสเตอริโอ 48 kHz / 24-bit หรือ 2.5 ชั่วโมงของ 96 kHz / 24-bit ไฟล์ที่ใหญ่กว่านั้นใช้ได้บนแผนทีม — แค่ติดต่อเราก่อนการอัปโหลด
02คุณรองรับ 32-bit float WAV จาก Zoom F-series หรือ MixPre หรือไม่+
ใช่ แบบเนทีฟ เราอ่านตัวอย่าง float โดยไม่ตัดที่ 0 dBFS เพื่อให้ transients ดังที่คุณวางแผนจะดึงลงมาในการเสวนาได้รับการถอดเสียงอย่างเบาบาง เครื่องมือโหลดทั่วไปส่วนใหญ่ลอบข่มขัด down-cast เป็น 16-bit ก่อน
03ฉันมี WAV 4 แชนเนลจากอุปกรณ์บันทึก — ไมค์หนึ่งต่อคน การแยกผู้พูดจะใช้สิ่งนั้นหรือไม่+
จะใช้ อัปโหลด polyphonic WAV โดยตรง (อย่าทำลงเสีย stereo ก่อน) เราแยกวิเคราะห์เลย์เอาต์แชนเนลจากส่วนหัว WAV และกำหนดผู้พูดคนหนึ่งต่อแทร็ก — เชื่อถือได้มากกว่าการแยกผู้พูดด้วยเสียงบนเสียงที่คล้ายคลึงกัน
04คุณจะ downsample WAV 96 kHz หรือไม่+
อัลกอริทึมทำงานที่ 16 kHz ภายใน — นั่นคือเพดานของความเข้าใจเสียงพูดของมนุษย์ แต่เราเก็บไฟล์ต้นฉบับของคุณไว้ไม่ได้ยุ่ง และใช้เพื่อการประมวลผลหลังการขายเช่นการปิดป้องกันเสียง การส่งออกของคุณอ้างอิงไทม์ไลน์ต้นฉบับ
05WAV แม่นยำกว่า MP3 จริงๆ หรือไม่+
เล็กน้อยใช่ — โดยปกติ 1-2 จุด WER บนพูดเบาบาง ช่องว่างที่ใหญ่กว่าแสดงขึ้นบนเสียงเสี้ยนและส่วนผ่านเบา ซึ่ง psychoacoustic compression ของ MP3 ดำเนินการทิ้งข้อมูลที่อัลกอริทึมจะใช้ สำหรับงานถาวรหรือนิติวิทยาศาสตร์ WAV คือสิ่งที่ถูกต้อง
06ข้อมูล BWF และรหัสเวลา การคงไว้+
เราอ่านชิ้นส่วน BWF (bext iXML) และใช้รหัสเวลาเริ่มต้นเพื่อจัดแนวข้อความกับไทม์ไลน์เซสชันของคุณ WAV ต้นฉบับไม่เคยถูกปรับเปลี่ยน — เราทำงานในสำเนาที่ถูกลบในภายใน 24 ชั่วโมง
07ฉันสามารถวางโฟลเดอร์ WAV จากการส่งออกเซสชัน DAW ได้หรือไม่+
ใช่ การอัปโหลดหลายรายการรับได้สูงสุด 50 ไฟล์พร้อมกัน WAV แต่ละ��ฟล์ได้รับงานและข้อความของตัวเอง ถ้าพวกมันมาจากเซสชันเดียว คุณยังสามารถผสมเข้าเป็น WAV หลายแทร็กเดียวก่อนอัปโหลด และเราจะแยกผู้พูดต่อแชนเนล
08WAV stereo 1 ชั่วโมงใช้เวลาจริงเท่าไหร่+
การอัปโหลดคือส่วนที่ช้าที่สุด — WAV 48 kHz / 24-bit stereo 1 ชั่วโมงคือประมาณ 600 MB และใช้เวลา 2-5 นาทีสำหรับบรอดแบนด์ทั่วไป เมื่ออัปโหลดแล้ว การถอดเสียงเองทำงานในประมาณ 4-6 นาทีในคิวมาตรฐาน

วาง WAV ของคุณ เก็บคุณภาพไม่สูญเสีย ดูผลลัพธ์

ฟรี 30 นาทีทุกเดือน ไม่มีการ์ด การแยกผู้พูดต่อแทร็ก 32-bit float รองรับ ลบเสียงต้นฉบับใน 24 ชั่วโมง

เริ่มฟรี