Gbé WAV files pẹ̀lú àmì onísọ̀rọ̀.Ìtọ́jú aipadilẹ̀.

Tẹ WAV recording kúrò nínú rig ìkádùn rẹ, DAW bounce, tàbí interview kit. A ń ṣe 24-bit headroom jẹ́kó, run diarization lójúu raw PCM, àti rìtúnda transcript tí ó ní àkótán akókò pẹ̀lú SRT ní àwọnsìn.

Sọ ohùn tàbí fídíò rẹ sílẹ̀

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Gba ohùn sílẹ̀ tààrà láti inú aṣàwákiri rẹ

Forúkọ sílẹ̀ máa gba ìṣẹ́jú 30 — gbígba sílẹ̀ máa ṣí lẹ́sẹ̀kẹsẹ̀, nínú dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFiles auto-delete in 24h

↓ Wò ohun tí ó jáde

Raw PCM wọ̀. Transcript ìmọ̀ jáde.

Lossless WAV túmọ̀ gbògbó sibilant, plosive, àti ọ̀rọ̀ ìpakín bá á ń rìlọ tútúnu — àìníí MP3 smear lórí consonants. Bá oríṣun báà jẹ́ multi-track (onísọ̀rọ̀ kan fún channel), a tẹ́ acoustic diarization mọ̀ kọjá àti pin lórí channel layout.

WAV · 48 kHz / 24-bitREC 2 tracks · 1h 12m · 743 MB
auto-detected en-GBstereo PCM · uncompressed
~90s
Transcript · streaming97% accuracy
S1

Gbà mí padà sí owó ìmọ́lẹ àrọjọ́ náà ní -eight fun — àkókò wo ló dé bẹ̀ẹ̀ ìpè?

S2

Quarter to five, give or take. Kettle ní ẹ̀kọja, mo ríran nínú iyẹn.

S1

Àti láti níbẹ̀ ẹ fáráwesẹ̀ sígunagunà sí ọ̀pá àgbálowó?

S2

Sígunagunà sí boatyard. Éèkú àti imọ̀lẹ̀ ní olúìyá nígbà tí mo wọ̀.

97% lórí per-track WAVSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Àwọn àǹfání mẹ́ta gidi · ìwéwádo onítòótọ̀

Adobe Audition. Descript. Àbí àwa.

Audition's Speech to Text ní ifẹ̀ Creative Cloud àti ó dúró nínú timeline. Descript ń ṣe import WAV sínú editor ire rẹ. A gbà file gẹ́gẹ́ bó ṣe dé, rìtúnda àwọn standard exports, àti à beèrè ẹ lọ́wọ́ láti gba project rẹ sórí ibodè.

Option 01

Adobe Audition / Premiere

Transcript panel nínú Adobe timeline. Ópìlẹ̀ CC subscription àti project file.

Ní ìbereCreative Cloud subscription
Speaker diarizationBẹ́ẹ̀ni, mixed-down nìkan
Multi-track WAVFlattened túnbẹ̀ STT
ExportSRT · CSV · XML
Àwọn ede18, manual select
Owo~$23/mo (single app)
Best forÀwọn onítọ́jú arówójù tí wọ́n ní ìmụ́ńnú nínú Premiere tàbí Audition tí wọ́n ń rá fún captions tí á tẹ́jádè nínú timeline.
Option 02

Transcription.Solutions

Tẹ WAV. Per-channel diarization bá ó bá jẹ́ multi-track. Source atilẹ́yìn ní 24h.

Ní ìbereNkan — ṣugbọn file nìkan
Speaker diarizationPer-track tàbí acoustic
Multi-track WAVÓ ka 16 channels
ExportSRT · VTT · DOCX · TXT · JSON
Àwọn ede99, auto-detected
Owo · per min$0.03
Best forAlárá síba pínpín WAV — field recordists, podcasters bouncing láti DAW, oral history archivists, àwọn ọ̀nà-ìwádìí.
Option 03

Descript

Ń ṣe import WAV rẹ sínú Descript's editor. Aláwa, ṣùgbọ́n ẹ gbọ́dọ̀ ṣe iṣẹ́ nínú rẹ.

Ní ìbereDescript account + import
Speaker diarizationAcoustic, EN-tuned
Multi-track WAVImport gẹ́gẹ́ clips ọ̀tọ̀.
ExportTXT · SRT · DOCX
Àwọn ede23, accuracy síìwáyan
Owo$16–24/user/mo
Best forÀwọn editor podcast tí wọ́n ń rá láti tún-àtunyẹ́wò audio nípasẹ̀ tún-àtunyẹ́wò transcript — Descript's true ṛìn àbù.

Pricing accurate as of 2026. Adobe and Descript feature flags change frequently; check current docs before committing.

Pataki fun WAV

Àwọn nǹkan mẹ́ta tí ó jẹ́ ìnírá jùlọ ní **àwọn alápa gbigbẹ̀ tí a lò**.

Ibadandun lọpọ̀ sílẹ̀ntì downsample WAV rẹ túnbẹ̀ tẹ́ ẹ sí recognizer. A ko sẹ̀.

Ohun tí ó kọ́ síbi

  1. 1Multi-track WAV á gba túnkúnkun. A 4-channel field recording láti Sound Devices MixPre á gba ní mono túnbẹ̀ STT. Per-mic separation tí ẹ san fún á tẹ̀ lọ.
  2. 232-bit float WAVs láti Zoom F-series tàbí MixPre á kọ láìfẹ́, tàbí clipped sí 16-bit àti tí á máa padilẹ̀ headroom recovery.
  3. 396 kHz / 24-bit interviews ń lo àlafia nǹkan lórí upload nítorí alápa re-encodes sí MP3 nínú browser túnbẹ̀ tẹ́ ẹ.

Ohun tí á yẹ lọ níhìn-yẹn

  1. 1Tẹ multi-track WAV gẹ́gẹ́ bó ṣe dé (ó ka 16 channels). A ka channel layout láti WAV header àti pin onísọ̀rọ̀ kan fún track — àìní acoustic guessing.
  2. 232-bit float á gba gẹ́gẹ́ onídánidán. A ń ṣaalẹ̀gbìn float headroom nígbà tí a ń normalise fún recognizer, nítorí peaks above 0 dBFS ko píèrò.
  3. 3Direct binary upload, àìní transcode nínú browser. A 2 GB WAV ń lọ lórí rẹ full bandwidth àti ibẹ̀rẹ̀ processing nígbà tí byte ìsẹ̀ọ́kọ̀ dé.

Àwọn job settings tó yẹ fún WAV

Tẹ WAV àti àwọn èyí á máa ọ̀ nísinsin, Standard láti job ifò.

Sample rate
Native (àìní downsample)
Bit depth
24-bit / 32-float preserved
Diarization
Per-channel bá ó bá jẹ́ multi-track
Speaker model
Interview · 2-8 speakers
Filler words
Kept (toggle off bá ó ní nǹkan láti se)
Export
DOCX · SRT · timestamped TXT

Accuracy · real-world numbers

97%+ lórí per-track WAV. WAV fún recognizer àwọn ìmọ̀ tí ó dára jùlọ.

Nítorí WAV tọjú raw PCM láìní psychoacoustic compression, consonants àti sibilants àìní smear gẹ́gẹ́ bi MP3 ń smear wọn kia. Recognizer gbọ́ ohun tí microphone gbọ́ nínú. Àwọn nomba níbè yíò láti real customer WAV jobs ní production.

98%
Studio WAV · onísọ̀rọ̀ sokan

48 kHz / 24-bit, large-diaphragm condenser, treated room. Narration, audiobook, voice-over bookings dúró níhìn-yẹn.

96%
Multi-track interview WAV

Channel kan fún onísọ̀rọ̀ kan (lavs tàbí boundary mics). Diarization jẹ́ nìkan channel routing — text-only error.

92%
Handheld field recorder

Zoom H5, Tascam DR-40, àfíìkúnnu. Stereo XY pickup, 2-3 speakers, some room reflection. Majority podcast WAVs dúró níhìn-yẹn.

85%
Noisy environment field WAV

Outdoor, café, vehicle. Lossless capture ní iranlọwọ́ — àsìkò àbínukúnnu jẹ́ gidi, àìní codec artefact — ṣùgbọ́n accuracy sàn lórí overlapping speech.

Àwọn ìbéèrè tí a lò pátápátá

8 nǹkan tí àwọn ènìyàn ń béèrè nípa WAV síìgbé ọrọ.

01Kini maximum WAV file size?+
5 GB per file lórí standard plan, eyí tí ó jẹ́ approximately 8 hours of stereo 48 kHz / 24-bit, tàbí 2.5 hours of 96 kHz / 24-bit. Àwọn files tó jù lọ dáadá lórí team plan — ki ẹ kọ̀ọ̀ wa túnbẹ̀ upload.
02Àse ẹ gba 32-bit float WAV láti Zoom F-series tàbí MixPre?+
Bẹ́ẹ̀ni, nísinsin. A ka float samples láìní clipping ní 0 dBFS, nítorí loud transients tí ẹ tì sá láti tú dúró nínú post a tún ń síìgbé dímọ̀. Majority generic uploaders sílẹ̀ntì down-cast sí 16-bit kì á.
03Mo ní 4-channel WAV láti field recorder — mic kan fún onísọ̀rọ̀ kan. À lo èyí?+
Àá lo. Tẹ polyphonic WAV tóra (má bo sí stereo kì á). A gúnwù channel layout láti WAV header àti pin onísọ̀rọ̀ kan fún track — dìyele dáadá jùlọ jù acoustic diarization lór�� similar voices.
04Àse ẹ á downsample 96 kHz WAV mi?+
Recognizer ń gbé ní 16 kHz nínúhìn — èkó ẹ̀dun human speech intelligibility. Ṣùgbọ́n a ní file ìtúkọ̀ rẹ jẹ́kó àti ó lò ní àáǹfáníì mẹ́ tí a máa ṣẹ gẹ́gẹ́ noise gating. Àwọn exports rẹ túwo ìtúkọ̀ timeline.
05WAV àbínúkúnnu oníkakajù jù MP3 fún síìgbé ọrọ?+
Níbi díẹ̀, bẹ́ẹ̀ni — usually 1-2 points of WER lórí clean speech. Àǹfáníì tó tó ju lọ fo lórí sibilants àti quiet passages, níbi tí MP3's psychoacoustic compression tẹ àwọn ìmọ̀ recognizer yóo ti lo. Fún archival tàbí forensic work, WAV jẹ́ àǹfáníì tó tọ́.
06À tá àwọn BWF metadata àti timecode?+
A ka BWF chunks (bext, iXML) àti lo start timecode láti wo transcript lórí session timeline rẹ. Original WAV àìní iye — a ṣe iṣẹ́ lórí kaakì tí á atilẹ́yìn ní ìlopin 24h.
07Àse mo lè tẹ folder of WAV files láti DAW session export?+
Bẹ́ẹ̀ni. Batch upload á gbà ó ka 50 files ní opposite times. WAV kọ��ọ̀kan á ní job àti transcript ire re. Bá wọ́n ba jẹ́ stems láti one session, ẹ tún le merge wọn ká WAV multi-track kan túnbẹ̀ upload àti a á diarize per channel.
08Kìlọ̀ àkókò 1-hour stereo WAV yóó gba?+
Upload jẹ́ ìbadandun tó dárá — 1-hour 48 kHz / 24-bit stereo WAV bá jẹ́ approximately 600 MB àti ó gba 2-5 minutes lórí typical broadband. Kí á tí lọ ọ̀ upload, síìgbé ọrọ ire ara rẹ ń gbé nínú approximately 4-6 minutes lórí standard queue.

Tẹ WAV rẹ. ṢE ìtọ́jú aipadilẹ̀. Wò ohun tí ó jáde.

30 free minutes every month. No card. Per-track diarization, 32-bit float supported, source audio deleted in 24h.

Start free