I-transkribe ang mahabang audio files.Hanggang 10 oras. Walang timeout.

Ilagay ang mahabang audio file — hanggang 10 oras, 5 GB sa Business. Gumagawa kami ng chunks nang magkakasabay, pinapanatili ang speaker IDs na consistent mula simula hanggang dulo, at naghahatid ng isang transcript sa halip na numbered folder.

I-drop ang audio o video mo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Mag-record diretso mula sa browser mo

30 segundo lang ang sign up — bubukas agad ang recording sa dashboard pagkatapos.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTAwtomatikong nabubura ang files sa 24h

↓ Isang 5-hour file, mid-transcript

Oras na. Isang malinis na file out.

Karamihan sa tools ay nag-timeout sa paligid ng 90-minute mark o naghahati ng iyong mahabang recording sa numbered partials na kailangang isama. Gumagawa kami ng chunks sa 12-minute overlapping windows, nagpoproseso nang magkakasabay, at muling isinasama gamit ang global speaker pass.

Sesyon ng board strategyREC 3 speakers · 5:14:22 · 3.1 GB
awtomatikong na-detect en-GB44.1 kHz stereo · 192 kbps
~90s
Transcript · isang file92% tumpak · t=3:14:08
S1

Tatlong oras na kami — bumalik tayo sa supply chain point mula sa umaga.

S2

Tama, ang Vietnam manufacturing pivot. Naisip ko na lumabas kami sa lead-time risk.

S1

Ang lead times ay bumago mula 14 hanggang 31 na araw pagkatapos ng tariff change.

S3

At iyan pa ay bago natin isaalang-alang ang port congestion sa Long Beach.

92% sa buong 5h fileDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tatlong tunay na opsyon · matapat na paghahambing

Otter Pro. DIY Whisper chunking. O kami.

Ang consumer tools ay nag-cap ng file length at tahimik na nag-truncate. Whisper API ay may 25 MB per-request ceiling, kaya ikaw ang gumagawa ng chunker. Tatanggap namin ang buong 10-hour file at maghahatid ng isang transcript.

Option 01

Otter Pro

Nag-cap ng long files sa 4 oras bawat recording. Ang speaker labels ay tumitindig lampas sa 2-hour mark.

Max na haba ng file4 oras (Pro tier)
Max na laki ng file~1.5 GB upload
Speaker IDs mula simula hanggang duloTumitindig lampas 2 oras
Long-file outputIsang doc, truncated sa cap
Presyo$16.99/user/buwan
Resumable na uploadHindi
Best forMaikling meetings sa loob ng 2 oras. Nasisirang sa day-long recordings.
Option 02

Transcription.Solutions

10 oras bawat file. Parallel chunking, global speaker pass, isang DOCX out.

Max na haba ng file10 oras (Pro & Business)
Max na laki ng file2 GB Pro · 5 GB Business
Speaker IDs mula simula hanggang duloGlobal embedding pass
Long-file outputIsang file · DOCX/SRT/TXT
Presyo · bawat minuto$0.03 flat anuman ang haba
Resumable na uploadMultipart, nakakasabay sa pagbagsak
Best forDay-long workshops, depositions, board meetings, oral histories — kahit ano lampas sa 90-minute wall.
Option 03

Whisper API + DIY chunking

Pinakamura bawat minuto. Ikaw ang gumagawa ng chunker, speaker stitch, at retry logic.

Max na haba ng file25 MB bawat request (~25 min)
Max na laki ng file25 MB hard cap
Speaker IDs mula simula hanggang duloWala — walang diarization
Long-file outputNumbered partials, ikaw ang magsamang
Presyo · bawat minuto$0.006 (OpenAI Whisper)
Engineering timeOras hanggang araw bawat pipeline
Best forEngineers na gustong raw text bawat chunk at hindi kailangan ng speakers, summaries, o isang output.

Ang pricing at limits ay tumpak mula Mayo 2026. Otter Pro length cap ay huling na-verify sa kanilang public pricing page.

Specific sa long files

Tatlong paraan kung paano namamatay ang generic tools lampas sa 90-minute mark.

Karamihan sa pipelines ay itinayo para sa one-hour meetings. Ang long audio ay sinisirang ang mga ito sa predictable na paraan — nito ang ibang ginagawa namin.

Kung ano ang napupunta nang mali

  1. 1Silent timeout sa 90 minuto. Ang trabaho ay umiikot ng oras, pagkatapos ay namamatay nang walang kapaki-pakinabang na error. Ikaw ay naiwan ng walang dapat i-retry.
  2. 2Speaker IDs ay tumitindig sa pagitan ng chunks. Ang Speaker 1 sa oras 1 ay nagiging Speaker 4 sa oras 3 dahil bawat chunk ay diarized nang hiwalay.
  3. 3Output ay isang numbered folder. `transcript_part_01.txt` hanggang `transcript_part_24.txt` na may timestamp resets sa bawat chunk boundary. Ikaw ay nagsamang nito.

Kung ano ang i-flip dito

  1. 1Resumable multipart upload. Ang connection ay bumaba sa oras 2 ng upload? Muling nagsimula mula sa huling nakamit na part. Walang re-upload ng 4 GB.
  2. 2Global speaker embedding pass. Pagkatapos ng per-chunk diarization, nag-cluster kami ng mga boses sa buong file kaya ang Speaker 3 ay pareho sa tao sa minuto 12 at minuto 487.
  3. 3Isang DOCX na may oras markers. Isang file, patuloy na timestamps, optional chapter break bawat 60 minuto. Walang stitching.

Inirekomendahang job settings para sa long files

Ilagay ang kahit ano sa loob ng 90 minuto at ang mga ito ay awtomatikong naka-on. I-override bawat-trabaho mula sa form.

Chunk strategy
12 min windows · 10s overlap
Diarization
Global pass sa lahat ng chunks
Speaker model
Long-form · 2-20 speakers
Upload
Resumable multipart
Queue
Priority (Business plan)
Export
Isang DOCX · oras markers on

Accuracy · real-world numbers

92% ay nakanatili sa loob ng 5-hour file. Kalidad ay nananatiling flat hour-to-hour.

Ang mahirap sa mahabang audio ay hindi ang model — ito ay pagpanatili ng accuracy na flat mula minuto 1 hanggang minuto 600. Ang speaker drift at chunk-boundary errors ang nagsasama sa karamihan ng pipelines. Ang mga numero sa ibaba ay sinusukat sa buong-haba ng customer files, hindi sa unang 10 minuto.

95%
Studio long-form, isang speaker

Audiobook narration, solo podcast, dictated manuscript. 6-10 oras ng malinis na boses na walang room noise. Walang diarization na kailangan.

92%
Boardroom, 2-6 speakers

Conference table, decent mic, 3-5 oras. Ang global speaker pass ay nagpapanatili ng IDs na matatag sa buong file.

88%
All-day workshop, lapel mics

7-9 oras na training day na may mic handoffs at audience Q&A. Ang mga pangalan ay nangangailangan ng 5-minute pass sa speaker chips.

82%
Field roundtable, 8+ speakers

Mahabang oral history, focus group, o panel na may overlapping voices at ambient noise. Magagamit, pero inaasahan ang cleanup.

Mga itinatanong na tanong

8 bagay na itinatatanong ng mga tao tungkol sa pag-transkribe ng mahabang audio.

01Ano ang aktwal na file length at size limit?+
10 oras bawat file sa parehong Pro at Business. Ang Pro ay nag-cap ng file size sa 2 GB, Business sa 5 GB. Kung mayroon kang higit 10 oras, i-split ito nang beses sa natural na break — kami ay magpapanatili ng speaker IDs na consistent kung i-upload mo ang mga ito nang pabalik-balik sa parehong proyekto.
02Makakatanggap ba ako ng isang transcript o folder ng numbered partials?+
Isang file. Palagi. DOCX, SRT, TXT, o JSON — iyong pagpipilian. Ang mga timestamps ay tumatakbo nang patuloy mula 00:00:00 hanggang sa dulo ng recording, hindi reset sa bawat chunk boundary.
03Gaano katagal ang comeback ng 6-hour file?+
Mahigit 18-25 minuto sa Pro queue, 8-12 sa Business priority. Tinatanggap namin ang 12-minute chunks nang magkakasabay, kaya ang wall-clock time ay sub-linearly na sumusukat sa file length, hindi minuto-for-minuto.
04Ang speaker IDs ay nananatiling consistent mula simula hanggang dulo?+
Oo. Pagkatapos ng per-chunk diarization, ang global embedding pass ay nag-cluster ng mga boses sa buong file. Ang Speaker 3 sa minuto 12 ay pareho ang Speaker 3 sa minuto 487. Ito ang pangunahing bagay na nakukuha ng DIY Whisper pipelines na mali.
05Ano ang mangyayari kung ang aking upload ay bumaba sa oras 3 ng 4 GB file?+
Ang resumable multipart upload ay nagsisimula mula sa huling nakamit na bahagi. Hindi mo muling i-upload ang unang 3 GB. Gumagana sa flaky hotel Wi-Fi at cellular tethering — pareho ang nasubukan.
06Bakit nag-choke ang Whisper API sa long files?+
Ang OpenAI's Whisper endpoint ay may 25 MB per-request hard cap — humigit-kumulang 25 minuto ng compressed audio. Kahit ano na mas mahaba ay nangangailangan sa iyo na mag-chunk, transkribe nang magkakasabay, pagkatapos ay magsamang transcripts at i-align ang speakers mo. Ginagawa namin lahat nito server-side.
07Pareho ba ang per-minute price sa 10-hour file sa 10-minute file?+
Oo. $0.03 bawat minuto flat, anuman ang haba. Ang 10-hour file ay nagkakahalaga ng $18. Hindi kami nag-surcharge ng long files ang paraan ng Rev ay ginagawa ($1.50/min human × 10 oras = $900).
08Makakakuha ba ako ng chapter markers o timestamps bawat oras?+
I-toggle ang 'Hour markers' sa job form at ang DOCX ay nag-export na may heading break bawat 60 minuto. Ang SRT ay nagpapanatili ng patuloy na timecode. Ang JSON ay may parehong — chapter array plus word-level timestamps.

Ilagay ang iyong long file. Makatanggap ng isang transcript bumalik.

30 libreng minuto bawat buwan. Walang card. Mga file hanggang 10 oras, speaker labels na nananatiling consistent, single-file export.

Magsimula nang libre