Transcriu arxius d'àudio llargs.Fins a 10 hores. Sense límit de temps.

Carrega un arxiu d'àudio llarg — fins a 10 hores, 5 GB en Business. Dividim en paral·lel, mantenim les IDs de parlants consistents de principi a fi, i retornem una única transcripció en lloc d'una carpeta numerada.

Deixa-hi l'àudio o el vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grava directament des del navegador

El registre triga 30 segons — la gravació s'obre just després, al dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTEls fitxers s'esborren en 24 h

↓ Un arxiu de 5 hores, a meitat de la transcripció

Hores dins. Un arxiu net fora.

La majoria d'eines s'estallen al voltant de la marca de 90 minuts o divideixen la teva gravació llarga en parcials numerats que has de cosir. Dividim en finestres solapades de 12 minuts, les processem en paral·lel i les reassemblem amb una passada global de parlant.

Sessió d'estratègia de juntaREC 3 parlants · 5:14:22 · 3.1 GB
detectat automàticament en-GB44.1 kHz estèreo · 192 kbps
~90s
Transcripció · arxiu únic92% de precisió · t=3:14:08
S1

Portem tres hores — tornem al tema de la cadena de subministrament de la sessió del matí.

S2

Clar, el gir de la manufactura a Vietnam. Crec que vam passar per alt el risc de temps de lliurament.

S1

Els temps de lliurament van passar de 14 a 31 dies després del canvi d'aranzels.

S3

I això és abans de tenir en compte la congestió portuària a Long Beach.

92% en tot l'arxiu de 5hDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opcions reals · comparació honesta

Otter Pro. Chunking DIY de Whisper. O nosaltres.

Les eines de consum limiten la longitud dels arxius i els trunquen silenciosament. L'API de Whisper té un límit de 25 MB per sol·licitud, així que tu construeixes el divisor. Acceptem tot l'arxiu de 10 hores i retornem una única transcripció.

Option 01

Otter Pro

Limita arxius llargs a 4 hores per gravació. Les etiquetes de parlant es desviuen després de la marca de 2 hores.

Longitud màxima de l'arxiu4 hores (nivell Pro)
Mida màxima de l'arxiu~1,5 GB de càrrega
IDs de parlant de principi a fiEs desvia després de 2 hores
Sortida de l'arxiu llargDocument únic, truncat al límit
Cost$16,99/usuari/mes
Càrrega reanudableNo
Best forReunions curtes de menys de 2 hores. Es col·lapsa en gravacions de tot el dia.
Option 02

Transcription.Solutions

10 hores per arxiu. Chunking paral·lel, passada de parlant global, un DOCX de sortida.

Longitud màxima de l'arxiu10 hores (Pro i Business)
Mida màxima de l'arxiu2 GB Pro · 5 GB Business
IDs de parlant de principi a fiPassada global d'embedding
Sortida de l'arxiu llargArxiu únic · DOCX/SRT/TXT
Cost · per minut$0,03 plans independentment de la longitud
Càrrega reanudableMultipart, resistent a bestretes
Best forTallers de tot el dia, deposicions, reunions de junta, històries orals — qualsevol cosa més enllà de la barrera de 90 minuts.
Option 03

Whisper API + chunking DIY

Més barat per minut. Tu construeixes el divisor, la costura de parlant i la lògica de reintent.

Longitud màxima de l'arxiu25 MB per sol·licitud (~25 min)
Mida màxima de l'arxiuLímit dur de 25 MB
IDs de parlant de principi a fiCap — sense diarització
Sortida de l'arxiu llargParcials numerats, tu cosius
Cost · per minut$0,006 (OpenAI Whisper)
Temps d'enginyeriaHores a dies per pipeline
Best forEnginyers que volen text brut per chunk i no necessiten parlants, resum o una sortida única.

Preus i límits precisos a partir de maig de 2026. Límit de longitud de Otter Pro verificat per última vegada a la seva pàgina de preus públics.

Específic per a arxius llargs

Tres maneres en què les eines genèriques moren més enllà de la marca de 90 minuts.

La majoria de pipelines es van construir per a reunions d'una hora. L'àudio llarg els trenca de maneres previsibles — aquí és el que fem diferent.

Què va malament

  1. 1Timeout silencioso als 90 minuts. El treball gira durant una hora, després mor sense un error útil. Et quedes sense res per a reintentar.
  2. 2Les IDs de parlant es desviuen entre chunks. Parlant 1 a l'hora 1 es converteix en Parlant 4 a l'hora 3 perquè cada chunk es diaritza aïlladament.
  3. 3La sortida és una carpeta numerada. `transcript_part_01.txt` fins a `transcript_part_24.txt` amb restabliments de marques de temps a cada límit de chunk. Tu la cosius tu mateix.

Què canviar aquí

  1. 1Càrrega multipart reanudable. La connexió es cau a l'hora 2 de la càrrega? Es reprèn des de la darrera part completada. Sense re-càrrega de 4 GB.
  2. 2Passada global d'embedding de parlant. Després de la diarització per chunk, agrupem veus en tot l'arxiu perquè Parlant 3 sigui la mateixa persona al minut 12 i al minut 487.
  3. 3DOCX únic amb marcadors d'hora. Un arxiu, marques de temps contínues, trencament de capítol opcional cada 60 minuts. Sense costura.

Configuració de treball recomanada per a arxius llargs

Deixa qualsevol cosa més de 90 minuts i aquestes es canvien automàticament. Anul·la per treball des del formulari.

Estratègia de chunk
Finestres de 12 min · 10s de solapament
Diarització
Passada global en tots els chunks
Model de parlant
Llarga durada · 2-20 parlants
Càrrega
Multipart reanudable
Cua
Prioritat (pla Business)
Exportació
DOCX única · marcadors d'hora activats

Accuracy · real-world numbers

92% es manté en un arxiu de 5 hores. La qualitat es manté plana hora a hora.

La part difícil amb l'àudio llarg no és el model — és mantenir la precisió plana del minut 1 al minut 600. La deriva de parlant i els errors als límits de chunks són els que maten la majoria de pipelines. Els números següents es mesuren en arxius de clients de longitud completa, no en els primers 10 minuts.

95%
Studio de llarga durada, parlant únic

Narració d'audiollibre, podcast en solitari, manuscrit dictat. 6-10 hores de veu neta sense soroll de sala. No es necessita diarització.

92%
Sala de junta, 2-6 parlants

Taula de conferència, micròfon decent, 3-5 hores. La passada de parlant global manté les ID estables en tot l'arxiu.

88%
Taller de tot el dia, micròfons de solapa

Dia de formació de 7-9 hores amb canvis de micròfon i preguntes i respostes públiques. Els noms necessiten una passada de 5 minuts en els xips de parlant.

82%
Taula rodona de camp, 8+ parlants

História oral llarga, grup de discussió o panell amb veus solapades i soroll ambiental. Usable, però espera neteja.

Preguntes freqüents

8 coses que la gent pregunta sobre la transcripció d'àudio llarg.

01Quin és el límit real de longitud i mida de l'arxiu?+
10 hores per arxiu tant en Pro com en Business. Pro limita la mida de l'arxiu a 2 GB, Business a 5 GB. Si tens quelcom més de 10 hores, divideix-lo una vegada en un trencament natural — mantindrem les IDs de parlant consistents si les carregues consecutivament en el mateix projecte.
02Obtinc una transcripció o una carpeta de parcials numerats?+
Un arxiu. Sempre. DOCX, SRT, TXT o JSON — la teva tria. Les marques de temps corren contínuament de 00:00:00 fins al final de la gravació, no es restableixen a cada límit de chunk.
03Quant temps tarda en tornar un arxiu de 6 hores?+
Més o menys 18-25 minuts a la cua Pro, 8-12 a la prioritat Business. Processem els chunks de 12 minuts en paral·lel, de manera que el temps s'escala sub-linealment amb la longitud de l'arxiu, no minut a minut.
04Les IDs de parlant es mantenen consistents de principi a fi?+
Sí. Després de la diarització per chunk, una passada global d'embedding agrupa veus en tot l'arxiu. Parlant 3 al minut 12 és el mateix Parlant 3 al minut 487. Això és la cosa principal que els pipelines DIY de Whisper fan malament.
05Què passa si la meva càrrega cau a l'hora 3 d'un arxiu de 4 GB?+
La càrrega multipart reanudable es reprèn des de la darrera part completada. No has de re-carregar els primers 3 GB. Funciona en Wi-Fi d'hotel inestable i tethering cel·lular — hem provat ambdós.
06Per què l'API de Whisper s'estrangula amb arxius llargs?+
L'endpoint de Whisper d'OpenAI té un límit dur de 25 MB per sol·licitud — uns 25 minuts d'àudio comprimit. Qualsevol cosa més llarga necessita que divideixis, transcribiu en paral·lel, després cosiu transcripcions i alineeu parlants. Ho fem tot del costat del servidor.
07El preu per minut és el mateix en un arxiu de 10 hores que en un arxiu de 10 minuts?+
Sí. $0,03 per minut plans, independentment de la longitud. Un arxiu de 10 hores costa $18. No sobrecarreguem arxius llargs com fa Rev ($1,50/min humana × 10 hores = $900).
08Puc obtenir marcadors de capítol o marques de temps cada hora?+
Alterna 'Marcadors d'hora' al formulari de treball i el DOCX exporta amb una pausa d'encapçalament cada 60 minuts. SRT manté el codi de temps continu. JSON té ambdós — matriu de capítols més marques de temps a nivell de paraula.

Carrega el teu arxiu llarg. Obtén una transcripció.

30 minuts gratuïts cada mes. Sense targeta. Arxius fins a 10 hores, etiquetes de parlant que es mantenen consistents, exportació d'arxiu únic.

Comença gratis