Transcribe archivos de audio largo.Hasta 10 horas. Sin espera.

Carga un archivo de audio largo — hasta 10 horas, 5 GB en Business. Segmentamos en paralelo, mantenemos los identificadores de locutor consistentes de principio a fin, y te devolvemos una transcripción en lugar de una carpeta numerada.

Suelta tu audio o vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Graba directamente desde tu navegador

Registrarse lleva 30 segundos — la grabación se abre justo después, en el panel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTLos archivos se eliminan automáticamente en 24 h

↓ Un archivo de 5 horas, a mitad de la transcripción

Horas dentro. Archivo limpio afuera.

La mayoría de herramientas agota el tiempo alrededor de los 90 minutos o dividen tu grabación larga en parciales numerados que tienes que unir. Segmentamos en ventanas superpuestas de 12 minutos, procesamos en paralelo, y reensamblamos con un pase global de locutor.

Sesión de estrategia de juntaREC 3 locutores · 5:14:22 · 3.1 GB
auto-detectado en-GB44.1 kHz estéreo · 192 kbps
~90s
Transcripción · archivo único92% de precisión · t=3:14:08
S1

Llevamos tres horas — volvamos al punto de la cadena de suministro de la sesión matutina.

S2

Claro, el cambio de fabricación a Vietnam. Creo que pasamos por alto el riesgo de tiempo de entrega.

S1

Los tiempos de entrega pasaron de 14 a 31 días después del cambio arancelario.

S3

Y eso es antes de considerar la congestión portuaria en Long Beach.

92% en el archivo completo de 5hDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opciones reales · comparación honesta

Otter Pro. Chunking DIY con Whisper. O nosotros.

Las herramientas de consumo limitan la longitud de archivo y truncan silenciosamente. La API de Whisper tiene un límite de 25 MB por solicitud, así que construyes el chunker tú mismo. Aceptamos el archivo completo de 10 horas y devolvemos una transcripción.

Option 01

Otter Pro

Limita archivos largos a 4 horas por grabación. Los identificadores de locutor se desplazan después de las 2 horas.

Longitud máxima de archivo4 horas (nivel Pro)
Tamaño máximo de archivo~1.5 GB de carga
Identificadores de locutor de principio a finSe desplazan después de 2 horas
Salida de archivo largoDocumento único, truncado en el límite
Costo$16.99/usuario/mes
Carga reanudableNo
Best forReuniones cortas menores a 2 horas. Se desmorona en grabaciones de día completo.
Option 02

Transcription.Solutions

10 horas por archivo. Segmentación paralela, pase global de locutor, un DOCX de salida.

Longitud máxima de archivo10 horas (Pro y Business)
Tamaño máximo de archivo2 GB Pro · 5 GB Business
Identificadores de locutor de principio a finPase de embedding global
Salida de archivo largoArchivo único · DOCX/SRT/TXT
Costo · por minuto$0.03 planos independientemente de la longitud
Carga reanudableMultiparte, sobrevive caídas
Best forTalleres de día completo, deposiciones, reuniones de junta, historias orales — cualquier cosa más allá de la barrera de 90 minutos.
Option 03

Whisper API + DIY chunking

La más barata por minuto. Construyes el chunker, la costura de locutor, y la lógica de reintento.

Longitud máxima de archivo25 MB por solicitud (~25 min)
Tamaño máximo de archivoLímite duro de 25 MB
Identificadores de locutor de principio a finNinguno — sin diarización
Salida de archivo largoParciales numerados, tú unes
Costo · por minuto$0.006 (OpenAI Whisper)
Tiempo de ingenieríaHoras a días por pipeline
Best forIngenieros que quieren texto sin procesar por chunk y no necesitan locutores, resúmenes, o una salida única.

Precios y límites precisos a partir de mayo de 2026. Límite de longitud de Otter Pro verificado por última vez en su página de precios pública.

Específico para archivos largos

Tres formas en que las herramientas genéricas mueren después de los 90 minutos.

La mayoría de pipelines fueron construidos para reuniones de una hora. El audio largo los rompe de formas predecibles — aquí está lo que hacemos diferente.

Qué sale mal

  1. 1Timeout silencioso a los 90 minutos. El trabajo gira durante una hora, luego muere sin un error útil. Te queda nada para reintentar.
  2. 2Los IDs de locutor se desplazan entre chunks. Locutor 1 a la hora 1 se convierte en Locutor 4 a la hora 3 porque cada chunk se diariza en aislamiento.
  3. 3La salida es una carpeta numerada. `transcript_part_01.txt` hasta `transcript_part_24.txt` con restablecimiento de timestamps en cada límite de chunk. Tú lo unes tú mismo.

Qué cambiar aquí

  1. 1Carga multiparte reanudable. ¿La conexión se cae a la hora 2 de carga? Se reanuda desde la última parte completada. Sin recarga de 4 GB.
  2. 2Pase de embedding global de locutor. Después de diarización por chunk, agrupamos voces en todo el archivo para que Locutor 3 sea la misma persona en minuto 12 y minuto 487.
  3. 3DOCX único con marcadores de hora. Un archivo, timestamps continuos, pausa de capítulo opcional cada 60 minutos. Sin costura.

Configuración de trabajo recomendada para archivos largos

Carga cualquier cosa más allá de 90 minutos y estas se activan automáticamente. Anula por trabajo desde el formulario.

Estrategia de chunk
ventanas de 12 min · superposición de 10s
Diarización
Pase global en todos los chunks
Modelo de locutor
Formato largo · 2-20 locutores
Carga
Multiparte reanudable
Cola
Prioritaria (plan Business)
Exportación
DOCX único · marcadores de hora activados

Accuracy · real-world numbers

92% se mantiene en un archivo de 5 horas. La calidad permanece plana hora tras hora.

Lo difícil con audio largo no es el modelo — es mantener la precisión plana de minuto 1 a minuto 600. La desviación de locutor y los errores de límite de chunk son lo que mata la mayoría de pipelines. Los números a continuación se miden en archivos de cliente de longitud completa, no en los primeros 10 minutos.

95%
Estudio formato largo, locutor único

Narración de audiolibro, podcast en solitario, manuscrito dictado. 6-10 horas de voz limpia sin ruido ambiental. Sin necesidad de diarización.

92%
Sala de junta, 2-6 locutores

Mesa de conferencia, micrófono decente, 3-5 horas. El pase global de locutor mantiene los IDs estables en todo el archivo.

88%
Taller de día completo, micrófonos de solapa

Día de capacitación de 7-9 horas con cambios de micrófono y preguntas y respuestas de la audiencia. Los nombres necesitan un pase de 5 minutos en los chips de locutor.

82%
Mesa redonda de campo, 8+ locutores

Historia oral larga, grupo focal, o panel con voces superpuestas y ruido ambiental. Usable, pero espera limpieza.

Preguntas comunes

8 cosas que la gente pregunta sobre transcripción de audio largo.

01¿Cuál es el límite real de longitud y tamaño de archivo?+
10 horas por archivo en Pro y Business. Pro limita el tamaño de archivo a 2 GB, Business a 5 GB. Si tienes algo más largo que 10 horas, divídelo una vez en una pausa natural — mantendremos los IDs de locutor consistentes si los cargas uno después del otro en el mismo proyecto.
02¿Obtengo una transcripción o una carpeta de parciales numerados?+
Un archivo. Siempre. DOCX, SRT, TXT, o JSON — tu elección. Los timestamps corren continuamente de 00:00:00 al final de la grabación, no reinician en cada límite de chunk.
03¿Cuánto tiempo tarda en regresar un archivo de 6 horas?+
Aproximadamente 18-25 minutos en la cola Pro, 8-12 en prioridad Business. Procesamos los chunks de 12 minutos en paralelo, por lo que el tiempo de reloj se escala de forma sublineal con la longitud del archivo, no minuto a minuto.
04¿Los IDs de locutor permanecen consistentes de principio a fin?+
Sí. Después de diarización por chunk, un pase de embedding global agrupa voces en todo el archivo. Locutor 3 en minuto 12 es el mismo Locutor 3 en minuto 487. Esto es lo principal que los pipelines DIY de Whisper se equivocan.
05¿Qué sucede si mi carga se cae a la hora 3 de un archivo de 4 GB?+
La carga multiparte reanudable se reanuda desde la última parte completada. No recarga los primeros 3 GB. Funciona en Wi-Fi de hotel inestable y tethering celular — probamos ambos.
06¿Por qué la API de Whisper se atraganta con archivos largos?+
El endpoint de Whisper de OpenAI tiene un límite duro de 25 MB por solicitud — aproximadamente 25 minutos de audio comprimido. Cualquier cosa más larga requiere que hagas chunking, transcriba en paralelo, luego cose transcripciones y alinee los locutores tú mismo. Hacemos todo eso del lado del servidor.
07¿Es el precio por minuto el mismo en un archivo de 10 horas que en un archivo de 10 minutos?+
Sí. $0.03 por minuto plano, independientemente de la longitud. Un archivo de 10 horas cuesta $18. No aplicamos sobrecargo a archivos largos como lo hace Rev ($1.50/min humano × 10 horas = $900).
08¿Puedo obtener marcadores de capítulo o timestamps cada hora?+
Activa 'Marcadores de hora' en el formulario de trabajo y el DOCX exporta con una pausa de encabezado cada 60 minutos. SRT mantiene código de tiempo continuo. JSON tiene ambos — matriz de capítulos más timestamps de nivel de palabra.

Carga tu archivo largo. Obtén una transcripción de regreso.

30 minutos gratis cada mes. Sin tarjeta. Archivos hasta 10 horas, etiquetas de locutor que permanecen consistentes, exportación de archivo único.

Comenzar gratis