Transcribir archivos WAV con etiquetas de hablante.Calidad sin pérdidas.

Suelta una grabación WAV directamente desde tu equipo de campo, rebote de DAW o kit de entrevista. Mantenemos la resolución de 24 bits intacta, ejecutamos diarización en el PCM sin procesar y devolvemos una transcripción con marca de tiempo y SRT en minutos.

Suelta tu audio o vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Graba directamente desde tu navegador

Registrarse lleva 30 segundos — la grabación se abre justo después, en el panel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTLos archivos se eliminan automáticamente en 24 h

↓ Mira qué sale

PCM sin procesar entra. Transcripción limpia sale.

WAV sin pérdidas significa que cada sibilante, oclusiva y palabra silenciosa sobrevive intacta — sin difuminado de MP3 en consonantes. Si el archivo tiene múltiples pistas (un hablante por canal), saltamos la diarización acústica por completo y dividimos según el diseño del canal.

WAV · 48 kHz / 24-bitREC 2 pistas · 1h 12m · 743 MB
en-GB detectado automáticamentePCM estéreo · sin comprimir
~90s
Transcripción · transmisión97% de precisión
S1

Llévame de vuelta a esa mañana del setenta y ocho — ¿a qué hora llegó la llamada?

S2

A las cinco menos cuarto, más o menos. La tetera estaba puesta, lo recuerdo bien.

S1

¿Y de ahí bajaste directo al puerto?

S2

Directo al astillero. Las luces todavía estaban encendidas cuando entré.

97% en WAV por pistaSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opciones reales · comparación honesta

Adobe Audition. Descript. O nosotros.

El Speech to Text de Audition viene incluido con Creative Cloud y permanece dentro de la línea de tiempo. Descript importa el WAV en su propio editor. Nosotros tomamos el archivo tal cual, devolvemos exportaciones estándar y no te pedimos que muevas tu proyecto a ningún lado.

Option 01

Adobe Audition / Premiere

Panel de transcripción dentro de la línea de tiempo de Adobe. Vinculado a Creative Cloud y al archivo del proyecto.

RequiereSuscripción a Creative Cloud
Diarización de hablantesSí, solo mixto
WAV multípistaSe aplana antes de STT
ExportaciónSRT · CSV · XML
Idiomas18, selección manual
Costo~$23/mes (una sola app)
Best forEditores que ya cortan en Premiere o Audition y quieren subtítulos cosidos a la línea de tiempo.
Option 02

Transcription.Solutions

Suelta el WAV. Diarización por canal si es multípista. Fuente eliminada en 24h.

RequiereNada — solo el archivo
Diarización de hablantesPor pista o acústica
WAV multípistaHasta 16 canales
ExportaciónSRT · VTT · DOCX · TXT · JSON
Idiomas99, detección automática
Costo · por minuto$0.03
Best forCualquiera que tenga un WAV sin procesar — grabadores de campo, podcasters que rebotan desde un DAW, archivistas de historia oral, investigadores.
Option 03

Descript

Importa tu WAV al editor de Descript. Potente, pero tienes que trabajar dentro de él.

RequiereCuenta de Descript + importación
Diarización de hablantesAcústica, afinada para EN
WAV multípistaImportar como clips separados
ExportaciónTXT · SRT · DOCX
Idiomas23, la precisión varía
Costo$16–24/usuario/mes
Best forEditores de podcasts que quieren editar el audio editando la transcripción — el verdadero superpoder de Descript.

Precios exactos a partir de 2026. Los indicadores de características de Adobe y Descript cambian frecuentemente; consulta la documentación actual antes de comprometerte.

Específico de WAV

Tres cosas que causan problemas en herramientas genéricas de transcripción.

La mayoría de los cargadores reducen silenciosamente tu WAV antes de enviarlo a un reconocedor. Nosotros no.

Qué sale mal

  1. 1El WAV multípista se aplana. Una grabación de 4 canales desde un Sound Devices MixPre se mezcla a mono antes de STT. La separación por micrófono por la que pagaste se tira.
  2. 2Los WAVs de 32-bit float de Zoom F-series o MixPre se rechazan por completo, o se cortan a 16-bit y pierden su recuperación de margen.
  3. 3Las entrevistas de 96 kHz / 24-bit tardan una eternidad en subirse porque la herramienta recodifica a MP3 en el navegador antes de enviar.

Qué cambiar aquí

  1. 1Sube el WAV multípista tal cual (hasta 16 canales). Leemos el diseño del canal del encabezado WAV y asignamos un hablante por pista — sin adivinanza acústica.
  2. 2El de 32-bit float se acepta de forma nativa. Preservamos el margen flotante cuando normalizamos para el reconocedor, por lo que los picos por encima de 0 dBFS no se cortan.
  3. 3Carga binaria directa, sin transcodificación en el navegador. Un WAV de 2 GB se mueve a tu ancho de banda completo e inicia el procesamiento en el momento en que llega el último byte.

Configuración de trabajo recomendada para WAV

Suelta un WAV y estos se encienden por defecto. Anula por trabajo desde el formulario.

Frecuencia de muestreo
Nativa (sin reducción)
Profundidad de bits
24-bit / 32-float preservados
Diarización
Por canal si es multípista
Modelo de hablante
Entrevista · 2-8 hablantes
Palabras de relleno
Mantenidas (desactiva si es necesario)
Exportación
DOCX · SRT · TXT con marca de tiempo

Accuracy · real-world numbers

97%+ en WAV por pista. WAV suministra la mejor señal posible al reconocedor.

Porque WAV almacena PCM sin compresión perceptiva, las consonantes y sibilantes no se difuminan de la manera en que MP3 las difumina. El reconocedor escucha lo que escuchó el micrófono. Los números siguientes provienen de trabajos reales de WAV de clientes en producción.

98%
WAV de estudio · un solo hablante

48 kHz / 24-bit, micrófono de diafragma grande, sala tratada. Narración, audiolibros, trabajos de voz en off aterrizan aquí.

96%
WAV de entrevista multípista

Un canal por hablante (micrófonos de corbata o límite). La diarización es solo enrutamiento de canal — error solo de texto.

92%
Grabadora de campo portátil

Zoom H5, Tascam DR-40, similares. Captura XY estéreo, 2-3 hablantes, algo de reflejo de sala. La mayoría de WAVs de podcast aterrizan aquí.

85%
WAV de campo en ambiente ruidoso

Exterior, café, vehículo. La captura sin pérdidas ayuda — el ruido es real, no artefacto de códec — pero la precisión aún baja en habla superpuesta.

Preguntas comunes

8 cosas que pregunta la gente sobre transcripción WAV.

01¿Cuál es el tamaño máximo del archivo WAV?+
5 GB por archivo en el plan estándar, que es aproximadamente 8 horas de estéreo 48 kHz / 24-bit, o 2.5 horas de 96 kHz / 24-bit. Los archivos más grandes están bien en el plan de equipo — solo contáctanos antes de la carga.
02¿Soportan WAV de 32-bit float desde Zoom F-series o MixPre?+
Sí, de forma nativa. Leemos las muestras flotantes sin corte a 0 dBFS, por lo que los transitorios altos que planeabas bajar en postproducción se transcriben limpiamente. La mayoría de los cargadores genéricos convierten silenciosamente a 16-bit primero.
03Tengo un WAV de 4 canales desde una grabadora de campo — un micrófono por persona. ¿Usará diarización eso?+
Lo hará. Sube el WAV polifónico directamente (no reboces a estéreo primero). Analizamos el diseño del canal desde el encabezado WAV y asignamos un hablante por pista — mucho más confiable que la diarización acústica en voces similares.
04¿Reducirás mi WAV de 96 kHz?+
El reconocedor se ejecuta a 16 kHz internamente — ese es el techo de la inteligibilidad del habla humana. Pero mantenemos tu archivo original intacto y lo usamos para el procesamiento posterior como reducción de ruido. Tus exportaciones hacen referencia a la línea de tiempo original.
05¿Es WAV realmente más preciso que MP3 para transcripción?+
Marginalmente, sí — generalmente 1-2 puntos de WER en habla limpia. La brecha más grande aparece en sibilantes y pasajes silenciosos, donde la compresión psicoabústica de MP3 descarta información que el reconocedor hubiera usado. Para trabajo de archivo o forense, WAV es la opción correcta.
06¿Se preservan los metadatos BWF y el código de tiempo?+
Leemos fragmentos BWF (bext, iXML) y usamos el código de tiempo de inicio para alinear la transcripción a tu línea de tiempo de sesión. El WAV original nunca se modifica — trabajamos en una copia que se elimina en 24h.
07¿Puedo soltar una carpeta de archivos WAV desde una exportación de sesión DAW?+
Sí. La carga por lotes acepta hasta 50 archivos a la vez. Cada WAV obtiene su propio trabajo y transcripción. Si son stems de una sesión, también puedes fusionarlos en un único WAV multípista antes de cargar y diarizaremos por canal.
08¿Cuánto dura realmente un WAV estéreo de 1 hora?+
La carga es la parte más lenta — un WAV estéreo de 1 hora 48 kHz / 24-bit es aproximadamente 600 MB y toma 2-5 minutos en banda ancha típica. Una vez cargado, la transcripción en sí se ejecuta en aproximadamente 4-6 minutos en la cola estándar.

Suelta tu WAV. Conserva la calidad sin pérdidas. Mira qué sale.

30 minutos gratuitos cada mes. Sin tarjeta. Diarización por pista, 32-bit float soportado, audio fuente eliminado en 24h.

Comienza gratis