Transcribe MP3 a texto.Etiquetas de hablante, 100+ idiomas.

Sube un archivo MP3 a cualquier velocidad de bits de 64 a 320 kbps. Obtén una transcripción con marca de tiempo y etiquetas de hablante en 99 idiomas — sin conversión de formato, sin recodificación, sin esperas.

Suelta tu audio o vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Graba directamente desde tu navegador

Registrarse lleva 30 segundos — la grabación se abre justo después, en el panel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTLos archivos se eliminan automáticamente en 24 h

↓ Mira qué sale

MP3 dentro. Transcripción con diarización afuera.

Leemos los encabezados de fotogramas MP3 directamente — VBR, CBR, joint-stereo, cualquier codificador (LAME, Fraunhofer, FFmpeg). Si el archivo es estéreo verdadero con hablantes en canales separados, lo usamos para separar voces. La mezcla en mono se basa en diarización acústica.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Transcripción · en tiempo realPrecisión 95%
S1

¿Entonces, cuándo te diste cuenta de que el archivo estaba incompleto?

S2

Probablemente alrededor de 2019, cuando comenzamos a digitalizar los carretes.

S1

¿Y las cintas faltantes — estaban catalogadas en algún lugar?

S2

Hay un índice en papel de '78, pero la mitad está dañada por agua.

95% en 192 kbps estéreoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opciones reales · comparación honesta

Whisper local gratuito. Otter o Sonix. O nosotros.

Puedes ejecutar Whisper en tu portátil de forma gratuita si eres técnico. Otter y Sonix aceptan cargas de MP3 dentro de paneles de suscripción. Tomamos el archivo, devolvemos la transcripción, y no necesitas vivir en nuestra interfaz.

Option 01

Whisper local / código abierto

Gratuito si tienes una GPU y una tarde. Sin diarización de hablantes incluida.

ConfiguraciónPython + CUDA + modelos de 10 GB
Diarización de hablantesNo incluida (complemento pyannote)
Velocidad · 1 hr MP35–40 min en GPU de consumo
Idiomas99, pero el modelo diminuto cae por debajo del 80%
ExportaciónTXT / SRT / VTT / JSON
CostoGratuito + tu electricidad
Best forIngenieros que ya tienen una GPU, no necesitan etiquetas de hablante, y quieren privacidad local completa.
Option 02

Transcription.Solutions

Suelta el MP3. Recupera texto con etiquetas de hablante en aproximadamente tiempo real × 0.025.

ConfiguraciónArrastra y suelta, no se necesita cuenta para probar
Diarización de hablantesIncluida (planes Pro y Business)
Velocidad · 1 hr MP3~90 segundos
Idiomas99, detección automática
ExportaciónSRT · VTT · DOCX · TXT · JSON
Costo · por min$0.03
Best forCualquiera con un MP3 — grabación de periodista, exportación de podcast, memo de voz, dub de archivo — que solo quiera texto preciso del otro lado.
Option 03

Otter / Sonix

Panel pulido, límite mensual de minutos, optimizado para inglés. La carga de archivos se siente como una característica secundaria.

ConfiguraciónCuenta + plan de pago
Diarización de hablantesAcústica, sesgada hacia EN
Velocidad · 1 hr MP35–10 min en cola
IdiomasOtter solo EN; Sonix ~40
ExportaciónBloqueada detrás de niveles de pago
Costo$17+/mes o $10+/hr (Sonix)
Best forEquipos que quieren un editor de transcripción e interfaz de colaboración más que un flujo limpio al estilo API archivo→texto.

Precios y disponibilidad de características precisos a partir de mayo de 2026. El rendimiento de Whisper varía según el tamaño del modelo y el hardware.

Específico de MP3

Tres cosas que muerden a la gente en herramientas genéricas de transcripción.

MP3 es un formato, no un estilo de grabación — lo que significa que los modos de fallo provienen del codificador, no del habla.

Qué sale mal

  1. 1Los encabezados VBR se analizan incorrectamente. Algunas herramientas leen MP3s de velocidad variable como velocidad fija y miscalculan la duración — las marcas de tiempo se desvían de minutos durante un archivo de una hora.
  2. 2El joint-stereo se aplana a mono durante el preprocesamiento de carga. Pierdes la separación de canales por hablante que realmente estaba en el archivo.
  3. 3El arte de álbum ID3 incrustado activa a algunos cargadores — rechazan el archivo como 'no audio puro' o lo eliminan y recodifican, reduciendo la calidad aún más.

Lo que hacemos en su lugar

  1. 1Usamos el encabezado Xing/LAME cuando está presente y recurrimos al conteo de fotogramas cuando no. Las marcas de tiempo VBR se mantienen precisas a ±0,1 s en archivos de varias horas.
  2. 2Los MP3s de joint-stereo y true-stereo se decodifican a PCM L/R antes de la diarización. Si tus hablantes estaban paneados, los mantenemos separados.
  3. 3Etiquetas ID3v1, ID3v2, APE, arte incrustado — todo pasa sin tocar. Nunca recodificamos tu MP3.

Configuración recomendada de trabajo para cargas MP3

Valores predeterminados que se ajustan a ~80% de los archivos MP3. Anula por trabajo desde el formulario.

Decodificador
Preciso de fotogramas, sin recodificación
Diarización
División de canales si estéreo, si no, acústica
Modelo de hablante
Auto · 1-12 hablantes
Idioma
Detección automática de los primeros 30 s
Palabras de relleno
Eliminado (cambiar para mantener)
Paquete de exportación
DOCX + SRT + TXT con marca de tiempo

Accuracy · real-world numbers

95%+ en 192 kbps estéreo. Usable hasta 64 kbps mono.

La precisión de MP3 está limitada por lo que el codificador conservó, no por nosotros. La compresión perceptual por encima de ~96 kbps preserva muy bien la inteligibilidad del habla; por debajo de 64 kbps, los sibilantes y consonantes comienzan a disolverse. Los números a continuación provienen de MP3s reales de clientes en producción.

96%
320 kbps estéreo, fuente de estudio

Casi sin pérdidas para habla. Maestros de podcast, exportaciones de aplicaciones de dictado, equipos profesionales de entrevista. Diarización limpia si los hablantes están en canales separados.

95%
192 kbps estéreo, 2-3 hablantes

Velocidad de bits más común para MP3s de palabra hablada. Exportaciones de Zoom, descargas de Riverside, valor predeterminado de grabadoras de voz. Artefactos de compresión inaudibles para el reconocedor.

91%
128 kbps mono, conversacional

Valores predeterminados de memo de voz en la mayoría de teléfonos. La diarización acústica maneja 2-4 hablantes. Los números y nombres propios ocasionalmente necesitan una mirada.

84%
64 kbps mono, archivo / volcado telefónico

Extracciones de contestadora antigua, archivos de conferencias, fuentes de banda estrecha. Las consonantes de alta frecuencia (f/s/sh) se desdibujan. Aún legible — planea una revisión.

Preguntas comunes

8 cosas que la gente pregunta sobre transcripción MP3.

01¿Cuál es la velocidad de bits MP3 mínima que sigue dando una transcripción utilizable?+
64 kbps es el piso práctico. Por debajo de eso, los sibilantes (s, sh, f) se comprimen en ruido y la tasa de error de palabras sube más del 20%. Si estás grabando nuevo, apunta a 128 kbps mono o 192 kbps estéreo — cualquier cosa más alta es excesiva para habla.
02¿Necesito convertir mi MP3 a WAV primero?+
No. Recodificar MP3 → WAV no agrega precisión porque los datos que el codificador descartó se han ido para siempre. Carga el MP3 directamente. Decodificamos fotogramas en memoria y alimentamos PCM al reconocedor.
03¿Me dará MP3 estéreo mejores etiquetas de hablante que mono?+
Solo si los hablantes fueron grabados en canales separados — la mayoría de MP3s estéreo tienen el mismo audio en ambos lados ('mono dual') y no ganan nada. La verdadera división de canales (p. ej. exportaciones de Riverside, equipos de campo de dos micrófonos) nos permite omitir la diarización acústica y etiquetar hablantes casi perfectamente.
04¿Cuál es el tamaño máximo de archivo MP3 que aceptas?+
5 GB por carga, que es aproximadamente 60 horas a 192 kbps o 90 horas a 128 kbps. Si tu archivo es más grande, mostraremos una carga fragmentada — no es necesario dividirlo tú mismo.
05¿Cuánto tiempo tarda un MP3 de 60 minutos en transcribirse?+
Típicamente 90 segundos desde carga completa hasta transcripción lista, independientemente de la velocidad de bits. Decodificar fotogramas MP3 es rápido; el tiempo está en el reconocedor. La diarización agrega 5-10 segundos en archivos con múltiples hablantes.
06Mi MP3 tiene música de fondo — ¿se arruinará la transcripción?+
La música suave bajo la voz está bien. La música fuerte que compite con la voz (estrofas de introducción, música bajo entrevistas) a veces desencadena errores de reconocimiento en sílabas superpuestas. Activa la supresión de música en el formulario del trabajo para prefiltrar.
07¿Puedes manejar MP3s extraídos del correo de voz telefónico o contestadoras?+
Sí, aunque estos a menudo son de banda estrecha de 8 kHz recodificados como MP3 — el techo de calidad de audio lo establece la captura PSTN original, no el envoltorio MP3. Espera una precisión del 78-85% en ese tipo de fuente, la cual es la misma que obtendríamos en la llamada subyacente.
08¿Mantienes mi MP3 después de que se complete la transcripción?+
Los archivos se eliminan después de 30 días de forma predeterminada, o inmediatamente bajo solicitud a través del panel. La transcripción permanece en tu cuenta hasta que la elimines. No usamos audio de clientes para entrenar ningún modelo — nunca.

Suelta tu MP3. Obtén texto de vuelta en 90 segundos.

30 minutos gratis cada mes. No se requiere tarjeta. Etiquetas de hablante, 99 idiomas, todos los formatos de exportación incluidos.

Comenzar gratis