Whisper local / código abierto
Gratuito si tienes una GPU y una tarde. Sin diarización de hablantes incluida.
Sube un archivo MP3 a cualquier velocidad de bits de 64 a 320 kbps. Obtén una transcripción con marca de tiempo y etiquetas de hablante en 99 idiomas — sin conversión de formato, sin recodificación, sin esperas.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Mira qué sale
Leemos los encabezados de fotogramas MP3 directamente — VBR, CBR, joint-stereo, cualquier codificador (LAME, Fraunhofer, FFmpeg). Si el archivo es estéreo verdadero con hablantes en canales separados, lo usamos para separar voces. La mezcla en mono se basa en diarización acústica.
¿Entonces, cuándo te diste cuenta de que el archivo estaba incompleto?
Probablemente alrededor de 2019, cuando comenzamos a digitalizar los carretes.
¿Y las cintas faltantes — estaban catalogadas en algún lugar?
Hay un índice en papel de '78, pero la mitad está dañada por agua.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tres opciones reales · comparación honesta
Puedes ejecutar Whisper en tu portátil de forma gratuita si eres técnico. Otter y Sonix aceptan cargas de MP3 dentro de paneles de suscripción. Tomamos el archivo, devolvemos la transcripción, y no necesitas vivir en nuestra interfaz.
Gratuito si tienes una GPU y una tarde. Sin diarización de hablantes incluida.
Suelta el MP3. Recupera texto con etiquetas de hablante en aproximadamente tiempo real × 0.025.
Panel pulido, límite mensual de minutos, optimizado para inglés. La carga de archivos se siente como una característica secundaria.
Precios y disponibilidad de características precisos a partir de mayo de 2026. El rendimiento de Whisper varía según el tamaño del modelo y el hardware.
Específico de MP3
MP3 es un formato, no un estilo de grabación — lo que significa que los modos de fallo provienen del codificador, no del habla.
Valores predeterminados que se ajustan a ~80% de los archivos MP3. Anula por trabajo desde el formulario.
Accuracy · real-world numbers
La precisión de MP3 está limitada por lo que el codificador conservó, no por nosotros. La compresión perceptual por encima de ~96 kbps preserva muy bien la inteligibilidad del habla; por debajo de 64 kbps, los sibilantes y consonantes comienzan a disolverse. Los números a continuación provienen de MP3s reales de clientes en producción.
Casi sin pérdidas para habla. Maestros de podcast, exportaciones de aplicaciones de dictado, equipos profesionales de entrevista. Diarización limpia si los hablantes están en canales separados.
Velocidad de bits más común para MP3s de palabra hablada. Exportaciones de Zoom, descargas de Riverside, valor predeterminado de grabadoras de voz. Artefactos de compresión inaudibles para el reconocedor.
Valores predeterminados de memo de voz en la mayoría de teléfonos. La diarización acústica maneja 2-4 hablantes. Los números y nombres propios ocasionalmente necesitan una mirada.
Extracciones de contestadora antigua, archivos de conferencias, fuentes de banda estrecha. Las consonantes de alta frecuencia (f/s/sh) se desdibujan. Aún legible — planea una revisión.
Preguntas comunes
30 minutos gratis cada mes. No se requiere tarjeta. Etiquetas de hablante, 99 idiomas, todos los formatos de exportación incluidos.
Comenzar gratis