Transcrire MP3 en texte.Identification des intervenants, 100+ langues.

Déposez un fichier MP3 à n'importe quel débit de 64 à 320 kbps. Obtenez une transcription horodatée avec identification des intervenants en 99 langues — aucune conversion de format, aucun ré-encodage, aucune attente en queue.

Déposez votre audio ou vidéo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Enregistrez directement depuis votre navigateur

L'inscription prend 30 secondes — l'enregistrement s'ouvre juste après, dans le tableau de bord.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFichiers supprimés automatiquement sous 24h

↓ Voir ce qui en sort

MP3 en entrée. Transcription avec diarisation en sortie.

Nous lisons les en-têtes de trame MP3 directement — VBR, CBR, joint-stereo, n'importe quel encodeur (LAME, Fraunhofer, FFmpeg). Si le fichier est une vraie stéréo avec des intervenants sur des canaux séparés, nous l'utilisons pour séparer les voix. Un mixdown mono revient à la diarisation acoustique.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz �� LAME 3.100
~90s
Transcription · streamingPrécision 95 %
S1

Alors, quand avez-vous d'abord réalisé que l'archive était incomplète ?

S2

Probablement autour de 2019, quand nous avons commencé à numériser les bobines.

S1

Et les bandes manquantes — étaient-elles cataloguées quelque part ?

S2

Il y a un index papier de '78, mais la moitié est endommagée par l'eau.

95 % en stéréo 192 kbpsSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trois vraies options · comparaison honnête

Gratuit Whisper local. Otter ou Sonix. Ou nous.

Vous pouvez exécuter Whisper gratuitement sur votre ordinateur portable si vous êtes technique. Otter et Sonix acceptent les uploads MP3 dans les tableaux de bord d'abonnement. Nous prenons le fichier, renvoyons la transcription et ne vous forçons pas à vivre dans une interface.

Option 01

Whisper local / open source

Gratuit si vous avez un GPU et un après-midi. Pas de diarisation d'intervenants en standard.

ConfigurationPython + CUDA + modèles 10 GB
Diarisation d'intervenantsNon incluse (add-on pyannote)
Vitesse · 1 h MP35–40 min sur GPU grand public
Langues99, mais le petit modèle chute sous 80 %
ExportationTXT / SRT / VTT / JSON
CoûtGratuit + votre électricité
Best forLes ingénieurs qui possèdent déjà un GPU, n'ont pas besoin d'identification des intervenants et veulent une confidentialité locale complète.
Option 02

Transcription.Solutions

Déposez le MP3. Récupérez le texte avec identification des intervenants à peu près en temps réel × 0,025.

ConfigurationGlisser-déposer, aucun compte nécessaire pour essayer
Diarisation d'intervenantsIntégrée (plans Pro et Business)
Vitesse · 1 h MP3~90 secondes
Langues99, auto-détectées
ExportationSRT · VTT · DOCX · TXT · JSON
Coût · par minute$0,03
Best forQuiconque ayant un MP3 — enregistrement de journaliste, export de podcast, mémo vocal, doublage archivé — qui veut simplement du texte précis en sortie.
Option 03

Otter / Sonix

Tableau de bord soigné, limite mensuelle de minutes, optimisé pour l'anglais. L'upload de fichier semble un trait secondaire.

ConfigurationCompte + plan payant
Diarisation d'intervenantsAcoustique, orientée EN
Vitesse · 1 h MP35–10 min en attente
LanguesOtter EN uniquement ; Sonix ~40
ExportationVerrouillé derrière les niveaux payants
Coût$17+/mois ou $10+/h (Sonix)
Best forLes équipes qui veulent un éditeur de transcription et une interface de collaboration plus qu'un flux fichier→texte de style API propre.

Prix et disponibilité des fonctionnalités à jour en mai 2026. Les performances de Whisper varient selon la taille du modèle et le matériel.

Spécifique à MP3

Trois choses qui posent problème aux gens sur les outils de transcription génériques.

MP3 est un format, pas un style d'enregistrement — ce qui signifie que les modes de défaillance proviennent de l'encodeur, pas de la parole.

Ce qui se passe mal

  1. 1Les en-têtes VBR sont mal analysés. Certains outils lisent les MP3 à débit variable comme à débit fixe et mal calculent la durée — les horodatages dérivent d'minutes sur un fichier d'une heure.
  2. 2La stéréo implicite est aplatie à mono lors du prétraitement de téléchargement. Vous perdez la séparation des canaux par intervenant qui était réellement dans le fichier.
  3. 3Les images d'album ID3 intégrées trébuchent quelques téléchargeurs — ils rejettent le fichier comme 'pas du pur audio' ou les suppriment et ré-encodent, baissant davantage la qualité.

Ce que nous faisons à la place

  1. 1Nous utilisons l'en-tête Xing/LAME quand il est présent et un repli sur le comptage de trames sinon. Les horodatages VBR restent précis à ±0,1 s sur les fichiers multi-heures.
  2. 2Les MP3 stéréo implicite et stéréo vraie sont décodés en PCM L/R avant la diarisation. Si vos intervenants étaient panoramiqués, nous les gardons séparés.
  3. 3Tags ID3v1, ID3v2, APE, images intégrées — tout passe inchangé. Nous ne ré-encodons jamais votre MP3.

Paramètres de job recommandés pour les uploads MP3

Paramètres par défaut qui conviennent à ~80 % des fichiers MP3. Remplacez par job depuis le formulaire.

Décodeur
Précis au niveau de la trame, aucun ré-encodage
Diarisation
Séparation des canaux si stéréo, sinon acoustique
Modèle d'intervenant
Auto · 1-12 intervenants
Langue
Détection automatique à partir des 30 premières secondes
Mots de remplissage
Supprimés (basculer pour conserver)
Lot d'exportation
DOCX + SRT + TXT horodaté

Accuracy · real-world numbers

95+ % en stéréo 192 kbps. Utilisable jusqu'à 64 kbps mono.

La précision MP3 est limitée par ce que l'encodeur a conservé, pas par nous. La compression perceptuelle au-dessus de ~96 kbps préserve très bien la compréhension du discours ; en dessous de 64 kbps, les sifflantes et les consonnes commencent à se dissoudre. Les chiffres ci-dessous proviennent de MP3 clients réels en production.

96%
320 kbps stéréo, source studio

Quasi sans perte pour la parole. Maîtres de podcast, exports d'apps de dictée, montages d'interview professionnels. Diarisation claire si les intervenants sont sur des canaux séparés.

95%
192 kbps stéréo, 2-3 intervenants

Débit d'accès le plus courant pour les MP3 parlés. Exports Zoom, téléchargements Riverside, standard des enregistreurs vocaux. Artefacts de compression inaudibles pour le reconnaisseur.

91%
128 kbps mono, conversationnel

Standard des mémos vocaux sur la plupart des téléphones. La diarisation acoustique gère 2-4 intervenants. Les chiffres et noms propres ont occasionnellement besoin d'un coup d'œil.

84%
64 kbps mono, archivage / vidage téléphonique

Vieux extraits de répondeurs, archives de conférences, sources de bande étroite. Les consonnes haute fréquence (f/s/sh) s'estompent. Toujours lisible — prévoyez une relecture.

Questions courantes

8 choses que les gens demandent sur la transcription MP3.

01Quel est le débit MP3 minimum qui donne encore une transcription utilisable ?+
64 kbps est le point pratique. En dessous, les sifflantes (s, sh, f) se compressent en bruit et le taux d'erreur de mots monte au-dessus de 20 %. Si vous enregistrez à nouveau, ciblez 128 kbps mono ou 192 kbps stéréo — tout ce qui est plus haut est excessif pour la parole.
02Dois-je convertir mon MP3 en WAV en premier ?+
Non. Le ré-encodage MP3 → WAV n'ajoute zéro précision car les données que l'encodeur a rejetées sont perdues à jamais. Uploadez le MP3 directement. Nous décodons les trames en mémoire et alimentons le PCM au reconnaisseur.
03Un MP3 stéréo me donnera-t-il une meilleure identification des intervenants que le mono ?+
Seulement si les intervenants ont réellement été enregistrés sur des canaux séparés — la plupart des MP3 stéréo ont le même audio sur les deux côtés ('mono double') et ne gagnent rien. La vraie séparation de canaux (par exemple, exports Riverside, montages de terrain deux-micros) nous permet de sauter la diarisation acoustique et d'identifier les intervenants presque parfaitement.
04Quelle est la taille maximale de fichier MP3 que vous acceptez ?+
5 GB par upload, ce qui représente à peu près 60 heures à 192 kbps ou 90 heures à 128 kbps. Si votre fichier est plus grand, nous afficherons un upload en chunks — pas besoin de le diviser vous-même.
05Combien de temps faut-il pour transcrire un MP3 de 60 minutes ?+
Typiquement 90 secondes de l'upload complet à la transcription prête, indépendamment du débit. Le décodage des trames MP3 est rapide ; le temps est dans le reconnaisseur. La diarisation ajoute 5-10 secondes sur les fichiers multi-intervenants.
06Mon MP3 a de la musique de fond — la transcription sera-t-elle ruinée ?+
La musique de fond douce sous la parole convient bien. La musique forte qui rivalise avec la voix (stings d'intro, bande sonore pendant les interviews) déclenche parfois des méconnaissances sur les syllabes qui se chevauchent. Basculez la suppression musicale sur le formulaire de job pour pré-filtrer.
07Pouvez-vous gérer les MP3 extraits de la messagerie vocale ou des répondeurs téléphoniques ?+
Oui, bien que ceux-ci soient souvent ré-encodés en MP3 en bande étroite 8 kHz — le plafond de qualité audio est défini par la capture PSTN d'origine, pas le wrapper MP3. Attendez-vous à une précision de 78-85 % sur ce type de source, ce que nous obtiendrions sur l'appel sous-jacent.
08Conservez-vous mon MP3 après la transcription ?+
Les fichiers sont supprimés après 30 jours par défaut, ou immédiatement sur demande via le tableau de bord. La transcription reste dans votre compte jusqu'à ce que vous la supprimiez. Nous n'utilisons jamais l'audio client pour entraîner un modèle.

Déposez votre MP3. Récupérez du texte en 90 secondes.

30 minutes gratuites chaque mois. Aucune carte requise. Identification des intervenants, 99 langues, tous les formats d'exportation inclus.

Commencer gratuitement