Nouveau modèle de transcription IA de Meta capable de distinguer plusieurs locuteurs et langues en temps réel

2 septembre 2026

Meta a présenté son premier modèle audio en temps réel, Muse Voice Transcribe. Le modèle peut gérer la dictée et la transcription pour plus de 20 locuteurs et peut traiter sans accroc plusieurs langues simultanément, selon Meta.

Le PDG de Meta, Mark Zuckerberg, qui est récemment revenu sur X après trois années sans publication sur la plateforme, a partagé un exemple illustrant la capacité du modèle à gérer plusieurs locuteurs et plusieurs langues à la fois. Dans la vidéo, la transcription parvient à distinguer automatiquement les différents locuteurs et à passer d’une langue à l’autre. Il est même capable de repérer le « code-switching » et de transcrire des phrases utilisant des mots issus de plusieurs langues.

« Le modèle décide quand écouter. Il attend un peu plus longtemps sur les mots difficiles et s’engage plus rapidement sur les mots faciles, en utilisant un délai adaptatif pour prédire chaque jeton et augmenter la précision », a-t-il expliqué. « Il tient même sur l’audio réel et chaotique aussi — entraîné sur plus de 70 langues (dont 25 validées au lancement), gère le code-switching en milieu de phrase et peut gérer des sessions d’une heure avec plus de 20 locuteurs. »

Muse Voice Transcribe est la dernière sortie du Meta Superintelligence Lab (MSI), qui ne cesse de produire de nouveaux modèles et outils d’IA. Au cours des dernières semaines, la société a également présenté son premier agent dédié au codage, un modèle à poids libres et l’application Meta AI Mac susmentionnée.

Nadia Kerroum

Nadia Kerroum

Rédactrice chez GeekyAlgeria, j’explore chaque jour l’impact de la technologie sur notre vie. Entre innovations locales, tendances mondiales et culture numérique, je raconte ce qui façonne le futur de manière simple, précise et accessible. Toujours curieuse, je cherche avant tout à partager une passion : comprendre la tech pour mieux la vivre.