Meta a présenté son premier modèle audio en temps réel, Muse Voice Transcribe. Le modèle peut gérer la dictée et la transcription pour plus de 20 locuteurs et peut traiter sans accroc plusieurs langues simultanément, selon Meta.
Le PDG de Meta, Mark Zuckerberg, qui est récemment revenu sur X après trois années sans publication sur la plateforme, a partagé un exemple illustrant la capacité du modèle à gérer plusieurs locuteurs et plusieurs langues à la fois. Dans la vidéo, la transcription parvient à distinguer automatiquement les différents locuteurs et à passer d’une langue à l’autre. Il est même capable de repérer le « code-switching » et de transcrire des phrases utilisant des mots issus de plusieurs langues.
Muse Voice Transcribe is MSL’s first real-time audio perception model — rolling out today. SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model. pic.twitter.com/LViMDSkbim
— Mark Zuckerberg (@finkd) September 1, 2026
« Le modèle décide quand écouter. Il attend un peu plus longtemps sur les mots difficiles et s’engage plus rapidement sur les mots faciles, en utilisant un délai adaptatif pour prédire chaque jeton et augmenter la précision », a-t-il expliqué. « Il tient même sur l’audio réel et chaotique aussi — entraîné sur plus de 70 langues (dont 25 validées au lancement), gère le code-switching en milieu de phrase et peut gérer des sessions d’une heure avec plus de 20 locuteurs. »
3/ already powering dictation in the meta desktop app and muse code. live now via meta model apihttps://t.co/MFosERCV0E pic.twitter.com/UESTQhKJrH
— Alexandr Wang (@alexandr_wang) September 1, 2026
Muse Voice Transcribe est la dernière sortie du Meta Superintelligence Lab (MSI), qui ne cesse de produire de nouveaux modèles et outils d’IA. Au cours des dernières semaines, la société a également présenté son premier agent dédié au codage, un modèle à poids libres et l’application Meta AI Mac susmentionnée.