Meta présente Muse Voice Transcribe, un modèle de transcription AI en temps réel
Meta a lancé Muse Voice Transcribe le 1er septembre 2026, et le modèle est déjà disponible dans l'application Meta AI pour Mac. C'est le premier modèle de perception audio en temps réel de Meta.
Meta affirme que le modèle combine la transcription en continu de la parole en texte, la diarisation des locuteurs et le pointage dans un seul système. Il peut transcrire plus de 20 locuteurs à la fois, gérer plusieurs langues simultanément et même suivre le changement de code, y compris les phrases qui mélangent des mots de différentes langues.
Statistiques du modèle
Selon le blog de recherche, Muse Voice Transcribe a été formé sur plus de 70 langues, avec 25 validées au lancement. Meta indique également qu'il peut gérer des sessions d'une heure avec plus de 20 locuteurs, ce qui le rend adapté aux réunions, aux interviews, aux podcasts et à d'autres conversations en direct.
Le modèle est maintenant disponible dans l'application Meta AI pour Mac, où il peut également alimenter des fonctionnalités de dictée dans d'autres applications. Les développeurs peuvent y accéder via Muse Code et l'API Model de Meta.
Meta a fixé le prix de Muse Voice Transcribe à 3 $ pour 1 000 minutes audio. Mark Zuckerberg a résumé l'approche du modèle de cette manière : Le modèle décide quand écouter. Il attend un peu plus longtemps sur les mots difficiles et s'engage plus rapidement sur les mots faciles, utilisant un délai adaptatif pour prédire chaque jeton et augmenter la précision.— Mark Zuckerberg, PDG de Meta
Les outils de transcription en temps réel deviennent-ils beaucoup plus utiles une fois qu'ils peuvent suivre plusieurs locuteurs, langues et changements de code en même temps ?