Meta apresenta Muse Voice Transcribe
A Meta apresentou (1º) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial (IA) voltado à percepção de áudio em tempo real. A tecnologia consegue transcrever conversas enquanto elas acontecem, distinguir quem está falando e lidar com mais de 20 pessoas simultaneamente.
O modelo foi desenvolvido pelo Meta Superintelligence Labs (MSL) e também consegue trabalhar com diferentes idiomas em uma mesma conversa. Segundo a empresa, ele foi treinado com mais de 70 idiomas, sendo que 25 deles foram amplamente validados para o lançamento.
Uma das características mais interessantes do Muse Voice Transcribe é a capacidade de realizar o chamado code-switching, quando uma pessoa alterna entre idiomas durante uma conversa. A tecnologia consegue reconhecer essa mudança mesmo no meio de uma frase.
Em uma demonstração divulgada pela Meta, oito pessoas conversam simultaneamente e o sistema consegue identificar cada participante e associar corretamente suas falas. A IA também consegue lidar com interrupções, sobreposição de vozes e diferentes sotaques.
A tecnologia combina três funções principais em um único modelo: reconhecimento automático de fala em fluxo contínuo (ASR, na sigla em inglês), identificação dos diferentes participantes da conversa, conhecida como speaker diarization, e identificação dos momentos em que uma fala começa ou termina.
IA decide quanto tempo deve ouvir
- O Muse Voice Transcribe processa o áudio em blocos de 80 milissegundos. A cada novo trecho, o modelo decide se deve continuar ouvindo ou começar a produzir o texto;
- A Meta chama esse mecanismo de “atraso adaptativo”. Na prática, a IA pode esperar um pouco mais quando encontra uma palavra difícil e produzir a transcrição mais rapidamente quando identifica uma palavra simples;
- A estratégia busca equilibrar velocidade e precisão. Quanto mais tempo o modelo espera antes de transcrever, maior tende a ser a precisão, mas também aumenta o atraso na resposta;
- A tecnologia também pode utilizar informações sobre o idioma, palavras-chave e contexto para melhorar a precisão das transcrições;
- Segundo a Meta, o Muse Voice Transcribe alcançou a primeira posição nos rankings da Artificial Analysis para reconhecimento de fala em streaming e também em benchmarks públicos de identificação de participantes. A classificação considera os resultados disponíveis em 1º de setembro de 2026.




