
Tudo sobre Inteligência Artificial
A Meta apresentou nesta terça-feira (1) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial (IA) voltado à percepção de áudio em tempo real. A tecnologia consegue transcrever conversas enquanto elas acontecem, distinguir quem está falando e lidar com mais de 20 pessoas simultaneamente.
Continua após a publicidade
O modelo foi desenvolvido pelo Meta Superintelligence Labs (MSL) e também consegue trabalhar com diferentes idiomas em uma mesma conversa. Segundo a empresa, ele foi treinado com mais de 70 idiomas, sendo que 25 deles foram amplamente validados para o lançamento.
Uma das características mais interessantes do Muse Voice Transcribe é a capacidade de realizar o chamado code-switching, quando uma pessoa alterna entre idiomas durante uma conversa. A tecnologia consegue reconhecer essa mudança mesmo no meio de uma frase.
Em uma demonstração divulgada pela Meta, oito pessoas conversam simultaneamente e o sistema consegue identificar cada participante e associar corretamente suas falas. A IA também consegue lidar com interrupções, sobreposição de vozes e diferentes sotaques.
A tecnologia combina três funções principais em um único modelo: reconhecimento automático de fala em fluxo contínuo (ASR, na sigla em inglês), identificação dos diferentes participantes da conversa, conhecida como speaker diarization, e identificação dos momentos em que uma fala começa ou termina.
Leia mais:

IA decide quanto tempo deve ouvir
- O Muse Voice Transcribe processa o áudio em blocos de 80 milissegundos. A cada novo trecho, o modelo decide se deve continuar ouvindo ou começar a produzir o texto;
- A Meta chama esse mecanismo de “atraso adaptativo”. Na prática, a IA pode esperar um pouco mais quando encontra uma palavra difícil e produzir a transcrição mais rapidamente quando identifica uma palavra simples;
- A estratégia busca equilibrar velocidade e precisão. Quanto mais tempo o modelo espera antes de transcrever, maior tende a ser a precisão, mas também aumenta o atraso na resposta;
- A tecnologia também pode utilizar informações sobre o idioma, palavras-chave e contexto para melhorar a precisão das transcrições;
- Segundo a Meta, o Muse Voice Transcribe alcançou a primeira posição nos rankings da Artificial Analysis para reconhecimento de fala em streaming e também em benchmarks públicos de identificação de participantes. A classificação considera os resultados disponíveis em 1º de setembro de 2026.
Continua após a publicidade
Onde a tecnologia pode ser usada
O novo modelo já está sendo utilizado para recursos de ditado no aplicativo Meta AI para Mac. Como o aplicativo consegue oferecer recursos de voz para outros serviços, o Muse Voice Transcribe também pode ser usado para ditado em diferentes aplicações.
A tecnologia ainda está disponível para desenvolvedores por meio do Muse Code e da API de modelos da Meta. O acesso custa US$ 3 (cerca de R$ 15,50) por mil minutos de áudio. A Meta também disponibilizou uma demonstração do modelo em sua página de pesquisa, permitindo testar a transcrição de áudio em tempo real.
O lançamento acontece menos de uma semana depois da apresentação do Gemini 3.5 Transcribe, do Google, que também aposta em recursos avançados de reconhecimento de áudio. A diferença é que o Muse Voice Transcribe chega com foco explícito em combinar transcrição, identificação de múltiplos participantes e processamento multilíngue em tempo real.

Rodrigo Mozelli
Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.
Fonte: Olhar Digital