Microsoft lança transcrição em tempo real em 60 idiomas e novas vozes com português do Brasil

Capa do Watcher com o título Microsoft lança transcrição ao vivo em 60 idiomas
Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI.

A Microsoft AI, divisão comandada por Mustafa Suleyman, lançou em 1º de outubro de 2026 o MAI-Transcribe-2-Streaming, seu primeiro modelo de transcrição em tempo real. Ele reconhece 60 idiomas com detecção automática e entrega a primeira hipótese de texto pouco mais de 100 milissegundos depois de receber o áudio. Junto, a empresa lançou duas vozes sintéticas, o MAI-Voice-2.1 e o MAI-Voice-2.1-Flash, com 23 idiomas e vozes prontas em português do Brasil.

Em resumo

  • O que é: modelo de transcrição em streaming, para agentes de voz, legendas ao vivo e atendimento, mais dois modelos de voz.
  • Desempenho: primeiro lugar entre 38 modelos no ranking de transcrição em tempo real da Artificial Analysis, com 2,5% de taxa de erro de palavras.
  • Preço: US$ 0,54 por hora de áudio até o fim de 2026, US$ 22 por milhão de caracteres no Voice-2.1 e US$ 15 no Flash.
  • Onde: Microsoft Foundry, OpenRouter, MAI Playground, Vercel e Azure Voice Live, com LiveKit em breve.
  • Português: a documentação lista o português na transcrição e vozes em pt-BR, como Luana e Caio, nos dois modelos de voz.

O que a Microsoft lançou?

O MAI-Transcribe-2-Streaming recebe áudio contínuo por WebSocket e devolve o texto em pedaços, que vão sendo corrigidos até virar o segmento final. A Microsoft diz que as palavras aparecem na transcrição duas vezes mais rápido que no concorrente mais próximo. A RuntimeWire e a TestingCatalog lembram que essa comparação vem de testes da própria Microsoft.

Os dois modelos de voz usam uma única voz para os 23 idiomas, com sotaque nativo em cada um, e permitem clonar uma voz a partir de poucos segundos de áudio. A Microsoft fala em travas de consentimento contra uso indevido, sem detalhar como funcionam. O Flash tem latência de ponta a ponta de 150 milissegundos, segundo o anúncio.

Os números se sustentam?

O dado mais forte vem de fora da Microsoft. Segundo a MarkTechPost, no ranking da Artificial Analysis o modelo ficou em primeiro entre 38, com 2,5% de taxa de erro de palavras a 0,13 segundo do fim da fala. O Grok Voice Transcribe 2.0 ficou em segundo, com 2,7% a 0,49 segundo, e o Muse Voice Transcribe, da Meta, em terceiro, com 3,1% a 0,16 segundo. O teste usou cerca de 8 horas de áudio, metade de conversas com agentes e o resto de discursos do Parlamento Europeu e teleconferências de resultados.

O preço de lançamento é de US$ 0,54 por hora de áudio até o fim do ano, mais de cinco vezes o da versão em lote, o MAI-Transcribe-2, que custa US$ 0,10 por hora. A MarkTechPost cita concorrentes de streaming entre US$ 0,18 e US$ 0,20 por hora. A conta, portanto, favorece a Microsoft em latência e precisão e desfavorece em preço. A RuntimeWire observa ainda que a latência anunciada é a do modelo, e que o tempo real de resposta depende da rede e da arquitetura de quem integra.

Como chegamos até aqui?

A Microsoft AI lançou o MAI-Transcribe-2, em lote, em setembro. A versão em streaming completa a pilha que um agente de voz precisa: ouvir em tempo real, entender e responder com voz. A disputa nesse pedaço ficou cheia em poucos dias. A ElevenLabs lançou o Eleven v4 com 90 idiomas em 28 de setembro e dobrou de valor para US$ 22 bilhões, como o portal noticiou. A Meta tem o Muse Voice Transcribe no ranking e a xAI tem o Grok Voice.

Para a Microsoft, o movimento também tem peso estratégico. Modelos próprios no Foundry diminuem a dependência dos modelos da OpenAI dentro do Azure.

O que muda para quem está no Brasil?

A documentação do Microsoft Learn lista o português (código “pt”, sem separar Brasil e Portugal) entre os idiomas do MAI-Transcribe-2 e traz vozes prontas em pt-BR, como Luana, Caio, Pedro e Rafael, nos dois modelos de voz, com estilos como “customer_call_center” e “agent”. A página consultada não detalha os idiomas da versão em streaming. Quem pensa em usar o modelo em central de atendimento brasileira deve testar com áudio real de telefone, sotaques regionais e ruído, porque os números divulgados não trazem resultado específico para o português.

Há também uma questão de dados. Atendimento por voz trata dado pessoal, e a LGPD exige base legal e transparência para gravar e transcrever ligações. A clonagem de voz pede cuidado adicional com consentimento.

O que observar nas próximas semanas

A tese: a transcrição em tempo real virou disputa de latência e preço, e a Microsoft entra para disputar os agentes de voz corporativos dentro do Azure. Até o fim de dezembro, vale checar o preço que vai vigorar depois da tarifa promocional, a chegada ao LiveKit, a publicação da lista de idiomas da versão em streaming e testes independentes em outros idiomas além do inglês. Também vale ver se ElevenLabs, Meta e xAI respondem com corte de preço.

Fontes

Rating Marcio.AI: 4/5 (Global, Muito relevante, Muito próximo do hype). Seção DeepTech do Watcher.

#MarcioAI #Microsoft #AgentesDeVoz #Transcricao #SpeechToText #IA

Como este texto foi produzido

Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.


Leia também: ElevenLabs lança Eleven v4 com 90 idiomas e ElevenLabs dobra de valor para US$ 22 bilhões

Deixe um comentário

Rolar para cima