
A Microsoft AI, divisão comandada por Mustafa Suleyman, lançou em 1º de outubro de 2026 o MAI-Transcribe-2-Streaming, seu primeiro modelo de transcrição em tempo real. Ele reconhece 60 idiomas com detecção automática e entrega a primeira hipótese de texto pouco mais de 100 milissegundos depois de receber o áudio. Junto, a empresa lançou duas vozes sintéticas, o MAI-Voice-2.1 e o MAI-Voice-2.1-Flash, com 23 idiomas e vozes prontas em português do Brasil.
Em resumo
- O que é: modelo de transcrição em streaming, para agentes de voz, legendas ao vivo e atendimento, mais dois modelos de voz.
- Desempenho: primeiro lugar entre 38 modelos no ranking de transcrição em tempo real da Artificial Analysis, com 2,5% de taxa de erro de palavras.
- Preço: US$ 0,54 por hora de áudio até o fim de 2026, US$ 22 por milhão de caracteres no Voice-2.1 e US$ 15 no Flash.
- Onde: Microsoft Foundry, OpenRouter, MAI Playground, Vercel e Azure Voice Live, com LiveKit em breve.
- Português: a documentação lista o português na transcrição e vozes em pt-BR, como Luana e Caio, nos dois modelos de voz.
O que a Microsoft lançou?
O MAI-Transcribe-2-Streaming recebe áudio contínuo por WebSocket e devolve o texto em pedaços, que vão sendo corrigidos até virar o segmento final. A Microsoft diz que as palavras aparecem na transcrição duas vezes mais rápido que no concorrente mais próximo. A RuntimeWire e a TestingCatalog lembram que essa comparação vem de testes da própria Microsoft.
Os dois modelos de voz usam uma única voz para os 23 idiomas, com sotaque nativo em cada um, e permitem clonar uma voz a partir de poucos segundos de áudio. A Microsoft fala em travas de consentimento contra uso indevido, sem detalhar como funcionam. O Flash tem latência de ponta a ponta de 150 milissegundos, segundo o anúncio.
Os números se sustentam?
O dado mais forte vem de fora da Microsoft. Segundo a MarkTechPost, no ranking da Artificial Analysis o modelo ficou em primeiro entre 38, com 2,5% de taxa de erro de palavras a 0,13 segundo do fim da fala. O Grok Voice Transcribe 2.0 ficou em segundo, com 2,7% a 0,49 segundo, e o Muse Voice Transcribe, da Meta, em terceiro, com 3,1% a 0,16 segundo. O teste usou cerca de 8 horas de áudio, metade de conversas com agentes e o resto de discursos do Parlamento Europeu e teleconferências de resultados.
O preço de lançamento é de US$ 0,54 por hora de áudio até o fim do ano, mais de cinco vezes o da versão em lote, o MAI-Transcribe-2, que custa US$ 0,10 por hora. A MarkTechPost cita concorrentes de streaming entre US$ 0,18 e US$ 0,20 por hora. A conta, portanto, favorece a Microsoft em latência e precisão e desfavorece em preço. A RuntimeWire observa ainda que a latência anunciada é a do modelo, e que o tempo real de resposta depende da rede e da arquitetura de quem integra.
Como chegamos até aqui?
A Microsoft AI lançou o MAI-Transcribe-2, em lote, em setembro. A versão em streaming completa a pilha que um agente de voz precisa: ouvir em tempo real, entender e responder com voz. A disputa nesse pedaço ficou cheia em poucos dias. A ElevenLabs lançou o Eleven v4 com 90 idiomas em 28 de setembro e dobrou de valor para US$ 22 bilhões, como o portal noticiou. A Meta tem o Muse Voice Transcribe no ranking e a xAI tem o Grok Voice.
Para a Microsoft, o movimento também tem peso estratégico. Modelos próprios no Foundry diminuem a dependência dos modelos da OpenAI dentro do Azure.
O que muda para quem está no Brasil?
A documentação do Microsoft Learn lista o português (código “pt”, sem separar Brasil e Portugal) entre os idiomas do MAI-Transcribe-2 e traz vozes prontas em pt-BR, como Luana, Caio, Pedro e Rafael, nos dois modelos de voz, com estilos como “customer_call_center” e “agent”. A página consultada não detalha os idiomas da versão em streaming. Quem pensa em usar o modelo em central de atendimento brasileira deve testar com áudio real de telefone, sotaques regionais e ruído, porque os números divulgados não trazem resultado específico para o português.
Há também uma questão de dados. Atendimento por voz trata dado pessoal, e a LGPD exige base legal e transparência para gravar e transcrever ligações. A clonagem de voz pede cuidado adicional com consentimento.
O que observar nas próximas semanas
A tese: a transcrição em tempo real virou disputa de latência e preço, e a Microsoft entra para disputar os agentes de voz corporativos dentro do Azure. Até o fim de dezembro, vale checar o preço que vai vigorar depois da tarifa promocional, a chegada ao LiveKit, a publicação da lista de idiomas da versão em streaming e testes independentes em outros idiomas além do inglês. Também vale ver se ElevenLabs, Meta e xAI respondem com corte de preço.
Fontes
- Microsoft AI, Our first streaming transcription model (anúncio oficial), 01/10/2026
- Microsoft Learn, MAI-Voice, vozes e idiomas suportados (documentação, consultada em), 04/10/2026
- Microsoft Learn, MAI-Transcribe, idiomas suportados (documentação, consultada em), 04/10/2026
- MarkTechPost, Microsoft AI Releases MAI-Transcribe-2-Streaming: #1 Real-Time Speech-to-Text Model on Artificial Analysis, 02/10/2026
- TestingCatalog, Microsoft launches MAI-Transcribe-2-Streaming, 01/10/2026
- RuntimeWire, Microsoft adds streaming transcription and two voice models to its MAI lineup, 01/10/2026
Rating Marcio.AI: 4/5 (Global, Muito relevante, Muito próximo do hype). Seção DeepTech do Watcher.
#MarcioAI #Microsoft #AgentesDeVoz #Transcricao #SpeechToText #IA
Como este texto foi produzido
Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.
Leia também: ElevenLabs lança Eleven v4 com 90 idiomas e ElevenLabs dobra de valor para US$ 22 bilhões
