A Microsoft lança o MAI-Voice-2-Flash, reduzindo em 89% os custos de GPU

MSFT-2,24%
Key Takeaways
  • A Microsoft lançou MAI-Voice-2-Flash e MAI-Image-2.5-Pro para prévia pública em 23 de julho, com reduções de custos significativas.
  • Os centros de atendimento ao cliente da Microsoft alcançaram uma redução de 89% nos custos de computação após adotar o MAI-Voice-2-Flash para processamento de fala.
  • O MAI-Code-1-Flash pode ser executado em GPUs H100 e A100 mais antigas, mantendo um desempenho equivalente ao do GPT-5.6 em tarefas do Excel.

A Microsoft, em 23 de julho, divulgou dois novos modelos para acesso público em prévia: MAI-Image-2.5-Pro e MAI-Voice-2-Flash; ao mesmo tempo, publicou dados internos de que, após o centro de atendimento passar a usar o MAI-Voice-2-Flash, o custo de computação cai 89%. O CEO da Microsoft, Satya Nadella, afirmou que, quando os modelos da própria empresa emparelham ou superam soluções de ponta, ele direciona o tráfego para o MAI.

Enquadramento de recursos e precificação do MAI-Image-2.5-Pro e do MAI-Voice-2-Flash

O MAI-Image-2.5-Pro é voltado para a geração avançada de imagens, com preço de US$ 5 por milhão de tokens de entrada de texto e US$ 106 por milhão de tokens de saída de imagens; o Bing Image Creator já foi totalmente substituído por MAI-Image-2.5, e o diretor global de criação da WPP, Rob Reilly, afirmou na divulgação da Microsoft que se trata de um “grande salto na área de ferramentas de mídia gerada”.

O MAI-Voice-2-Flash é voltado para cenários de processamento massivo de voz (como centrais de atendimento), é duas vezes mais rápido que o antecessor e tem custo 32% menor; após a central de atendimento trocar por este modelo, o custo de computação cai 89%. Nesta mesma divulgação, foram apresentados também os resultados da implantação no Bing Image Creator, no PowerPoint (com custo de GPU 84% menor que o do GPT-Image-2), no OneDrive (taxa de armazenamento +26%, latência -25%) e no Dragon Copilot (taxa de erro -50%).

Resultados específicos de economia de custos de GPU

A Microsoft revelou, na nota, os resultados de cada cenário da seguinte forma:

MAI-Voice-2-Flash (voz da central de atendimento): custo de computação reduzido em 89%; duas vezes mais rápido que o antecessor, com custo 32% menor

MAI-Image-2.5-Pro (PowerPoint): custo de GPU reduzido 84% em relação ao OpenAI GPT-Image-2

OneDrive ao trocar de modelo: taxa de armazenamento aumenta 26%, e a latência cai cerca de 25%

Dragon Copilot (MAI-Transcribe-1.5, transcrição médica): atende 170 mil profissionais de saúde; no trimestre anterior processou 28 milhões de registros de pacientes; ao transcrever e reconhecer idiomas em 58 idiomas, a taxa de erro de reconhecimento de linguagem cai relativamente 50%

MAI-Code-1-Flash (GitHub Copilot): a taxa de adoção de código é cerca de 10% maior que GPT-5.4 Mini e Claude Haiku 4.5; o consumo de tokens é 10% menor; pode ser executado em GPUs H100 e até A100

Estratégia de “roda de moinho” de Nadella e lógica de tráfego para MAI substituir modelos de ponta

Nadella publicou no X uma postagem com o título “difusão e controle de ponta”, na qual explica a estratégia de modelos da Microsoft: quando os modelos da própria empresa apresentarem desempenho igualando ou superando soluções substitutas de ponta, o tráfego é direcionado para o MAI, entregando serviços em larga escala com menor custo. O que sustenta essa estratégia é a metodologia “hill-climbing”: fazer com que os dados, o modelo e o produto “se encaixem” e formem uma roda de iteração contínua, em vez de depender de um único ciclo de treinamento para decidir vida ou morte.

Ele também afirmou que o sistema de avaliação “mesmo removendo qualquer um dos modelos, deve continuar subindo” — manter memória e habilidades fora do modelo, formando o verdadeiro controle que a Microsoft domina. Depois de afinar o MAI-Code-1-Flash no ambiente de aprendizado por reforço do Excel, ele pode ser executado em GPUs H100 e A100 de geração anterior, emparelhando GPT-5.6 na maioria das tarefas do Excel, enquanto libera o cluster mais recente GB200 para treinamento, e não para requisições de serviço.

Perguntas frequentes

Qual é o preço do MAI-Image-2.5-Pro e do MAI-Voice-2-Flash, respectivamente?

O MAI-Image-2.5-Pro custa US$ 5 por milhão de tokens de entrada de texto e US$ 106 por milhão de tokens de saída de imagens, já disponível em prévia pública no Azure. O MAI-Voice-2-Flash é duas vezes mais rápido que o antecessor, com custo 32% menor; os detalhes do preço ficam a cargo do comunicado oficial no Azure.

Quanto a Microsoft disse que o custo de GPU caiu no máximo após adotar os modelos MAI?

Com base nos dados internos divulgados pela Microsoft, após a central de atendimento passar a usar o MAI-Voice-2-Flash, o custo de computação cai 89%; ao mudar o PowerPoint para um modelo de imagem MAI, o custo de GPU cai 84% em relação ao GPT-Image-2; ao trocar o Dragon Copilot para o MAI-Transcribe-1.5, a taxa de erro de transcrição e reconhecimento de linguagem cai relativamente 50%. No entanto, todos esses números vêm de avaliações internas da Microsoft, e não de testes independentes de terceiros.

Como clientes corporativos usam o método de treinamento MAI da Microsoft via Azure?

A Microsoft, por meio dos produtos Foundry e Frontier Tuning no Azure, permite que clientes corporativos usem seus próprios dados para treinar modelos dedicados; a Microsoft destaca que o treinamento desses modelos usa “dados corporativos limpos e rastreáveis”, sem destilação por modelos de terceiros, para responder às questões de conformidade sobre a origem dos dados de treinamento.

Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários