マイクロソフトは7月23日に2つの新しいモデルを公開プレビューとして提供開始しました:MAI-Image-2.5-Pro と MAI-Voice-2-Flash;同時に社内データも明らかにし、カスタマーサポートセンターが MAI-Voice-2-Flash に切り替えた後の計算コストが89%低下すると発表しました。マイクロソフトのCEO サティア・ナデラは、自社モデルの性能が最先端の代替案と同等かそれを上回る場合にはトラフィックを MAI に振り向けると述べています。
MAI-Image-2.5-Pro と MAI-Voice-2-Flash の機能的な位置づけと価格
MAI-Image-2.5-Pro は上位の画像生成を目的としており、価格は「100万文字入力tokenあたり5ドル」「100万画像出力tokenあたり106ドル」です;Bing Image Creator は全面的に MAI-Image-2.5 に切り替わっており、WPPのグローバル・クリエイティブ・ディレクター Rob Reilly はマイクロソフトの発表で「生成メディアツールにとっての大きな飛躍」だと評価しています。
MAI-Voice-2-Flash は大量の音声処理シーン(たとえばカスタマーサポートセンター)を想定しており、前モデルより2倍速く、コストは32%低いとしています;サポートセンターがこのモデルに切り替えた後、計算コストは89%低下したとのことです。今回の発表では同時に、Bing Image Creator、PowerPoint(GPUコストは GPT-Image-2 より84%低下)、OneDrive(保存率 +26%、遅延 -25%)、および Dragon Copilot(エラー率 -50%)の導入効果も明らかにしています。
GPUコスト削減の具体的な実績
マイクロソフトが発表した各シーンでの効果は以下の通りです:
MAI-Voice-2-Flash(カスタマーサポートセンターの音声):計算コストが89%低下;前モデルより2倍速く、コストは32%低い
MAI-Image-2.5-Pro(PowerPoint):GPUコストが OpenAI GPT-Image-2 より84%低下
OneDrive のモデル切り替え:保存率が26%向上、遅延が約25%低下
Dragon Copilot(MAI-Transcribe-1.5、医療の文字起こし):17万人の医療従事者にサービス提供;前四半期に2,800万件の患者記録を処理;58種類の言語での文字起こしと、言語認識のエラー率が相対的に50%低下
MAI-Code-1-Flash(GitHub Copilot):コード採用率が GPT-5.4 Mini と Claude Haiku 4.5 より約10%高い;トークン消費量が少ない(10%);H100 さらには A100 GPU 上で動作可能
ナデラの“飛輪”戦略と、MAIが最先端モデルを置き換えるためのトラフィックの論理
ナデラはXで「最先端の拡散と制御」を題して投稿し、マイクロソフトのモデル戦略を説明しました:自社モデルが最先端の代替案と性能をそろえるか上回る場合には、トラフィックを MAI に振り向け、より低コストで大規模にサービス提供するという考えです。この戦略を支えるのが「hill-climbing(ハイ ルクライミング)」という考え方で、データ、モデル、プロダクトの「連動システム」が継続的に反復する“飛輪”を形成し、単発の学習だけで勝ち負けを決めるのではない、というものです。
また、評価システムについて「どのモデルを1つ外しても、なお上へ向かっていくべきだ」とも述べています――記憶と技能をモデルの外に残し、マイクロソフトが本当に掌握する“制御権”を形成するという考えです。MAI-Code-1-Flash は Excel の強化学習環境で追加学習した後、旧世代の H100 と A100 GPU 上でも動作でき、多くの Excel タスクで GPT-5.6 と互角にしつつ、最新の GB200 クラスタを学習要件に振り向けて、サービスリクエストには使わないようにします。
よくある質問
MAI-Image-2.5-Pro と MAI-Voice-2-Flash の価格はいくらですか?
MAI-Image-2.5-Pro の価格は「100万文字入力tokenあたり5ドル」「100万画像出力tokenあたり106ドル」で、すでに Azure の公開プレビューで提供されています。MAI-Voice-2-Flash は前モデルより2倍速く、コストは32%低い一方で、価格の詳細は Azure の公式発表に準じます。
マイクロソフトは MAI モデルに切り替えたことで GPU コストが最大でどれだけ下がると述べていますか?
マイクロソフトが公開した社内データによれば、カスタマーサポートセンターが MAI-Voice-2-Flash に切り替えた後、計算コストは89%低下します;PowerPoint が MAI 画像モデルに切り替わった後、GPUコストは GPT-Image-2 より84%低下します;また Dragon Copilot は MAI-Transcribe-1.5 に切り替えることで、文字起こしおよび言語認識のエラー率が相対的に50%低下します。ただし、上記の数字はいずれもマイクロソフト社内の評価に基づくもので、第三者による独立のベンチマークテストではありません。
企業のお客様は Azure を通じて Microsoft の MAI の学習方法をどう利用できますか?
マイクロソフトは Azure の Foundry と Frontier Tuning 製品を通じて、企業のお客様が自社データを使って専用モデルを学習できるようにしています;またマイクロソフトは、これらのモデルの学習が「クリーンで追跡可能な企業レベルのデータ」に基づき、第三者のモデルによる蒸留は行われていないと強調しており、学習データの出所に関するコンプライアンス上の問題に対応しています。