微软于 7 月 23 日发布两款新模型进入公开预览:MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash;同时公布内部数据,客服中心改用 MAI-Voice-2-Flash 后算力成本降低 89%。微软执行长 Satya Nadella 称,当自家模型表现配平或超越前沿方案时就把流量导向 MAI。
MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 的功能定位与定价
MAI-Image-2.5-Pro 定位高阶影像生成,定价为每百万文字输入 token 5 美元、每百万图片输出 token 106 美元;Bing Image Creator 已全面改用 MAI-Image-2.5,WPP 全球创意长 Rob Reilly 在微软公告中称之为「生成媒体工具的一次重大跃进」。
MAI-Voice-2-Flash 定位大量语音处理场景(如客服中心),比前代快一倍、成本低 32%;客服中心换用此模型后算力成本降低 89%。此次公告同时披露了 Bing Image Creator、PowerPoint(GPU 成本较 GPT-Image-2 降低 84%)、OneDrive(存储率 +26%、延迟 -25%)和 Dragon Copilot(错误率 -50%)的部署成效。
GPU 成本节省的具体成绩
微软在公告中揭露的各场景成效如下:
MAI-Voice-2-Flash(客服中心语音):算力成本降低 89%;比前代快一倍、成本低 32%
MAI-Image-2.5-Pro(PowerPoint):GPU 成本较 OpenAI GPT-Image-2 降低 84%
OneDrive 换模型:存储率提升 26%,延迟降低约 25%
Dragon Copilot(MAI-Transcribe-1.5,医疗转录):服务 17 万名医疗人员;上季处理 2,800 万笔患者记录;跨 58 种语言转录与语言识别错误率相对降低 50%
MAI-Code-1-Flash(GitHub Copilot):代码采用率较 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%;Token 消耗少 10%;可在 H100 甚至 A100 GPU 上运行
Nadella 飞轮战略与 MAI 取代前沿模型的流量逻辑
Nadella 在 X 上以《前沿扩散与控制》为题发文,阐述微软的模型策略:当自家模型表现配平或超越前沿替代方案时,就把流量导向 MAI,以更低成本大规模提供服务。支撑此策略的是「hill-climbing」方法论:让资料、模型与产品「配套系统」形成持续迭代的飞轮,而非靠单次训练决定生死。
他同时表示,评测系统「即使拿掉任何一个模型,都应该继续往上爬」——把记忆与技能留在模型之外,形成微软真正掌握的控制权。MAI-Code-1-Flash 在 Excel 的强化学习环境中加练后,可在旧款 H100 和 A100 GPU 上运行,在多数 Excel 任务上配平 GPT-5.6,同时释放最新 GB200 叢集用于训练而非服务请求。
常见问题
MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 的定价各为多少?
MAI-Image-2.5-Pro 定价为每百万文字输入 token 5 美元、每百万图片输出 token 106 美元,已在 Azure 公开预览中提供。MAI-Voice-2-Flash 比前代快一倍、成本低 32%,定价细节以 Azure 官方公告为准。
微软表示改用 MAI 模型后 GPU 成本最多降了多少?
根据微软公布的内部数据,客服中心改用 MAI-Voice-2-Flash 后算力成本降低 89%;PowerPoint 改用 MAI 图像模型后 GPU 成本较 GPT-Image-2 降低 84%;Dragon Copilot 换用 MAI-Transcribe-1.5 后转录与语言识别错误率相对降低 50%。上述数字均来自微软内部评测,并非第三方独立基准测试。
企业客户如何透过 Azure 使用 Microsoft 的 MAI 训练方法?
微软透过 Azure 的 Foundry 和 Frontier Tuning 产品,让企业客户可以使用自己的资料训练专属模型;微软强调这些模型训练来自「干净、可追溯的企业级资料」,且不经第三方模型蒸馏,以回应训练资料来源的合规性问题。