洞察

创作与工作流

MAI-Code-1.1-Flash:代码模型的竞争转向单任务成本

2026 年 10 月 7 日,微软 AI 发布 MAI-Code-1.1-Flash,这是其 6 月 Build 大会上发布的代码模型的更新版。公告的重点不是跑分,而是成本与部署位置:成本为前代的四分之一、单任务 token 减少 25%、GitHub Copilot 内 token 流速提升 25%,另提供可下载的 3-bit 量化版本(256K 上下文),本地运行零推理费用。2026 年 10 月底前将在 Copilot 应用、CLI 与 VS Code 开放实验性访问。

SlateMoth Editorial · Muse ·

Muse 辅助起草;事实与八语译文均由所有者审阅。这不是独立模型复审。 本文由 AI 辅助起草,未经过独立人工审阅。除非另有说明,所有数字均为厂商公布;采取行动前请以原始来源核对。

微软宣布了什么

2026 年 10 月 7 日,微软 AI 发布题为「MAI-Code-1.1-Flash:更好、更快,成本仅四分之一」的公告,介绍其 2026 年 6 月 Microsoft Build 大会上发布的自研代码模型 MAI-Code-1.0 的更新版。微软称新模型已在 GitHub Copilot 中投入生产使用。

公告的核心主张是经济性的:模型成本为 MAI-Code-1.0 的四分之一,完成单个任务的 token 消耗减少 25%,在 GitHub Copilot 中的 token 流速提升 25%。微软将此归因于训练与服务效率的提升,包括在 GitHub Copilot 中跨数十万个强化学习环境进行的优化。

[1]

微软公布的数字

基准测试方面,微软称在 GitHub Copilot CLI 中 Terminal-Bench 2.1 提升 22%,.NET 任务提升 15%,均为相对前代的对比。在其选择公布的生产指标中,代码存活率上升 4%,回访率上升 9%。

以上所有数字均为微软自述:对比对象是其自家前代模型或自家生产遥测数据。核验时未见独立评测,公告也未给出美元定价,只有相对的“四分之一成本”说法。

[1]

本地运行选项

公告中最具结构性意义的是本地部分。MAI-Code-1.1-Flash 提供可下载的 3-bit 量化版本本地运行,保留完整的 256K 上下文窗口;微软称其在 SWE-Bench Verified 与 Terminal-Bench 2.1 上的代码能力与全精度版本相当。微软表示本地模型调用零推理费用,并建议使用 120GB 以上内存的设备以获得最佳性能。

微软称,2026 年 10 月底前将在 GitHub Copilot 应用、GitHub Copilot CLI 与 Visual Studio Code 中开放实验性访问,让 Copilot 的路由器在云端模型之外,为符合条件的代码工作增加一个端侧选项。

[1]

对代码工作流意味着什么

综合来看,更低的单任务成本加上零费用的本地选项,改变了智能体化编程的经济学:长时间运行的 CLI 智能体与后台代码任务可以更高频次地运行,工作负载放在云端还是设备端,也从默认变成真正的选择。

对企业而言,端侧代码模型还能缓解敏感代码库的数据出境与数据驻留顾虑。代价是硬件:120GB 以上内存的建议意味着本地选项目前只属于工作站级设备。

[1]

尚未证实的部分

仍有大量信息未披露。公告未给出许可条款、下载地址、参数规模与美元定价;2026 年 10 月 8 日的独立报道指出了同样的缺口,并提醒所有数字均为微软自述。

真正值得关注的是方向:代码模型的竞争正从榜单跑分转向单任务成本与部署灵活性——这才是决定模型能否活在生产预算里的指标。但在许可条款与独立评测出现之前,团队应把厂商数字视为方向性参考,先试点再把关键工作流押上去。

[1] [2]

资料来源与延伸阅读

来源记录由所有者审阅;不声称已完成独立事实核验或独立模型复审。

  1. 微软 AI 官方博客(原始公告)

    Microsoft AI

    Recorded publication date ·

    Recorded verification time ·

  2. Deyron Labs 独立分析(2026-10-08)

    Deyron Labs

    Recorded publication date ·

    Recorded verification time ·