MAI-Code-1-Flash:来自真实开发者工作流的早期结果

2026年7月29日,作者:Faith Xu

在 VS Code 中,我们一直致力于通过 AI 辅助编程帮你完成更多工作,同时让每一个 Token 都物尽其用。这意味着我们要改进整个体验——从所使用的模型到其背后的产品和基础设施,为你提供适应不同工作流、性能需求和预算的选项。在 VS Code 中 GitHub Copilot 背后的编码工具包 (The Coding Harness Behind GitHub Copilot in VS Code) 一文中,我们解释了 VS Code 的编码工具包是如何将模型、工具和编辑器体验连接起来,以助力模型发挥最高效作用的。

在这篇文章中,我们将探讨专门针对 VS Code 工具包训练模型如何能进一步提升质量和效率。我们重点关注的模型是 MAI-Code-1-Flash,这是微软针对开发者每天在 GitHub Copilot 中执行的快速、迭代式编码任务而构建的轻量级编码模型。自该模型在 Build 大会上推出以来,它一直与领先的编码模型一起在生产环境中运行,让我们得以抢先了解它在真实开发者工作流中的表现。

结果表明,将 MAI-Code-1-Flash 与 VS Code 编码工具包相结合,能够在降低 Token 消耗的同时提供出色的编码质量,帮助开发者从其使用额度中获得更多价值。

生产环境中的质量与效率

在评估编码模型时,质量和效率至关重要。使用更少 Token 的模型可以降低成本,但如果开发者仍然能够高效完成任务,这种成本节约才会更有价值。我们的目标是找到正确的平衡点:在高效使用 Token 的同时保持出色的编码质量。

为了解 MAI-Code-1-Flash 在这种权衡中的表现,我们分析了在 VS Code Copilot Chat 中选择各个模型的开发者的聚合数据。我们同时考察了生成代码的质量以及开发者达到持久结果的效率。在质量方面,我们测量了开发者是否接受生成的建议,以及该代码在主动编辑后和提交时是否保留。在效率方面,我们测量了每个对话轮次生成的 Token 中位数,以及达到提交所需的轮次中位数。

结果表明,MAI-Code-1-Flash 在质量和效率之间取得了很好的平衡。它在质量上优于 Claude Haiku 4.5 和 GPT-5.4 Mini。体量更大的 GPT-5.6 Luna 和 Kimi K2.7 Code 虽在质量上占优,但每轮所需的 Token 数增加了 67% 到 94%,并且每次提交所需的轮次也更多。

Aggregated quality and efficiency metrics

模型 代码保留率 提交保留率 接受率 每轮 Token 数 每次提交的轮数
MAI-Code-1-Flash 基准 (0%) 基准 (0%) 基准 (0%) 基准 (0%) 基准 (0%)
Claude Haiku 4.5 -2% -8% -10% -10% +28%
GPT 5.4 Mini -3% -8% -7% +7% +17%
GPT 5.6 Luna +3% +3% +4% +67% +17%
Kimi K2.7 Code +4% +6% -6% +94% +11%

数据来源于 2026 年 6 月 2 日至 2026 年 7 月 24 日期间在 VS Code Copilot Chat 中选择各模型的用户。 指标定义:代码保留率 = 经过 10 分钟主动编辑后保留的 AI 生成代码的百分比。提交保留率 = Git 提交时保留的 AI 生成代码的百分比。接受率 = 用户接受的 AI 生成建议的百分比。每轮 Token 数 = 模型在每个对话轮次(单次请求-响应交互)中生成的 Token 数量的中位数。每次提交轮数 = 用户在达到 Git 提交之前完成的对话轮数的中位数。

通过 Auto 灰度测试验证结果

作为验证聚合使用数据的另一种方法,我们在 VS Code Copilot Chat 的 Auto 模型体验中运行了 A/B 灰度测试。Auto 会自动分配模型,而无需开发者手动选择,这有助于我们将模型的影响与选择不同模型或使用任务差异所带来的影响隔离开来。随后,我们考察了参与度和重复使用率,以此作为判断开发者是否觉得该体验足够有用而继续使用的信号。

结果印证了相同的结论。MAI-Code-1-Flash 带来了更高的参与度,同时比其他轻量级模型更具 Token 效率。与使用 GPT-5.4 Mini 相比,用户在两天内再次使用的可能性高出 6%,比使用 Claude Haiku 4.5 高出 11%。尽管参与度更高,但其 Token 使用量中位数比 GPT-5.4 Mini 低 13%,比 Claude Haiku 4.5 低 11%。换句话说,人们更多地使用了 MAI-Code-1-Flash,而它的运行成本依然更低。

比较 用户发起的轮次 2 天重复使用率 4 天重复使用率 总 Token 数
Claude Haiku 4.5 -5% -11% -37% +11%
GPT 5.4 Mini 无统计学显著差异 -6% -13% +13%

综上所述,生产环境指标和 Auto 灰度测试凸显了 MAI-Code-1-Flash 旨在扮演的角色:在高效使用 Token 的同时,在简单编码任务上交付出色的结果。最后,让我们仔细了解一下该模型及其旨在支持的工作流。

专为开发者的工作方式而设计

MAI-Code-1-Flash 的开发旨在与 VS Code 编码工具包及其支持的实际工作流紧密配合。它特别适合轻量级、迭代式的工作,例如探索代码、进行增量修改、生成或精炼测试以及修复 Bug。其自适应解决方案长度可确保简单请求的响应保持简洁,仅在需要时深入探讨。这意味着它能更快地提供有用的输出,同时还能提高 Token 的使用效率。

该模型使用干净、可追溯的数据从头开始训练,没有经过第三方模型的蒸馏。随着时间的推移,该模型将根据来自消费者套餐的聚合使用信号不断改进,而 Copilot Business 和 Copilot Enterprise 客户的数据则不会用于训练。

立即试用,助力塑造未来

MAI-Code-1-Flash 现已在 GitHub Copilot 中上线。将其与你当前常用的模型一起试用,体验它在你的工作流中的表现,并在 社区讨论 (Community Discussion) 中分享哪些功能运作良好,或者你希望看到哪些改进,开发团队正在密切关注。

你的反馈也有助于塑造未来的产品。MAI-Code-1-Flash 只是 MAI 编码模型发展历程中的第一步。今年晚些时候推出的更大规模的 MAI 编码模型将把该系列扩展到更复杂的任务中,具备更高的智能、更深层的推理能力,其质量旨在与最强大的前沿模型相媲美。

编码愉快! 💙

English 한국어 中文(简体) 中文(繁體)
© . This website operates independently and is not affiliated with or endorsed by Microsoft. All brand names, logos, and trademarks are the property of their respective owners.