人工智能

GitHub Copilot 将支持本地模型推理:可在云端与设备端 AI 间切换

2026年10月8日 · admin
OpenMagic API

据 IT之家消息,微软在美国旧金山举行的发布会上宣布,GitHub Copilot 将在本月底前加入本地 AI 模型推理能力。也就是说,这款面向开发者的 AI 编程助手不再只依赖云端托管模型,而是可以在云端模型与设备端模型之间进行自动或手动切换。对于使用 Visual Studio Code、CLI 以及 Copilot 应用的开发者来说,这意味着代码补全、解释、重构建议等能力未来有机会在本机完成一部分推理任务。

GitHub Copilot 过去的核心运行方式,是将开发环境中的上下文发送给云端模型,再由后台协调器根据性能、成本与准确性等因素对请求进行路由。微软此次扩展的重点,是把本地 AI 模型纳入同一套调度机制,让 Copilot 可以根据场景选择云端或设备端推理,或由用户强制指定只使用本地模型。

Copilot 从“云端编程助手”走向混合推理

来源显示,微软将为 GitHub Copilot 用户提供两种使用模式:一种是自动编排,由系统在云端模型和本地模型之间协调;另一种是强制使用设备端模型。用户可在 GitHub Copilot CLI、Copilot 应用以及 Visual Studio Code 中设置相关偏好。

本地模型的选择也并非固定单一。开发者可以指定提供程序、模型或端点。例如,在 Windows ML 路径下选择微软提供的 MAI Code 1.1 Flash;也可以连接兼容 OpenAI 接口的本地端点,并选用该端点暴露出来的模型。这种设计更接近开发工具中的“模型路由层”,而不是简单增加一个本地开关。

  • 自动编排:Copilot 后台根据任务与资源情况,在云端和本地模型间调度。
  • 强制本地:用户可指定设备端模型执行推理,减少对云端模型的依赖。
  • 可配置端点:支持通过 Windows ML 或 OpenAI 兼容本地端点选择模型。
  • 覆盖多入口:设置入口包括 Copilot CLI、Copilot 应用和 Visual Studio Code。

MAI Code 1.1 Flash:面向代码任务的本地模型尝试

微软同时推出了 MAI Code 1.1 Flash 模型。来源摘要显示,这是一款“混合专家”模型,总参数为 1370 亿,活跃参数为 68 亿,并采用量化与推测解码技术,以优化响应速度与内存占用。对于本地推理而言,这两点非常关键:一方面要降低设备端运行时的资源压力,另一方面要尽可能保持交互式编程场景所需要的低延迟。

在 Surface Laptop Ultra 上的测试结果显示,该模型在复杂任务中的峰值内存使用率、Token 利用率与处理速度均有明显提升。解码吞吐量测试中,当提示长度从 2K 到 256K Token 变化时,吞吐量介于每秒 40 至 63 个词元。对于编程助手而言,吞吐量不仅影响补全速度,也会影响长上下文代码理解、重构建议生成等任务的体验。

影响与解读:AI 编程工具进入“端云协同”阶段

从行业趋势看,Copilot 支持本地推理并不只是一个功能更新,而是 AI 编程工具架构上的重要变化。过去,开发者使用 AI 编程助手时,云端模型通常负责主要推理能力,优势是模型能力强、更新快、运维集中;但不足也很明显,包括网络依赖、延迟波动,以及部分团队对代码上下文外发的顾虑。

设备端模型的加入,为 Copilot 提供了新的平衡点。对于较轻量、频繁、对响应速度敏感的任务,本地模型可能更适合;对于复杂推理、跨文件分析或需要更强模型能力的场景,云端模型仍然有价值。微软让 Copilot 在两类模型之间自动调度,实际上是在把模型选择能力产品化,让开发者不必每次手动判断该使用哪一类模型。

这也会进一步推动 PC 硬件、操作系统 AI 框架与开发者工具之间的协同。Windows ML、本地端点、量化模型和推测解码等技术,被放入 Copilot 的真实开发流程后,端侧 AI 不再只是演示能力,而是开始进入高频生产力工具。对于中文开发者和企业团队来说,后续值得关注的是本地模型在代码质量、语言生态适配、隐私策略以及不同硬件上的实际表现。

总体来看,GitHub Copilot 将支持本地 AI 模型推理,代表微软正在把 AI 编程助手从单一云端服务推进到端云混合推理模式。随着更多模型、端点和硬件平台接入,开发者未来使用 Copilot 的体验可能会更加灵活:既能获得云端大模型能力,也能在合适场景下利用本机算力完成更快、更可控的推理。