人工智能

苹果被曝接洽 PrismML:1-bit 压缩技术已让 27B Qwen 3.6 在 iPhone 17 Pro 本地运行

2026年7月10日 · admin
openmagic ad

据 IT之家 7 月 10 日消息,科技媒体 The Information 于 7 月 9 日报道称,苹果正在接触 AI 初创公司 PrismML,重点评估其模型压缩技术能否帮助 iPhone 直接运行更大规模的 AI 模型。来源显示,PrismML 已将阿里巴巴开源大模型 Qwen 3.6 进行精简,并在 iPhone 17 Pro 上实现完整运行;该模型拥有 27B 参数。苹果看中的方向,是通过更高效的模型压缩与推理优化,提升本地端 AI 能力,而不是完全依赖云端模型。

公开资料显示,PrismML 是一家源自加州理工的 AI 初创公司,其核心技术被称为原生 1-bit 模型压缩。与常见的后训练量化不同,来源摘要称该方案的模型权重仅使用 {-1, +1} 表示,并配合分组缩放因子,目标是在显著降低模型体积和内存占用的同时,尽量保持接近 FP16 模型的精度表现。

1-bit 压缩为什么会引起苹果关注

对苹果而言,端侧 AI 的关键瓶颈并不只是算力,还包括内存、能耗、散热和响应速度。大型语言模型参数规模越大,对设备内存和持续推理功耗的要求越高。来源提到,PrismML 的技术可将模型体积压缩至全精度版本约 1/14,内存占用降低超过 90%,并宣称推理速度最高提升 8 倍、能耗降低 75%-80%。如果这些能力能够在消费级设备上稳定落地,将有助于手机运行更复杂的本地 AI 功能。

从技术路径看,苹果近年一直强调设备端智能:一方面可降低云端请求带来的延迟,另一方面也更契合其对隐私和系统级体验的长期叙事。若更大规模模型能够在 iPhone 上本地运行,未来语音助手、文本生成、图片理解、跨 App 自动化等能力,可能获得更强的上下文理解和更快的响应。

Qwen 3.6 在 iPhone 17 Pro 上运行的信号意义

此次报道中最值得关注的细节,是 PrismML 精简后的Qwen 3.6 27B 参数模型已在 iPhone 17 Pro 上完整运行。对于移动端设备来说,27B 级别模型通常意味着较高的存储、内存和推理压力。虽然来源并未披露具体运行速度、温控表现、续航影响或实际任务效果,但“完整运行”本身已经释放出一个信号:端侧大模型的规模边界正在被压缩技术重新定义。

  • 对用户体验:更强本地模型可能带来离线可用、低延迟和更少数据上传的 AI 功能。
  • 对开发者:如果系统层开放相关能力,App 可调用更强的本地推理能力,降低对外部 API 的依赖。
  • 对芯片与系统:模型压缩会与神经网络引擎、内存架构、系统调度形成协同竞争点。
  • 对模型生态:开源模型经过端侧优化后,可能更快进入手机、PC、可穿戴设备等终端场景。

影响与解读:端侧 AI 竞争进入“模型压缩”阶段

过去关于端侧 AI 的讨论,往往集中在芯片算力和云端模型能力上。但随着手机厂商希望把更多智能功能放在本地运行,模型压缩、低比特推理和内存优化正在变成同等重要的基础能力。PrismML 所宣称的“无高精度逃生通道”也显示,其路线并非简单把模型部分参数保留为高精度,而是试图从模型表示方式上重新设计压缩方案。

不过,这类技术仍需要谨慎看待。来源中的性能提升、能耗下降和精度保持属于公司宣称或报道信息,最终能否进入苹果产品,还取决于实际任务表现、系统稳定性、开发成本以及与苹果自研模型和硬件栈的整合难度。苹果接洽 PrismML 并不等同于确定收购或采用,但至少说明,大模型在终端设备上的部署已经成为手机 AI 竞争的核心议题之一。

对中文读者和开发者来说,此事还有另一层意义:Qwen 等开源模型经过压缩优化后,正在进入更多端侧实验场景。未来 AI 应用的竞争,未必只是谁拥有最大模型,也可能是谁能把足够强的模型以更低成本、更低功耗、更稳定的方式运行在每个人手中的设备上。