人工智能

MacBook Pro 外接 iPhone 17 Pro Max 跑 Qwen3.8-27B:预填充速度最高提升 44%

2026年10月4日 · admin
OpenMagic API

据 IT之家 10 月 4 日消息,围绕本地运行大模型的硬件瓶颈,有开发者做了一次颇具实验意味的尝试:将搭载 M4 Pro 芯片、配备 24GB 统一内存的 MacBook Pro,通过 USB-C 外接 iPhone 17 Pro Max,并借助自制软件协同运行 Qwen3.8-27B 模型。来源显示,这套方案在特定预填充任务中可将性能最高提升 44%。该项目目前已开源,名称为 backburner。

Qwen3.8-27B 这类参数规模较大的 AI 模型,对显存和系统内存有较高要求。对于只有 24GB 统一内存的 MacBook Pro 来说,模型并非不能跑,但在长上下文和预填充阶段容易受到内存与带宽限制。此次实验的核心思路,是把 iPhone 17 Pro Max 视作一块可参与推理的外部计算设备,让 Mac 与手机分担模型不同层的计算任务。

把 iPhone 变成“协处理器”:Mac 与手机分层计算

据 Wccftech 报道,Reddit 用户“u/StayLameBro”设计了两类协同方式,用于突破 MacBook Pro 24GB 统一内存带来的限制。针对预填充加速,MacBook Pro 会处理每一批 256 个 token 中的第 1 至 40 层,然后把激活值数据流传输到 iPhone;iPhone 17 Pro Max 则利用 A19 Pro 的 GPU 运行第 41 至 64 层。与此同时,Mac 端会继续开始处理下一批数据,从而形成流水线式并行。

来源显示,在这一过程中,手机端使用 GPU 后,相比不使用 GPU 的运行速度提升约 2.4 倍。也就是说,iPhone 并不是单纯作为存储或中转设备,而是真正承担了部分神经网络计算。对于本地 AI 用户而言,这一思路的价值在于:在不更换高内存工作站的情况下,尝试把身边已有的移动设备纳入推理链路。

此外,整套方案还利用了 iPhone 的神经网络引擎。开发者会把每 16K 长度的旧上下文编译为一套神经网络引擎模型。在 140K 上下文长度下,相比仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒缩短至 176 毫秒。这说明,GPU 与神经网络引擎的混合调度,可能会成为移动芯片参与本地 AI 推理的重要方向。

实测提升集中在预填充,长上下文收益更明显

以“预填充并保存一份 2000 token 文件会话”为例,来源给出了不同上下文窗口下的表现:

  • 8K 上下文:仅靠 Mac 本机为每秒 132 个 token,外接 iPhone 后达到每秒 177 个 token,提升 35%。
  • 16K 上下文:速度从每秒 109 个 token 提升至每秒 157 个 token,增幅最高达到 44%。
  • 32K 上下文:速度从每秒 101 个 token 提升至每秒 130 个 token,改善 29%。

这些结果表明,该方案的优势主要体现在预填充阶段,也就是模型读取和处理已有上下文的过程。对于长文档问答、代码仓库分析、知识库会话恢复等场景,预填充速度会直接影响用户等待时间。如果能够把已有上下文更快送入模型,交互体验就会更接近“即时可用”。

影响与解读:个人设备集群化,可能成为本地 AI 新思路

这项实验最值得关注的地方,并不只是 44% 的数字,而是它展示了一种趋势:个人用户手中的 Mac、iPhone 等设备,未来可能不再是彼此独立的计算终端,而是可以被组合成一个小型异构 AI 计算环境。Mac 负责主流程与部分层计算,iPhone 负责后段层或特定上下文处理,移动芯片中的 GPU、神经网络引擎也被纳入调度。

不过,来源也提到,这套方案并不完美。开发者指出,在 64K 以内的场景,手机并不会加速文本生成,生成工作依旧全部由 Mac 完成。这意味着它目前更像是针对预填充瓶颈的专项优化,而不是全面提升大模型推理速度的通用方案。对普通用户来说,部署门槛、稳定性、功耗、发热和数据传输效率,也都可能影响实际体验。

从产业角度看,苹果设备的统一内存架构、移动端高性能 SoC、神经网络引擎以及 USB-C 连接能力,为这类实验提供了基础。来源还提到,未来用于 iPhone 18 Pro 和 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大性能余量,并可能配备双 16 核神经网络引擎;据称,在专门适配神经网络处理器的任务中,其吞吐能力甚至可能超过芯片内置的 7 核 GPU。

对于中文 AI 开发者和本地模型玩家来说,backburner 的意义在于提供了一个可验证方向:边缘设备协同推理或许能缓解单台电脑内存不足的问题。虽然它距离成熟产品还有距离,但随着手机芯片 AI 算力持续增强,未来“把手机接到电脑上帮忙跑模型”可能不再只是极客实验,而会成为个人 AI 工作流中的一种新型扩展方式。