阿里开源 Qwen3.8-Flash-Next:125B MoE、多模态与 1M 上下文成 Qwen4 雏形
据 IT之家 8 月 26 日消息,阿里通义千问团队正式发布 Qwen3.8-Flash,并同步开源 Qwen3.8-Flash-Next 权重。来源显示,Qwen3.8-Flash-Next 被视为下一代 Qwen4 系列模型架构的雏形,是一款多模态 MoE 模型:主模型参数规模为 125B,额外配备 51B 参数的 N-gram Embedding,每个 token 激活约 6B 参数。该模型原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens,面向长文本、多模态理解、代码与办公等场景进行系统升级。
新架构:围绕长上下文、残差、Embedding 与优化器升级
从技术路线看,Qwen3.8-Flash-Next 并不是单纯扩大参数量,而是尝试在计算效率与模型容量之间重新做平衡。其 Attention 部分采用 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)的混合架构:前者用于高效压缩历史信息,后者通过轻量级 Indexer 在 micro-block 粒度上筛选更重要的上下文,从而降低长序列 Attention 的计算开销。
来源显示,在面对 1M token 超长上下文时,QSA 的 Attention Kernel 在 Prefill 与 Decode 阶段分别可实现最高 7.6 倍和 4.9 倍加速。这意味着在长文档分析、代码仓库理解、会议记录处理等任务中,模型不只是“能放下更多内容”,还尝试解决超长上下文推理时成本和延迟快速上升的问题。
在 Residual 设计上,新模型引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,并通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,有助于降低访存开销。Embedding 方面,模型加入 51B 参数的 N-gram Embedding,通过局部上下文查表扩展容量;这些参数可卸载到 Host Memory,并借助异步 Prefetch 与模型计算重叠,以避免长期占用 GPU 显存。
- 参数形态:125B 主模型参数,另有 51B N-gram Embedding。
- 激活规模:每 token 激活约 6B 参数,体现 MoE 架构的稀疏计算思路。
- 上下文能力:原生 262,144 tokens,可通过 YaRN 扩展至 1M tokens。
- 开源形式:权重已在 Hugging Face 与 ModelScope 开源,并同步提供 FP8 量化版本。
性能与成本:训练成本降至前代约九分之一
阿里通义团队称,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本约为前者的九分之一,但在编码和办公任务上具备更强能力。对于大模型产业而言,这一信息点值得关注:在模型参数规模持续增长之后,行业竞争正从“堆算力”转向架构效率、训练优化和推理成本的综合比拼。
来源摘要提到,Qwen3.8-Flash-Next-Base 在 6B 激活参数条件下,于 14 个 benchmark 中的 8 个取得最优结果,覆盖 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU 等测试。这些 benchmark 分别涉及通用知识、复杂推理、代码相关任务、数学和多模态理解等方向,说明该模型并非只针对单一能力进行调优,而是在多任务能力上寻求均衡提升。
优化方面,模型采用 Muon Optimizer,并针对正交化精度、参数分工和融合矩阵拆分等策略进行调整。通义团队还针对新架构重新拟合 Scaling Law,这表明 Qwen3.8-Flash-Next 更像是一套面向后续模型迭代的架构验证,而不仅是一次常规版本更新。
影响解读:开源大模型竞争进入“高效率长上下文”阶段
从中文 AI 生态角度看,Qwen3.8-Flash-Next 的开源有几层意义。首先,1M 级上下文能力对企业知识库、代码助手、合同审阅、科研文献分析等应用有直接价值。过去很多长文档任务需要切片、检索增强或多轮摘要,现在模型若能以更低成本处理更长上下文,将改变上层应用的产品设计方式。
其次,MoE 与 N-gram Embedding 的组合,体现出一种“少激活、多容量”的工程路线。模型总容量较大,但每 token 激活规模控制在 6B,有利于在推理阶段降低单位请求成本。对于开发者而言,FP8 量化版本和开源权重的同步发布,也降低了评测、微调和部署实验的门槛。
商业化方面,来源显示 Qwen3.8-Flash 即将上线千问 AI 平台并提供 API 服务,定价为每百万 tokens 输入 1 元、输出 3 元。若这一价格与长上下文能力结合,将进一步加剧国内模型 API 市场在低价、高吞吐、长上下文方向的竞争。
总体来看,Qwen3.8-Flash-Next 的重点不只是“125B 参数”或“开源”,而是通过 Attention、残差、Embedding 与优化器的一系列设计,展示下一代 Qwen 架构如何在多模态、长上下文和成本效率之间取舍。对于关注模型工具和企业 AI 落地的开发者来说,这将是近期值得重点评测的国产开源模型之一。