人工智能

亚马逊开源 Strands Decider 2B:面向本地部署的轻量决策模型

2026年10月4日 · admin
OpenMagic API

据 IT之家 10 月 3 日消息,Amazon(亚马逊)Strands Agents 团队当地时间本月 1 日宣布推出 Strands Decider 2B 决策模型。来源显示,该模型已在 GitHub 上开源,模型权重可在 Hugging Face 获取,并支持在本地 CPU 或 GPU 环境中运行。与常见以文本生成为核心能力的语言模型不同,Strands Decider 2B 更聚焦“决策”场景:它用于对候选动作或选项进行评估与选择,为智能体工作流中的下一步执行提供判断依据。

从生成模型到决策模型:Strands Decider 2B 的结构变化

从模型设计看,Strands Decider 2B 基于预训练的 Qwen3.5-2B“躯干”构建,但亚马逊团队并未沿用原本负责文本生成的语言模型“头部”。来源摘要显示,团队将其替换为一个具备评分能力的指针“头部”,用于面向决策任务输出评分或选择结果。

这一变化意味着,Strands Decider 2B 并不是要成为一个通用聊天模型,而是更像智能体系统中的“裁判”或“路由器”。在实际应用中,智能体往往需要在多个工具、多个步骤或多个候选方案之间做选择。传统做法可能直接让大模型生成自然语言推理过程,再解析出动作;而决策模型则试图把这类选择过程做得更轻、更快、更可控。

来源显示,新“头部”规模较小,总参数仅略超过一百万;作为主体的“躯干”则通过一个 rank-16 LoRA 适配器进行微调。对开发者来说,这类设计的价值在于:在保留预训练模型表征能力的同时,尽量降低针对决策任务的额外参数成本,也为后续定制化微调留下空间。

  • 开源方式:代码已在 GitHub 开源,权重可在 Hugging Face 获取。
  • 运行环境:支持本地 CPU / GPU 推理,便于在私有环境中集成。
  • 模型基础:采用 Qwen3.5-2B 预训练“躯干”,并替换为评分型指针“头部”。
  • 适配方式:“躯干”通过 rank-16 LoRA 适配器微调。

性能表现:强调低时延与可校准的决策能力

根据来源信息,Strands Decider 2B 在 JevBench 公开数据集上取得了不错的准确率和校准度表现。在 2B 级别模型中,其排名第 3,并且优于所有严格不超过 2B 参数规模的竞争对手。这里的“校准度”对于决策模型尤其重要:如果一个模型不仅能给出选择,还能让评分与实际可靠性更匹配,那么它在自动化系统中的风险控制价值会更高。

在本地运行方面,来源显示,Strands Decider 2B 在市面常见硬件上交出了 113ms 的决策时延中位数;在 NVIDIA GeForce RTX 3090 上执行小型决策任务时,中位数时延为 153ms。对于智能体应用而言,决策步骤往往会在一次任务中多次发生,因此单次决策时延会直接影响整体交互体验与自动化流程效率。

影响解读:智能体系统正在走向“模块化分工”

Strands Decider 2B 的发布反映出一个值得关注的方向:AI 应用并不总是需要一个更大的通用模型包办所有任务。随着智能体框架、工具调用和自动化流程的发展,系统内部可能会拆分出规划、检索、执行、验证、决策等不同模块,各模块使用更合适的模型来完成特定职责。

在这一思路下,大模型可以继续承担复杂理解与生成任务,而类似 Strands Decider 2B 的轻量决策模型,则可以负责更高频、结构化、低延迟的判断环节。对于企业和开发者来说,本地部署也带来两方面潜在优势:一是降低对远程推理服务的依赖,二是便于在涉及内部数据、工具权限和自动化流程时进行更细粒度的控制。

当然,Strands Decider 2B 的实际价值仍取决于具体场景。公开基准上的表现并不等同于所有业务环境中的稳定收益,开发者仍需要结合自身任务分布、候选动作设计和失败处理机制进行测试。但从产业趋势看,面向智能体的专用小模型正在成为开源生态中的重要分支。亚马逊此次开源的 Strands Decider 2B,为本地化智能体决策组件提供了一个新的可选方案。