人工智能

英伟达开源 Nemotron 3 Embed:8B 模型登顶 RTEB,面向智能体与 RAG 检索场景

2026年7月18日 · admin
openmagic ad

据 IT之家 7 月 18 日消息,英伟达于 7 月 17 日发布博文,宣布以开放权重形式推出 Nemotron 3 Embed 系列嵌入模型。该系列主要面向 AI 智能体与检索增强生成(RAG)应用,支持商业使用,并已通过 Hugging Face 与 NVIDIA NIM 免费提供。来源显示,Nemotron 3 Embed 配备 32K 上下文窗口,重点提升高精度检索能力;其中 8B BF16 版本在 RTEB 检索嵌入基准中取得 78.5% 的成绩并位列第一,同时在 MMTEB 检索测试中得分 75.5%。

面向 RAG 与智能体的嵌入模型组合

与用于对话生成的大语言模型不同,嵌入模型更常被用于把文本、问题或文档转换为可检索的向量表示,是企业知识库、智能客服、代码检索、搜索增强问答以及 Agent 工具调用流程中的基础组件。英伟达此次发布 Nemotron 3 Embed,核心目标并不是直接生成答案,而是提高系统在复杂语义环境下“找对资料”的能力。

来源显示,该系列支持 32K 上下文窗口,可在更长输入范围内执行检索任务。英伟达称,这一设计有助于减少 AI 智能体的重复检索,降低不必要的推理触发频率,并显著减少 Token 消耗。对部署 RAG 系统的企业来说,检索阶段越准确,后续大模型生成阶段越可能基于正确上下文回答,从而降低幻觉、重复调用和成本浪费。

三种版本覆盖精度、成本与硬件优化需求

英伟达此次同步公开了面向不同部署环境的微调和蒸馏版本,覆盖高精度、低时延低成本,以及特定 GPU 架构优化等需求。具体来看,Nemotron 3 Embed 系列包括三个主要版本:

  • Nemotron-3-Embed-8B-BF16:系列最高规格版本,参数规模为 80 亿。英伟达称其适合精度要求较高、风险较高的企业业务场景,基于 Ministral-3-8B-Instruct-2512 构建。
  • Nemotron-3-Embed-1B-BF16:高效率版本,参数规模为 11.4 亿。NVIDIA 表示该模型适合更重视时延与成本的部署环境,由基于 Ministral-3-3B-Instruct-2512 的父模型蒸馏得到。
  • Nemotron-3-Embed-1B-NVFP4:在高效率版本基础上面向 Blackwell 架构 GPU 优化。来源称,借助 NVFP4,该版本在保持相同检索精度的同时,可进一步降低内存占用,并将吞吐量最高提升至 2 倍。

这种分层发布方式也反映出当前企业 AI 落地的现实需求:并非所有场景都需要最大模型。金融、医疗、法律等高风险知识检索可能更看重准确率,而普通企业知识库、内部搜索或高并发问答系统则更关注推理成本、响应速度和硬件利用率。

RTEB 登顶背后的产业意义

性能方面,8B BF16 版本在 RTEB 跑分中获得 78.5% 的成绩并斩获第一。RTEB 即 Retrieval Embedding Benchmark,是由 Hugging Face 团队及 MTEB 社区推出的检索与嵌入模型评估标准,面向 RAG 系统、智能体等真实应用中的检索质量评估。相较只看通用语义相似度的测试,RTEB 更贴近“模型能否在实际任务中找准信息”的需求。

对中文读者和开发者而言,Nemotron 3 Embed 的看点不只在榜单成绩,还在于英伟达正在把模型、推理服务、GPU 架构优化与企业 AI 工作流进一步打通。开放权重与商业可用降低了试用门槛,而 NIM 的提供方式则方便企业将模型纳入现有推理和部署体系。

从产业趋势看,AI 智能体的发展正在把瓶颈从“能不能生成内容”转向“能不能稳定调用工具、检索知识并完成任务”。在这一链条中,嵌入模型是成本和准确率的关键环节。Nemotron 3 Embed 系列的发布,意味着英伟达正试图在生成模型之外,继续强化其在 RAG 基础设施与企业级 Agent 技术栈中的影响力。