跳转到主要内容

NVIDIA的Nemotron-3 Embed 8B模型登顶检索基准

NVIDIA悄然推出了Nemotron-3 Embed系列,这是一系列新的嵌入模型,旨在支持生产级检索增强生成(RAG)、智能问答、代码检索和智能体记忆。其中的8B版本已经在RTEB检索基准测试中夺得第一,成为同类中最强大的开源模型。

三种版本,一个目标

该系列包含三个开放检查点:高精度的Nemotron-3-Embed-8B-BF16、轻量级的Nemotron-3-Embed-1B-BF16,以及针对NVIDIA Blackwell架构优化的4位版本Nemotron-3-Embed-1B-NVFP4。三者均为具有双向注意力掩码的Transformer编码器,支持每序列最多32,768个令牌和34种语言。它们基于OpenMDW-1.1许可证发布。

有趣的是,所有基础模型都基于Mistral架构。8B版本源自Ministral-3-8B-Instruct-2512,而两个1B变体则来自Ministral-3-3B-Instruct-2512。

基准测试领先

在RTEB基准测试的16个公开任务中,8B-BF16版本的平均NDCG@10得分为78.46,位居第一。1B-BF16版本得分为72.38,比之前的基线llama-nemotron-embed-vl-1b-v2提高了10.4个百分点。而NVFP4版本相比其BF16兄弟版本仅损失了0.38分,保留了99.5%的精度,同时在Blackwell硬件上吞吐量翻倍。

1B模型的构建方法

团队没有从头训练一个小模型,而是采用了压缩方法。他们从3B基础模型开始,使用NVIDIA ModelOpt的神经架构搜索将其剪枝到2B,然后通过余弦距离和均方误差损失从微调后的8B教师模型中蒸馏知识。结果是一个1.14B参数的模型,性能超出预期。NVFP4版本经历了量化感知蒸馏,使用512个样本进行校准,并在20,000个样本上进行训练以恢复精度,特别是对于长输入。

Image

部署简便

每个版本都有各自的部署方案。8B和1B BF16模型适用于Transformers和Sentence Transformers框架,而1B-NVFP4仅支持vLLM 0.25.0 /v2/embed接口。硬件方面,NVFP4版本可在Ampere、Hopper、Lovelace和Blackwell上运行,而BF16版本则针对Ampere、Hopper和Blackwell。NVIDIA还发布了针对1B模型优化的NIM微服务,基于Rust构建,在GB200和RTX PRO6000上匹配或超越vLLM检查点。

实际应用

该系列在多语言企业搜索(跨语言检索)、代码检索(训练数据包含SWE-bench等代码数据集)和智能体记忆(32K令牌上下文用于更长的对话摘要)方面表现出色。对于成本敏感的场景,NVIDIA建议采用分层RAG策略:使用1B-NVFP4进行高容量召回,使用8B处理困难查询。

Image

快速上手

NVIDIA提供了完整的代码示例,用于使用Sentence Transformers进行本地推理和使用vLLM进行服务器端部署。查询和文档通过query:passage:前缀区分,经过L2归一化后,嵌入向量的点积等于余弦相似度。

关键点

  • Nemotron-3 Embed系列 包含8B、1B BF16和1B NVFP4版本
  • 8B模型登顶RTEB基准,平均NDCG@10为78.46
  • 1B模型采用压缩技术,从3B基础模型通过剪枝和蒸馏得到
  • NVFP4版本保留99.5%精度,同时在Blackwell上吞吐量翻倍
  • 支持34种语言和最多32K令牌上下文
  • 基于OpenMDW-1.1许可证开源