跳转到主要内容

Nvidia发布Nemotron-Nano-9B-v2,搭载可切换AI推理功能

Nvidia新款小型语言模型主打高效与灵活

Nvidia正式推出Nemotron-Nano-9B-v2,这是一款旨在提供强大AI能力同时保持高效部署需求的新型小型语言模型。该模型拥有9亿参数(较前代12亿有所减少),经过优化可在单块Nvidia A10 GPU上流畅运行。

Image

混合架构提升性能

据Nvidia人工智能模型后训练总监Oleksii Kuchiaev介绍,参数缩减是为了更好地适应实际部署需求。该模型采用混合架构,据称处理大批量数据的速度比同规模传统Transformer模型快六倍。

多语言支持与独特推理功能

该模型支持包括英语、德语、西班牙语、法语、意大利语和日语在内的多种语言,适用于以下多样化应用场景:

  • 指令跟随
  • 代码生成
  • 多语言内容创作

其突出创新之一是可切换推理功能,允许用户控制AI是否在给出答案前展示其“思考过程”。开发者可通过简单命令如/think或/no_think来切换此功能。

Image

‘思考预算’实现精准控制

Nvidia引入了新颖的“思考预算”机制,允许开发者为推理过程分配特定的token限额。此功能可在响应准确性与速度之间实现精确平衡——这对生产环境至关重要。

基准测试彰显实力

初步测试在多项基准中表现优异:

  • AIME25:展示高级推理能力
  • MATH500:展现数学问题解决能力
  • GPQA & LiveCodeBench:在编程相关任务中表现突出 该模型在指令跟随和长上下文评估中也优于同类开源小型模型。

开放许可消除商业壁垒

为推动开发者采用,Nvidia以开放许可协议发布Nemotron-Nano-9B-v2,该协议:

  • 允许免费商业使用和分发
  • 不声明对生成内容的所有权
  • 无需额外谈判或费用 此举使企业能立即将模型集成到生产系统中。

此次发布体现了Nvidia持续投资于使强大AI工具更易获取,同时保持适合企业应用的性能标准。

关键点:

🚀 高效部署:针对单GPU运行优化,仅需9亿参数 🌐 多语言支持:支持六种主要语言及代码应用 ⚙️ 可定制推理:带token预算控制的可切换思考过程 📜 开放许可:无商业使用或输出所有权限制