发生了什么
英伟达于8月11日发布两款新工具:面向长时间运行智能体工作负载的30B参数混合专家开源模型Nemotron 3.5 Lightning,以及开源模型路由库NeMo Switchyard。前者定位为多智能体系统中的专用任务执行模型,可运行于RTX PC、DGX Spark、工作站、数据中心与云端;后者允许企业按自身需求构建路由器,在自有模型、专有模型与英伟达模型之间自动分配请求,无需改写现有应用。
关键性能与特性
- Nemotron 3.5 Lightning输出速度最高提升4倍,智能体任务完成速度较同类模型快约30%
- 模型完全开放可定制,可通过英伟达NeMo在自有领域数据上进行后训练
- NeMo Switchyard据内部基准可在保持前沿精度的同时,将任务完成成本降至单一Opus 4.8方案的近三分之一
- 已有多家合作伙伴采用:CrowdStrike用于网络安全、Harvey用于法律服务、CodeRabbit用于代码审查,LangChain评测显示路由方案可降低74%成本
为何重要
随着AI应用从聊天机器人转向常驻智能体,"模型组合"架构正在成为主流:由强推理模型负责规划,轻量专用模型执行具体任务。Nemotron 3.5 Lightning与NeMo Switchyard的组合,让企业能够在本地与云端灵活部署开源模型,并在质量、时延与成本之间按需权衡,对希望控制数据隐私与推理成本的企业用户具有直接价值。
不确定性
路由性能数据主要来自英伟达内部基准及合作方评测,尚需更多独立验证。此外,智能体场景下的模型路由仍属较新领域,路由策略的稳定性与安全边界有待在实际生产环境中进一步检验。

