1. NVIDIA Agent Toolkits 简介

NVIDIA Agent Toolkit 是 NVIDIA 于 2026 年 3 月 16 日在 GTC 2026 上正式发布的一套开源企业级 AI Agent 开发平台。它并非单一产品,而是一个覆盖开发、编排、安全、部署全生命周期的模块化软件栈,旨在解决企业从 Agent 原型到生产级自主系统之间的基础设施鸿沟。


一、核心架构与组件

Agent Toolkit 由四个互补层级构成,每一层解决企业部署 Agent 时的特定痛点:

1. OpenShell — 安全运行时

OpenShell 是一个开源的安全沙箱运行时,为每个 Agent 提供进程级隔离环境。其核心能力包括:

  • 策略驱动的安全控制:基于策略的网络访问控制、隐私护栏和数据边界管理。
  • 最小权限模型:Agent 仅获得完成任务所需的最小权限。
  • 隐私路由器(Privacy Router):在数据传入 LLM 前自动过滤敏感信息(PII)。
  • 完整审计追踪:记录每个 Agent 的每一步操作,满足合规要求。

安全合作伙伴包括 Cisco、CrowdStrike、Google Security、Microsoft Security 和 TrendAI,从底层将安全控制嵌入 Agent 架构,而非事后 bolt-on。

2. NemoClaw — 企业编排与治理层

NemoClaw 是构建在 OpenShell 之上的企业级 Agent 编排层,提供:

  • 多 Agent 协调:支持多个专业 Agent 并行协作处理复杂任务。
  • 状态管理:跨多步工作流跟踪 Agent 状态。
  • 错误恢复:内置故障处理机制,确保 Agent 在出错时优雅降级。
  • 可观测性:提供全面的日志、监控和可解释性仪表板。

3. AI-Q Blueprint — 智能研究 Agent 蓝图

AI-Q 是一个开源的 Agentic 搜索参考架构,专为复杂多步研究任务设计:

  • 混合架构:由前沿大模型(如 GPT-4、Claude)负责高层编排与推理,NVIDIA 自研的 Nemotron 开源模型负责检索与分析。
  • 成本优化:NVIDIA 声称该混合架构可将查询成本降低 50% 以上,同时保持顶级准确率。
  • 基准表现:截至发布时,AI-Q 在 DeepResearch Bench 和 DeepResearch Bench II 两个权威榜单上均排名第一。

4. Nemotron — 开源模型家族

Nemotron 是 NVIDIA 专为 Agentic 推理优化的开源权重模型家族,2026 年 GTC 上发布了 Nemotron 3:

  • Nemotron 3 Super:已立即开放使用。
  • Nemotron Ultra / Omni / VoiceChat:后续即将推出的变体。
  • 超长上下文:Nemotron 3 支持 100 万 token 的上下文窗口(厂商声明),适用于需要跨长任务链累积上下文的 Agent 工作流。

5. cuOpt — GPU 加速优化库

cuOpt 是一个开源的 Agent 可调用技能库,提供 GPU 加速的组合优化算法:

  • 物流路径优化(供应链、配送、现场服务)。
  • 资源规划(团队分配、机器调度、云容量)。
  • 工作流调度:最大化 Agent 管道的吞吐量。

二、企业合作伙伴生态

NVIDIA 在发布时即宣布了 17 家大型企业合作伙伴,覆盖 ERP、CRM、安全、创意软件、半导体设计等领域:

合作伙伴 集成方向 预计可用时间
SAP Joule Studio + NeMo,在 S/4HANA 生态中微调领域专用模型 2026 Q3
Salesforce Agentforce + NIM,为 Sales/Service Cloud 提供模型无关的推理后端 2026 Q3
CrowdStrike Falcon 安全 Agent,自动化威胁检测与事件响应 2026 Q2(已 GA)
ServiceNow 自主工作流自动化 2027
Adobe、Atlassian、Siemens、Cadence、Synopsys 各垂直领域深度集成 2026-2027

这一策略将 NVIDIA 定位为企业 AI Agent 的中间件层,而非单纯的硬件供应商。


三、与现有开发框架的集成

Agent Toolkit 的设计目标是补充而非替代现有 Agent 框架。如果你已经在使用 LangChain、LlamaIndex 或 CrewAI,可以通过适配器模式直接接入 OpenShell 的运行时和策略层,无需重写 Agent 逻辑。

示例代码模式:

from nvidia_agent_toolkit import OpenShellRuntime
from nvidia_agent_toolkit.integrations import LangChainAdapter

runtime = OpenShellRuntime(sandbox_mode="standard")
secured_agent = LangChainAdapter(
    agent=existing_langchain_agent,
    runtime=runtime,
    policy=EnterprisePolicy(pii_detection=True),
)

四、垂直领域扩展

1. 物理 AI:Omniverse 库集成

SIGGRAPH 2026 上,NVIDIA 宣布 Agent Toolkit 集成 Omniverse 库,使 AI Agent 具备物理 AI 能力:

  • ovrtx:RTX 传感器模拟。
  • ovphysx:GPU 加速物理引擎。
  • CAD 到 SimReady 转换:自动将 CAD 数据转换为仿真就绪资产。
  • SimReady Blender 蓝图:开源的 Blender 集成方案。

这些库以独立的 C API(带 C++/Python 绑定)形式发布,无需完整 Omniverse 平台即可调用,使编码 Agent 能够自主检查场景、标记问题、准备资产并运行仿真。

2. 生命科学:BioNeMo Agent Toolkit

BIO 2026(2026 年 6 月 23 日)上,NVIDIA 发布了 BioNeMo Agent Toolkit,一套开源的 Agent 可调用生命科学技能库:

  • 能力范围:蛋白质折叠、分子对接、生成化学、基因组分析、蛋白质设计、生物标志物发现。
  • 性能基准:在 NVIDIA 的测试中,未配备这些技能的 Agent 仅完成 57.1% 的科学任务,而配备后达到 100%
  • Agent 无关:支持 Claude、Codex 等任何 Agent 运行时。Anthropic 已将其直接集成到 Claude Science 中。
  • 许可:代码以 CC BY 4.0 开源,NIM 托管端点免费用于原型(约 40 RPM)。

五、部署选项与性能

Agent Toolkit 针对 NVIDIA 硬件进行了协同优化,但也支持任意基础设施:

  • 云端:预优化的 AWS、Azure、GCP 连接器。
  • 本地数据中心:适用于安全敏感场景。
  • 边缘:支持 NVIDIA Jetson,用于 IoT 和机器人。

在 NVIDIA 的基准测试中,基于 DGX 系统 + Vera CPU 的 Agent 集群,吞吐量比标准 x86 基础设施高出 3.2 倍,主要得益于上下文组装和工具结果编组延迟的降低。


六、定价与许可模式

层级 费用 说明
开源代码 免费 GitHub 开源,CC BY 4.0 许可
NIM 托管端点 免费(原型) build.nvidia.com,约 40 RPM 限速,无 SLA
生产部署 付费 NVIDIA AI Enterprise 许可证,提供 90 天免费试用
自托管 NIM 需 GPU 节点 仅在本地运行 NIM 时需要 GPU

七、战略意义

NVIDIA Agent Toolkit 标志着 NVIDIA 从"GPU 制造商"向"完整 AI 软件平台公司"的战略转型。Jensen Huang 将其角色比喻为 AI 时代的 “收费站”(tollbooth)——无论企业使用哪种模型、哪种应用,只要训练和运行 Agent,就可能在 NVIDIA 的基础设施层产生价值。

对于 CIO 而言,这意味着 2026 年已不再是观望期:SAP S/4HANA 和 Salesforce 环境的 Agent 试点预算窗口已在 2026 年 Q3 打开,而 Agent 架构的锁定效应将主要体现在编排层而非模型层——选择在 SAP-NVIDIA 或 Salesforce-NVIDIA 基础上构建 Agent,即意味着进入相应的生态合约。

2. 开源程度介绍以及第三方算力公司接入方式

以下从 开源内容/开源程度第三方硬件算力公司接入方式 两个维度,对 NVIDIA Agent Toolkit 进行系统性说明。


一、开源内容与开源程度

1.1 许可证体系

NVIDIA Agent Toolkit 采用分层许可证策略,整体偏向宽松:

资产类型 许可证 关键权利
代码 Apache License 2.0 商业使用、修改、分发、专利保护
文档/Skills CC BY 4.0 或双许可 可自由引用、修改,需署名
模型权重 NVIDIA Open Model License (OML) 允许商业使用、微调、再分发;禁止对 NVIDIA 提起专利诉讼

1.2 开源仓库全景

所有核心组件均在 GitHub 公开维护,截至 2026 年 8 月的主要仓库包括:

仓库 功能定位 语言/技术 Stars (约)
NVIDIA/NeMo-Agent-Toolkit 核心 Agent 构建工具包 Python/TypeScript
NVIDIA/OpenShell 安全沙箱运行时(网关、策略引擎、Privacy Router) Rust (~90%) 7.8K+
NVIDIA/NemoClaw 企业级 Agent 参考栈(Hermes、OpenClaw、Deep Agents 的运行时) Python 22.1K+
NVIDIA-AI-Blueprints/aiq AI-Q 智能研究 Agent 蓝图 Python
NVIDIA/NeMo-Agent-Toolkit-UI 前端 Web UI TypeScript/Next.js
NVIDIA/NeMo-Agent-Toolkit-Examples 社区示例与教程 Python
NVIDIA/skills Agent Skills 目录(cuOpt、Omniverse、RAG 等) 多语言
NVIDIA/OpenShell-Community 社区沙箱镜像与配置 Docker/YAML

1.3 开源程度评估

高度开源的方面:

  • 代码完全开放:OpenShell 约 90% 为 Rust 代码,NemoClaw 为 Python,均可自由 fork、修改、提交 PR。
  • 社区活跃:OpenShell 在 2026 年 2 月创建仓库后,截至 6 月已有 66 位贡献者、53 个 release、842 个 fork,保持近每日发布的节奏。
  • 模型权重开放:Nemotron 3 系列(Nano、Super、Ultra、Embed 等)均在 Hugging Face 和 ModelScope 提供完整权重下载,包括 BF16 和 NVFP4 量化版本。
  • 第三方集成友好:官方明确支持与 LangChain、LlamaIndex、CrewAI 等现有开源框架集成,无需重写 Agent 逻辑。

存在商业限制的方面:

  • NIM 微服务:自托管 NVIDIA NIM 推理微服务需要 NVIDIA GPU 硬件,且生产部署需购买 NVIDIA AI Enterprise 许可证。
  • 免费托管端点:build.nvidia.com 提供免费 NIM 端点,但限制约 40 RPM、无 SLA,仅适合原型验证。
  • 硬件优化锁定:cuOpt、TensorRT-LLM、NVFP4 量化格式等核心加速技术仅针对 NVIDIA CUDA/Blackwell 架构优化。

二、第三方硬件算力公司接入生态的方式

NVIDIA Agent Toolkit 的架构设计有一个关键特性:Agent 运行时(OpenShell)与推理后端解耦。这意味着第三方硬件公司不需要修改 OpenShell 内核,只需提供兼容的推理服务端点即可接入。

2.1 架构解耦原理

OpenShell 通过两条路径处理推理流量:

路径 机制 第三方硬件适用性
inference.local 沙箱内代码调用此内部端点,OpenShell 网关的 Privacy Router 拦截请求,注入真实凭证后转发到配置的 Provider 核心接入点 — 可指向任何外部推理服务
外部端点 沙箱内代码直接访问外部 API,受 network_policies 管控 适用于云 API 或局域网内的第三方推理服务

2.2 按硬件平台的接入路径

A. AMD GPU(ROCm 生态)

可行路径:Ollama / vLLM + compatible-endpoint

  1. Ollama 路径:Ollama 原生支持 AMD GPU(通过 ROCm v7 on Linux / HIP7 on Windows)。在 AMD 主机上安装 Ollama 并加载模型后,通过以下命令将其注册为 OpenShell 的推理后端:
openshell provider create \
    --name ollama-amd \
    --type openai \
    --credential OPENAI_API_KEY=ollama \
    --config OPENAI_BASE_URL=http://host.openshell.internal:11434/v1

openshell inference set --provider ollama-amd --model llama3.2
  1. vLLM 路径:vLLM 从 0.6.6+ 开始支持 AMD ROCm 6.3+。在 AMD GPU 节点启动 vLLM 服务后,同样通过 compatible-endpoint 接入。

实际验证案例:GitHub Issue 显示,开发者在 AMD Ryzen AI 9 HX 370(Radeon 890M iGPU,32GB 共享显存)上成功运行 NemoClaw + Ollama,通过 compatible-endpoint 完成推理。

注意事项

  • NemoClaw 官方安装程序默认检测 NVIDIA driver 550+ 和 CUDA 12.4+,在纯 AMD 环境需跳过 GPU 检测或手动配置。
  • GPU passthrough 到 sandbox pods 需要 NVIDIA Container Toolkit,AMD 环境无法使用此特性,但 CPU 沙箱 + 外部 AMD 推理服务完全可行。
B. Intel XPU / GPU

可行路径:vLLM / GPTQModel + compatible-endpoint

  • vLLM 已添加 Intel XPU 后端支持,可在 Intel Data Center GPU Flex 系列或 Arc 显卡上运行。
  • GPTQModel 等量化工具也已支持 Intel XPU。
  • 通过自托管 Intel 推理服务,以 OpenAI-compatible API 形式暴露端点,再用 compatible-endpoint 接入 OpenShell。

限制:无原生 Intel GPU 加速的 Nemotron 权重格式,需通过 vLLM 的通用路径加载。

C. Apple Silicon(M1/M2/M3/M4/M5)

官方支持状态:OpenShell 明确支持 macOS Apple Silicon (arm64) via Docker Desktop。

  • 网关与沙箱:可完整运行 OpenShell 网关、策略引擎和沙箱隔离。
  • 推理路径:由于 Apple Silicon 无 NVIDIA GPU,本地推理需通过:
    1. 云端 NIM:使用 NVIDIA Cloud 端点(自动配置)。
    2. 本地 Ollama CPU 模式:Ollama 在 Apple Silicon 上运行,但受限于内存和 CPU 性能。
    3. 外部推理服务:通过 network_policies 允许访问局域网或远程 GPU 节点。

实际案例:M5 Max MacBook Pro 上成功运行 NemoClaw,安全模型和策略完全生效,使用 NVIDIA Cloud NIM 进行推理。

已知问题:本地 Ollama 在 macOS 上存在 inference.local DNS 解析 bug,需手动配置 /etc/hosts 或使用 host 网络模式。

D. 华为昇腾(Ascend NPU)

社区路径:vLLM-Ascend + compatible-endpoint

  • vLLM-Ascend:社区项目正在添加 Nemotron 3 Super 的昇腾支持,通过 CANN 后端实现。
  • GPTQModel:已官方添加 Huawei Ascend NPU 支持,可用于模型量化与推理。
  • 接入方式:在昇腾节点部署 vLLM-Ascend 或 MindIE 推理服务,暴露 OpenAI-compatible API,通过 compatible-endpoint 接入 OpenShell。

限制

  • Nemotron 3 的 NVFP4 量化格式仅 NVIDIA Blackwell 原生支持,昇腾需使用 BF16 或 FP16 版本。
  • 无官方 NVIDIA 优化,性能取决于社区适配成熟度。
E. 纯 CPU / 云 API / 任意算力

最通用的接入方式

OpenShell 本身可在 纯 CPU 节点 运行,不依赖任何 GPU。通过 network_policies 允许沙箱访问外部推理端点:

# policy.yaml
network:
  allowed_egress:
    - host: "your-inference-cluster.internal"
      port: 8000
    - host: "api.openai.com"
      port: 443

这意味着:

  • 云端 GPU 集群(如 AWS Inferentia、Google TPU、Intel Gaudi)可通过标准 REST API 接入。
  • 自研 ASIC(如 Google TPU、Amazon Trainium)只需实现 OpenAI-compatible API 即可被 OpenShell 调用。
  • CPU 推理(如 llama.cpp、Ollama CPU 模式)完全支持。

2.3 第三方硬件接入的核心限制

尽管架构上支持解耦,但以下能力严格绑定 NVIDIA 硬件

能力 绑定原因 第三方硬件替代方案
cuOpt Agent Skills GPU 加速的组合优化库,CUDA 专用 使用纯 CPU 求解器(如 OR-Tools)或自研技能
TensorRT-LLM 推理 NVIDIA 专有推理引擎 使用 vLLM、SGLang、llama.cpp 等跨平台引擎
NVFP4/MXFP4 量化 仅 Blackwell 架构原生支持 使用 BF16/FP16/INT8 格式,或 GGUF/Q4_K_M
NIM 微服务 仅支持 NVIDIA GPU 使用自托管 vLLM/Ollama 替代
GPU Passthrough 到沙箱 需要 NVIDIA Container Toolkit + CDI 使用 CPU 沙箱 + 外部推理服务

2.4 对第三方硬件厂商的建议接入策略

如果你是 AMD、Intel、华为昇腾、Google TPU 等硬件厂商,或基于这些硬件的云服务商,建议按以下优先级接入:

  1. 最低成本验证(PoC 阶段):

    • 在目标硬件上部署 OllamavLLM,加载 Nemotron 3 或 Llama 等开源模型。
    • 通过 compatible-endpoint 模式接入 NemoClaw/OpenShell,验证端到端 Agent 工作流。
  2. 性能优化(生产阶段):

    • 针对自家硬件优化 vLLM 后端(如 AMD ROCm、Intel XPU、华为 CANN)。
    • 提供预置的模型量化方案(如 GGUF、FP16、BF16),替代 NVFP4。
    • 与 NVIDIA 合作将硬件加入 NemoClaw 的 managed install 白名单(如 DGX Spark 的自动检测逻辑)。
  3. 生态深度集成(长期):

    • 为 OpenShell-Community 仓库贡献沙箱镜像(如 sandbox-amd-rocmsandbox-ascend)。
    • 在 NVIDIA/skills 仓库中提交针对自家硬件优化的 Agent Skills(如 amd-mi300-inferenceintel-xpu-embed)。

三、总结

维度 实际情况
开源程度 代码完全开源(Apache 2.0),模型权重开放(OML),社区活跃;但生产级 NIM 和硬件加速库有商业/硬件绑定。
第三方硬件接入可行性 。通过 inference.local + compatible-endpoint 架构,任何支持 OpenAI-compatible API 的推理后端均可接入。
接入最佳实践 AMD/Intel/昇腾/Apple Silicon 均已有验证路径;核心限制在于 NVIDIA 专有加速库(cuOpt、TensorRT-LLM、NVFP4),需用跨平台替代方案。
厂商策略建议 优先以 vLLM/Ollama 提供兼容端点,再逐步优化硬件原生后端,最后通过社区贡献实现深度生态集成。

NVIDIA Agent Toolkit 的设计哲学是 “Agent 运行时开放,推理后端可插拔”。这意味着第三方硬件厂商无需获得 NVIDIA 的授权或修改内核代码,只需提供标准的 OpenAI-compatible 推理服务,即可让 Agent 生态运行在自己的算力之上。

3. 开源网址汇总

以下是 NVIDIA Agent Toolkit 生态中所有主要开源项目的源代码网址汇总,按功能模块分类整理:


一、核心 Agent 构建工具包

项目名称 功能描述 源代码地址
NeMo Agent Toolkit 核心开源库,用于连接和优化 AI Agent 团队,支持多框架集成(LangChain、LlamaIndex、AutoGen、ADK 等) github.com/NVIDIA/NeMo-Agent-Toolkit
NeMo Agent Toolkit UI 官方 Web 前端界面,支持实时流式响应、人机协同工作流、明暗主题 github.com/NVIDIA/NeMo-Agent-Toolkit-UI
NeMo Agent Toolkit Examples 社区驱动的示例仓库,包含真实场景用例和教程 github.com/NVIDIA/NeMo-Agent-Toolkit-Examples

二、安全运行时与沙箱

项目名称 功能描述 源代码地址
OpenShell 安全沙箱运行时,提供进程隔离、Landlock/seccomp 策略执行、网络命名空间隔离、Privacy Router 推理路由 github.com/NVIDIA/OpenShell
OpenShell Community 社区维护的沙箱镜像和配置,包含基础沙箱定义 github.com/NVIDIA/OpenShell-Community

三、企业级 Agent 参考栈

项目名称 功能描述 源代码地址
NemoClaw 企业级参考栈,在 OpenShell 上运行 OpenClaw/Hermes/LangChain Deep Agents,提供引导式安装、托管推理、网络策略和生命周期管理 github.com/NVIDIA/NemoClaw
NemoClaw OpenShift 社区适配的 OpenShift 部署版本 github.com/rh-ai-quickstart/NemoClaw-OpenShift

四、Agent Skills 与蓝图

项目名称 功能描述 源代码地址
NVIDIA Skills 官方 Agent Skills 目录(cuOpt、Omniverse、RAG、CUDA、物理 AI 等),支持 Claude Code / Codex 插件安装 github.com/nvidia/skills
BioNeMo Agent Toolkit 生命科学专用 Skills 库(蛋白质折叠、分子对接、生成化学、基因组分析等) github.com/NVIDIA-BioNeMo/bionemo-agent-toolkit
AI-Q Blueprint 智能研究 Agent 参考架构,混合大模型编排 + Nemotron 检索分析 github.com/NVIDIA-AI-Blueprints/aiq

五、优化引擎与模型

项目名称 功能描述 源代码地址
cuOpt GPU 加速决策优化引擎(LP、QP、VRP、MIP),支持 Agent 技能调用 github.com/nvidia/cuopt
Nemotron 3 模型权重 开源模型家族(Nano、Super、Ultra、Embed 等),Hugging Face 托管 huggingface.co/nvidia

六、相关依赖与生态项目

项目名称 功能描述 源代码地址
NVIDIA Dynamo 推理加速框架(与 NeMo Agent Toolkit 集成用于端到端加速) github.com/ai-dynamo/dynamo

七、官方文档

文档站点 说明 地址
OpenShell 官方文档 开发者指南、API 参考、策略配置 docs.nvidia.com/openshell
NemoClaw 官方文档 架构、安装、安全最佳实践、CLI 参考 nvidia.github.io/NemoClaw
NVIDIA 开发者博客 cuOpt Agent Skills、NVFP4 量化等技术文章 developer.nvidia.com/blog

许可证说明:上述官方仓库中,源代码普遍采用 Apache License 2.0,Skills 文档采用 CC BY 4.0,Nemotron 模型权重采用 NVIDIA Open Model License(允许商业使用)。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐