JetPack 7 将 Thor 统一到 SBSA 和 CUDA 13 架构下,而 Orin 仍停留在 sm_87,软件栈成为购买决策的核心。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @MichaelGannotti# JetPack 7 分裂了 Jetson 家族 Thor 运行 SBSA 并使用统一的 CUDA 13 Arm 工具链。Orin 仍停留在 sm_87。购买决策的关键在于软件栈,而非 TOPS 数字。 Jetson 包装盒上的 TOPS 数字是页面上最没用的信息:NVIDIA 如今以同一个家族名称涵盖两个固件世界——Thor 作为 Arm 服务器,Orin 作为 Tegra 开发板,而 JetPack 7 同时覆盖两者。 这是《The Possible》专栏的第一篇:聚焦于将 AI 部署到机器人、无人机、信息亭或桌面设备上所需的硬件、固件与软件。今天 NVIDIA 传达的信息很简单:如果你在 2026 年底购买 Jetson,你首先买的是一份软件合约。 ## 两套软件栈,一个品牌 JetPack 7 是 Jetson 的官方软件栈。[3] 它运行 Linux 内核 6.8 和 Ubuntu 24.04 LTS。[3] 它新增了可抢占实时内核、Thor 上的多实例 GPU(MIG)以及 Holoscan Sensor Bridge。[3] 当前下载版本为 JetPack 7.2.1,搭配 Jetson Linux 39.2.1,驱动包日期为 2026 年 8 月 11 日。[5] 该版本的 ISO 镜像包含以下组件:CUDA 13.2.1、cuDNN 9.20.0、TensorRT 10.16.2、VPI 4.1.3、DeepStream 9.1、Holoscan SDK 3.9.0、Nsight Systems 2026.3 以及 NVIDIA Container Toolkit 1.19。[5] Isaac ROS 标注为"即将推出"。[5] ISO 安装程序现在默认以 Super 模式刷写 Jetson Orin Nano 开发者套件。[5] 不再提供 SD 卡镜像。[5] 刷机需通过 USB 闪存盘进行。[5] 这些版本锁定比峰值 TFLOPS 数字更为重要,因为它们决定了你的 PyTorch wheel、vLLM 容器以及载板 BSP 能否正常安装。 分叉就隐藏在这些版本号之下。随着 JetPack 7 的发布,Jetson 软件与服务器基础系统架构(SBSA)对齐,"将 Jetson Thor 定位于与业界标准 Arm 服务器设计并列的位置。"[2][3][5] NVIDIA 表示,SBSA 为操作系统支持和可移植性标准化了硬件与固件接口。[3] 在此基础上,"Jetson Thor 现在支持跨所有 Arm 目标的统一 NVIDIA CUDA 13.0 安装。"[3] Orin 是例外。CUDA 13.0 为 SBSA 服务器和 Thor 统一了工具链。"唯一的例外是 Orin(sm_87),它将暂时继续沿用现有路径。"[4] 你仍然可以在 Orin 系列上运行 JetPack 7.2.1。[5] 但你不能假装编译器层面的情况是一样的。 由于 Thor 使用 SBSA,手动刷机流程也随之改变。NVIDIA 要求你仔细遵循 r39.2.1 的刷机说明。[5] ## Thor 究竟是什么 NVIDIA 产品页面标注 Jetson Thor 系列模组的 AI 算力最高可达 2070 FP4 TFLOPS,内存容量为 128 GB——相比 Jetson AGX Orin,性能提升 7.5 倍,能效提升 3.5 倍——功耗范围为 40–130 W。[1] 2070 TFLOPS 数据是在 130 W 功耗下的实测性能。[1] 内存带宽为 273 GB/s。[1] 顶配 CPU 为 14 核。[1] 该页面在售的 SKU 包括 AGX Thor 开发者套件、Jetson T5000 以及 Jetson T4000。[1] AGX Thor 开发者套件 / T5000 与 Jetson T4000 对比:AI 性能分别为 2070 TFLOPS(FP4 稀疏)和 1200 TFLOPS(FP4 稀疏);GPU 分别为 2560 核心 Blackwell、第五代 Tensor Core、支持 MIG 含 10 个 TPC,以及 1536 核心 Blackwell、第五代 Tensor Core、支持 MIG 含 6 个 TPC;GPU 最高频率分别为 1.57 GHz 和 1.53 GHz;CPU 分别为 14 核 Arm Neoverse-V3AE、每核 1 MB L2 缓存、16 MB 共享 L3,以及 12 核 Arm Neoverse-V3AE、缓存规格相同;CPU 最高频率均为 2.6 GHz;内存分别为 128 GB 256 位 LPDDR5X(273 GB/s)和 64 GB 256 位 LPDDR5X(273 GB/s);功耗分别为 40 W–130 W 和 40 W–70 W;网络接口(模组)分别为 4× 25GbE 和 3× 25GbE;模组尺寸均为 100 mm × 87 mm,T5000 采用 699 针接口。 来源:NVIDIA Jetson Thor 产品参数表。[1] T4000 的 AI、GPU、CPU、内存和功耗数据均来自同一张表。开发者套件额外提供 M.2 Key M 插槽中的 1 TB NVMe、1× 5GbE RJ45、1× QSFP28(4× 25GbE)、HDMI 2.0b、DisplayPort 1.4a,以及尺寸为 243.19 × 112.40 × 56.88 mm 的机箱。[1] 2025 年 8 月发布的技术介绍文档目前仍是 T5000 的权威参考资料,该文档重申了 T5000 在 130 W 功耗下实现 2070 稀疏 FP4 TFLOPS 的指标,并补充了密集性能梯级数据:T5000 为 1035 TFLOPS 密集 FP4 / 稀疏 FP8 / 稀疏 INT8,以及 517 TFLOPS 密集 FP8 / 稀疏 FP16;T4000 在同一梯级中对应为 1200 / 600 / 300。[2] 该表中张量核心数量为 T5000 配备 96 个,T4000 配备 64 个。[2] 介绍文档中的 T4000 数据标注为初步数据。[2] 请勿将稀疏 FP4 峰值与 Orin 上的 INT8 TOPS 混淆,二者是不同的度量指标。NVIDIA 对 Thor 采用稀疏 FP4 TFLOPS 计量,对 Orin Nano Super 采用 INT8 TOPS 计量。[1][6] 开发者套件集成了 T5000 模组。[2] 模组侧的摄像头 I/O 包括:Holoscan Sensor Bridge、通过 HSB 最多支持 20 路摄像头、通过 16 条 MIPI CSI-2 通道最多支持 6 路摄像头、使用虚拟通道最多支持 32 路摄像头,C-PHY 2.1 速率为 10.25 Gbps,D-PHY 2.1 速率为 40 Gbps。[2] ## 请自行清点 SM 数量 营销图表中仍流传着"最大架构配置 3,072 个 CUDA 核心"的说法。NVIDIA 开发者论坛上的工作人员引用 Jetson-Thor-Series-Modules-Datasheet_DS-11945-001v1.3.pdf 指出,Thor 开发者套件实际配备 2,560 个 CUDA 核心,而非 3,072 个。[10] 该帖子的后续内容进一步说明:2,560 个 CUDA 核心 / 每 SM 128 个核心 = 20 个 SM。Blackwell SM 每个含 4 个张量核心,据此计算应为 80 个张量核心,但数据表中 T5000 的张量核心数为 96 个。[10] 同一帖子的后续回复报告了 CUDA Driver API 查询结果:GPU 名称为 NVIDIA Thor,SM 数量 20,L2 缓存 32 MiB,每个 SM 最大共享内存 228 KiB。[10] 将产品页面上的 2,560 核心数据视为量产 GPU 的实际规格。[1] 将 3,072 视为完整芯片架构图的参考值,直至数据表与 nvidia-smi 的查询结果相互印证为止。论坛并非数据表,但提出了合理的质疑。 JetPack 7.2 的 MIG 分区布局与 20 SM GPU 相符。NVIDIA 将 Thor 划分为两个隔离实例:12 个 SM / 1,536 个 CUDA 核心用于 AI 和图形,8 个 SM / 1,024 个 CUDA 核心用于机器人、控制、感知或安全关键任务。[7] 其核心价值在于:通过 JetPack 7 中的可抢占实时内核,实现专用计算、缓存和内存带宽的隔离,从而在单块 SoC 上支持混合关键性负载,避免 AI 推理任务抢占控制回路的算力。[7] ## CUDA 13 才是 Thor 的真正亮点 面向 Thor 的 CUDA 13.0 统一了服务器级 Arm 平台与嵌入式 Thor 平台的工具链。[4] NVIDIA 的思路是:一次构建,在 GB200、DGX Spark 等系统上仿真,再将相同的二进制文件部署到 Thor,无需修改代码。[4] 编译器仍会针对目标 GPU 生成对应代码。[4] 无需再维护两套工具链。[4] 容器也遵循同样的统一原则。[4] 上述表述出自 NVIDIA 自己的 CUDA 13 介绍文档,其中将 DGX Spark 列为仿真主机。[4] 这并非断言任何特定实验室当前正在运行 Spark。 Thor还获得了具备完全一致性的统一虚拟内存(Unified Virtual Memory)。[4] `cudaDeviceProp::pageableMemoryAccessUsesHostPageTables`为1,意味着GPU可以遍历宿主机页表访问可分页的CPU内存。[4] 硬件负责保持GPU与CPU缓存的一致性。[4] `mmap()`或`malloc()`分配的缓冲区无需经过CUDA分配器即可传入内核。[4] `cudaMallocManaged()`将`concurrentManagedAccess`报告为1,因此`cudaMemPrefetchAsync()`可以正常使用,但在CUDA 13.0中,这些托管内存分配不会被GPU缓存。[4] NVIDIA表示,此举使Jetson UVM与独立GPU保持一致,但上述缓存限制除外。[4] GPU共享机制也趋于成熟。[4] MPS(多进程服务)可将规模较小或突发性的进程整合到单一GPU上下文中,无需修改应用程序。[4] 绿色上下文(Green Contexts)与之并存。[4] CUDA 13.0还为Thor引入了`nvidia-smi`和NVML,这些工具独立GPU用户早已熟悉。[4] 如果你是为机器人编写CUDA代码的开发者,这就是你等待的版本;如果你是导入基于`sm_87`构建的wheel包的Python用户,这则是一个潜在的陷阱。 ## JetPack 7.2.1的组件清单 | 层级 | 版本 | |---|---| | Jetson Linux | 39.2.1(2026年8月11日) | | 内核 | 6.8 | | 用户空间 | L4T Ubuntu 24.04;同时列出Canonical Ubuntu 24.04 for Jetson | | CUDA | 13.2.1 | | cuDNN | 9.20.0 | | TensorRT | 10.16.2 | | VPI | 4.1.3 | | PVA | 2.9.1 | | DeepStream | 9.1 | | Holoscan SDK | 3.9.0 | | Vulkan / OpenGL / GLES | 1.4 / 4.6 / 3.2 | | Nsight Systems | 2026.3 | | Container Toolkit | 1.19(ISO) | | Isaac ROS | 即将推出 | | 支持硬件 | AGX Thor开发者套件、T5000、T4000、Orin系列 | 来源:NVIDIA JetPack 7.2.1下载页面。[5] JetPack 7.2还通过OE4T配方新增了对Yocto Project的官方支持。[3][7] 7.2.1新增了Jetson T3000仿真、视频流水线的智能体技能(agent skills)、将Super Mode设为Orin Nano默认烧录选项,以及对PCN211461 / PCN211462的支持。[5] NemoClaw在JetPack 7.2上只需一条命令即可安装:`curl -fsSL` https://www.nvidia.com/nemoclaw.sh `| bash`。[7] NVIDIA将NemoClaw描述为一个开源技术栈,在OpenClaw基础上增加了隐私与安全控制,并在7.2上预配置完毕,让用户无需手动搭建环境。[7] GitHub上提供的设备端技能(device-side skills)和BSP技能(BSP skills)可自动化完成BSP初始化、内存分区划分及模型性能基准测试。[3][7] 内存技能并非细枝末节。NVIDIA 2026年7月关于Thor模块的博客文章指出,合作伙伴通过降低内存用量而得以选择更低规格的内存SKU:优必选(UBTech)、Agile Robots和Connect Tech"将内存用量最多降低了15GB",从而由AGX Orin 64GB升级方案改用32GB;SandStar最多节省了4GB,从Orin NX 16GB降至8GB;NoTraffic在TX2 NX上节省了30%。[8] 这些均为厂商自述的节省数据,但仍具有重要参考价值:这是你无需采购的GB数。 JetPack 7.2还为Jetson AGX Orin 32GB开启了Super Mode。[7] 软件层面的演进仍在持续推动Orin芯片的能力边界。但这并不会赋予Orin Thor的SBSA固件。 ## 用数据说话,而非口号 NVIDIA发布了一份AGX Thor与AGX Orin的token吞吐量对比表格。[2] 测试条件为:序列长度2048、输出长度128、最大并发数8、两者均使用MAXN功耗模式。[2] LLM与VLM在vLLM框架下运行,[2] VLA在TensorRT下运行。[2] | 系列 | 模型 | Thor(tok/s) | Orin(tok/s) | 加速比 | |---|---|---|---|---| | Llama | Llama 3.1 8B | 150.8 | 112.33 | 1.34 | | Llama | Llama 3.3 70B | 12.64 | 7.38 | 1.71 | | Qwen | Qwen3-30B-A3B | 226.42 | 76.69 | 2.95 | | Qwen | Qwen3-32B | 79.1 | 16.84 | 4.70 | | DeepSeek | DeepSeek-R1-Distill-Qwen-7B | 304.76 | 180.41 | 1.69 | | DeepSeek | DeepSeek-R1-Distill-Qwen-32B | 82.63 | 16.96 | 4.87 | | VLM | Qwen2.5-VL-3B | 356.862 | 216 | 1.65 | | VLM | Qwen2.5-VL-7B | 252 | 154.02 | 1.64 | | VLM | Llama 3.2 11B Vision | 69.63 | 44.22 | 1.57 | | VLA | GR00T N1 | 46.7 | 18.5 | 2.52 | | VLA | GR00T N1.5 | 41.5 | 15.2 | 2.74 | 来源:NVIDIA技术博客,表3。[2] 将该表作为软件结果来解读。Qwen3-32B 上的 4.7× 和 DeepSeek-R1-Distill-Qwen-32B 上的 4.87×,正是 FP4、内存以及新引擎发挥作用之处。Llama 3.1 8B 的 1.34× 则提醒我们,一个小型稠密模型本已能装进 Orin。Thor 的 128 GB 内存,正是 70B 模型能出现在图表中的原因。[1][2] NVIDIA 还援引数据称,在 16 路并发请求下,Qwen2.5-VL-3B 与 Llama 3.2 3B 的 TTFT 远低于 200 ms,TPOT 远低于 50 ms。[2] 配备 FP4 与 Eagle 投机解码的 Qwen2.5-VL-7B 相比 Orin W4A16"最高提升 3.5×"。[2] 以上均为 NVIDIA 的基准测试数据。在将其写入采购订单之前,请在你自己的功耗模式、批次配置和软件栈上重新运行测试。 ## 小端产品线并未停步 Jetson Orin Nano Super 是大多数学生已经拥有的套件。NVIDIA 标称其性能为 67 INT8 TOPS,Ampere GPU 配备 1,024 个 CUDA 核心和 32 个 Tensor 核心,6 核 Cortex-A78AE,8 GB 128 位 LPDDR5 内存带宽达 102 GB/s,功耗 7–25 W。[6] 相比原版 Nano 套件,这一数据从 40 TOPS、68 GB/s 和 1.5 GHz 全面提升。[6] Super 的 CPU 频率在亮点行中标注为 1.7 GHz。[6] 现有的 Orin Nano 开发者套件可通过软件更新升级至 Super。[6] 2026 年 8 月 25 日,NVIDIA 发布了 Jetson Orin Nano 2:78 TOPS AI 算力、8 GB 内存、8 核 Arm CPU、相同的紧凑外形,推理性能是 Orin Nano Super 的 2 倍,且在 15 瓦模式下"以低 40% 的功耗实现与上一代相同的性能"。[9] 模块与开发者套件预计于 2027 年上半年上市。[9] NVIDIA 表示已有逾 300 万开发者基于其机器人软件栈进行开发,Cognex、斗山山猫(Doosan Bobcat)和 Matic 是早期探索者,Wing 则在使用 Nano Super 之后正在评估将 Nano 2 用于配送无人机。[9] Seeed Studio 也在载板支持列表之中。[9] 78 TOPS 对比 67 TOPS 并非重点所在。对于电池驱动的机器人而言,真正的故事是:CPU 核心数从 6 核增至 8 核,以及在 15 W 模式下同等性能时功耗降低 40%。[9][6] Nano 2 目前尚未上架。Super 已有货。 ## 中端 Thor,仍在排期中 2026 年 7 月 15 日,NVIDIA 发布了 Jetson T3000 与 T2000,这是两款面向量产机器人的 Blackwell Thor 模块,功耗目标低于 130 W 上限。[8] T3000:865 FP4 TFLOPS,8 核 Neoverse,32 GB LPDDR5X,带宽 273 GB/s,25 GbE,"尺寸和功耗约为 T5000 的一半"。[8] NVIDIA 表示,T3000"在包括 LLM、VLM、VLA 和世界基础模型在内的多模态工作负载上,可实现与 T5000 相近的推理性能",并称迁移至 T3000"有助于在内存价格高企的背景下降低成本"。[8] IGX T3000 版本额外增加了功能安全认证以及 NVIDIA Halos 机器人安全方案。[8] T2000:400 FP4 TFLOPS,16 GB 内存,面向视觉智能体、AMR 及工业机械臂。[8] NVIDIA 目前将边缘端算力范围描述为"70 TOPS 至 2,000 万亿次浮点运算"。[8] T3000 和 T2000 模块计划于 2027 年第一季度上市。[8] T3000 仿真已纳入 JetPack 7.2.1;T2000 仿真将在稍后跟进。[8] 开发流程从 AGX Thor 开发者套件出发,向下进行仿真。[8][5] Cosmos 3 Edge 是一个 40 亿参数的世界模型,NVIDIA 表示其与 Thor 平台兼容。[8] Seeed Studio 于同日宣布提供支持。[8] 如果你需要在 2026 年 10 月交付一台机器人计算机,你的选项是 T5000、T4000、AGX Orin 或 Orin Nano Super。T3000 目前仍是仿真目标。 ## 面对这一产品分布,该如何选购 你正在交付一台仿人机器人、一个多摄像头工作单元,或需要一个 70B 级本地推理大脑。选择 AGX Thor 开发者套件或 T5000。128 GB 内存、4× 25GbE、MIG、Holoscan Sensor Bridge、CUDA 13 SBSA。[1][2] 功耗预算 40–130 W,并配备能引出 QSFP 接口的载板。 你需要在70瓦、64 GB配置下运行Thor软件。T4000。同样273 GB/s带宽,核心数更少,12个CPU核心,3× 25GbE。[1] 你在2027年需要Thor的经济性。在现在能买到的硬件上模拟T3000。[8][5] 不要把32 GB当128 GB用。NVIDIA自己的内存技巧案例之所以存在,正是因为32 GB很紧张。[8] 你在实验台、课堂,或者物料清单只有几百美元。Orin Nano Super,67 INT8 TOPS,8 GB,7–25瓦,可从旧版Nano套件通过软件升级。[6] 规划好JetPack 7.2.1 ISO刷机流程。不要去找SD卡镜像。[5] 追CUDA 13 wheel包时,记住sm_87。[4] 你正在设计2027年的无人机或家用机器人。阅读Nano 2简报:78 TOPS,8核,8 GB,2027年上半年发布,在15瓦模式下同等性能功耗降低40%。[9] 如果等不及,就以Super为基础今天设计载板。 你为Spark、GB200和机器人编写一套统一的CUDA代码树。Thor在这棵树里。Orin不在,除非NVIDIA迁移sm_87。[4] ## 固件即产品 Jetson曾经意味着"刷入L4T,然后接受BSP锁定的任意CUDA版本。"JetPack 7依然要刷BSP。Thor的BSP遵循SBSA规范。Orin的GPU仍然报告计算能力8.7。统一的CUDA 13安装程序是为SBSA那一侧服务的。[4][5] 这就是为什么每周一的NVIDIA专栏不是又一篇Spark基准测试文章。Spark是NVIDIA自己CUDA 13故事中的一台桌面Grace-Blackwell机器,是你在把二进制文件复制到Thor之前进行编译的地方。[4] Jetson才是那个二进制文件必须与摄像头、25GbE、实时内核以及40–130瓦功耗封装共存的地方。[1][2][3] 这一周,可以实现的是:一台机器人,运行与机架上相同的Arm CUDA工具链,借助MIG让控制回路不与摘要模块共享SM,128 GB内存池让70B模型成为一项配置选项而非笑谈。[2][7] 约束来自家族的另一半——仍在Orin硅片上,仍在sm_87上,仍是大多数人实际能买到的那块板子。[4][6] 购买你能刷机的技术栈,在设备上清点SM数量,对不注明数据类型的TOPS数字保持怀疑。 ## 参考来源 [1] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor — NVIDIA Jetson Thor产品页面 [2] https://developer.nvidia.com/blog/introducing-nvidia-jetson-thor-the-ultimate-platform-for-physical-ai — NVIDIA Jetson Thor发布介绍 [3] https://developer.nvidia.com/embedded/jetpack — NVIDIA JetPack SDK [4] https://developer.nvidia.com/blog/whats-new-in-cuda-toolkit-13-0-for-jetson-thor-unified-arm-ecosystem-and-more — 面向Jetson Thor的CUDA Toolkit 13.0 [5] https://developer.nvidia.com/embedded/jetpack/downloads — JetPack 7.2.1下载及说明 [6] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/nano-super-developer-kit — Jetson Orin Nano Super开发者套件 [7] https://developer.nvidia.com/blog/deploy-agentic-ready-ai-at-the-edge-with-memory-efficiency-in-nvidia-jetpack-7-2 — JetPack 7.2智能体就绪AI [8] https://blogs.nvidia.com/blog/jetson-thor-robotics-edge-ai-agent — Jetson T3000与T2000发布公告 [9] https://nvidianews.nvidia.com/news/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai — Jetson Orin Nano 2新闻稿 [10] https://forums.developer.nvidia.com/t/clarification-on-cuda-core-and-tensor-core-counts-for-jetson-agx-thor/356355 — Thor CUDA核心说明论坛帖