静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 06:29

这篇的材料我按三把尺子重新量了一遍。「半台 Spark」这个比喻,只在一把尺子上成立。

三把尺量出的三个答案

尺子一:内存——成立

64 GB 对 128 GB,砍半。这条没问题。

尺子二:带宽——一把没砍

T5000 的官方规格是 128 GB LPDDR5X、256 位、273 GB/s,跟 DGX Spark 的 GB10 是同一组数(256 位、273 GB/s)。

原帖的解释链条是:27B 生成速度约为 Spark 七成 → 对应 730 对 1000 的算力比 → 「decode 是带宽 bound,内存子系统是七成速度的主要约束」。

如果两边带宽同规格,这条解释就不成立。 七成得去别处找:车规软件栈、功耗档、散热。这个区别很实际——如果瓶颈在软件栈,那是等更新;如果瓶颈在带宽,那是物理上限,等不来。

尺子三:算力——两个数字放不进同一个算式

  • NVIDIA 开发套件数据表:Jetson AGX Thor 是 2070 FP4 / 1035 FP8 TFLOPS;模组规格 2560 CUDA 核、96 Tensor 核、10 个 TPC、GPU 1.57 GHz,功耗 40–130 W 可配
  • 拆解机构口径:Thor-U 约 730 TOPS,公开信源未标精度
用 730 比 1000,得七成;用 2070 比 1000,得两倍。两个方向相反的答案,都出自「公开资料」。原帖自己标了「730 TOPS 的精度口径公开信源未标」,这个自觉是对的——但既然标了,就不该拿它去做比例。

技术前提也要改:不是同构

原帖说「GB10 的设备名在 CUDA 里就叫 NVIDIA Thor,compute capability 11.0,20 组 SM,2560 CUDA core,而 T5000 的 GPU 也正是 2560-core Blackwell,所以是同一块硅的两个封装」。

实情是:DGX Spark 的 GB10 是 6144 个 CUDA 核、compute capability 12.1(sm_120/sm_121);车规 Thor 那一侧是 2560 核、sm_110。核数差 2.4 倍。

拆机板能直接跑 llama.cpp / PyTorch / ComfyUI,不是因为「同构」,而是因为 sm_110 已经在这些栈的支持列表里。因果要倒过来:不是因为同构才能跑,是因为有人先做了 sm_110 的适配,所以能跑。

价格锚要加一个日期

  • Jetson T5000 模组:千片价 2999 美元
  • Jetson AGX Thor 开发套件:3499 美元
  • DGX Spark:2025-10-15 首发 3999 美元,2026-02-23 涨到 4699 美元,官方理由是 LPDDR5x 内存供应紧张
也就是说,那块 1800 元的拆机板,对着的是 2999 的模组价。差价里,一半是车企的采购量,一半是这一年内存涨的价。

下一根钉子

原帖那两条预测方向我认同,但第二条要加个前置条件:软件栈那部分差距被剥离之后,剩下的「纯硬件差」得先回答功耗题。

在一台拆机板上把同一个 27B 模型跑三次就好——默认功耗档、拉满功耗档、加主动散热。如果七成这个数随功耗档变化,那原帖的「带宽约束」就退了,「功耗墙」上位。 40–130 W 的可配区间不是参数表里的一行小字,它是这块板能不能从折腾变成教程的门槛。

暂无表态