这篇的材料我按三把尺子重新量了一遍。「半台 Spark」这个比喻,只在一把尺子上成立。
尺子一:内存——成立
64 GB 对 128 GB,砍半。这条没问题。
尺子二:带宽——一把没砍
T5000 的官方规格是 128 GB LPDDR5X、256 位、273 GB/s,跟 DGX Spark 的 GB10 是同一组数(256 位、273 GB/s)。
原帖的解释链条是:27B 生成速度约为 Spark 七成 → 对应 730 对 1000 的算力比 → 「decode 是带宽 bound,内存子系统是七成速度的主要约束」。
如果两边带宽同规格,这条解释就不成立。 七成得去别处找:车规软件栈、功耗档、散热。这个区别很实际——如果瓶颈在软件栈,那是等更新;如果瓶颈在带宽,那是物理上限,等不来。
尺子三:算力——两个数字放不进同一个算式
- NVIDIA 开发套件数据表:Jetson AGX Thor 是 2070 FP4 / 1035 FP8 TFLOPS;模组规格 2560 CUDA 核、96 Tensor 核、10 个 TPC、GPU 1.57 GHz,功耗 40–130 W 可配
- 拆解机构口径:Thor-U 约 730 TOPS,公开信源未标精度
技术前提也要改:不是同构
原帖说「GB10 的设备名在 CUDA 里就叫 NVIDIA Thor,compute capability 11.0,20 组 SM,2560 CUDA core,而 T5000 的 GPU 也正是 2560-core Blackwell,所以是同一块硅的两个封装」。
实情是:DGX Spark 的 GB10 是 6144 个 CUDA 核、compute capability 12.1(sm_120/sm_121);车规 Thor 那一侧是 2560 核、sm_110。核数差 2.4 倍。
拆机板能直接跑 llama.cpp / PyTorch / ComfyUI,不是因为「同构」,而是因为 sm_110 已经在这些栈的支持列表里。因果要倒过来:不是因为同构才能跑,是因为有人先做了 sm_110 的适配,所以能跑。
价格锚要加一个日期
- Jetson T5000 模组:千片价 2999 美元
- Jetson AGX Thor 开发套件:3499 美元
- DGX Spark:2025-10-15 首发 3999 美元,2026-02-23 涨到 4699 美元,官方理由是 LPDDR5x 内存供应紧张
下一根钉子
原帖那两条预测方向我认同,但第二条要加个前置条件:软件栈那部分差距被剥离之后,剩下的「纯硬件差」得先回答功耗题。
在一台拆机板上把同一个 27B 模型跑三次就好——默认功耗档、拉满功耗档、加主动散热。如果七成这个数随功耗档变化,那原帖的「带宽约束」就退了,「功耗墙」上位。 40–130 W 的可配区间不是参数表里的一行小字,它是这块板能不能从折腾变成教程的门槛。