数没大问题,但"便宜"这个词真正省在哪一层,原帖这条拆得不够狠,得再拧一遍。
先说清楚一个尺度:你中午点一份外卖大约 18 块,输入 100 万 token 折合下来约 7 块人民币,也就是两份外卖的钱;输出 100 万 token 是 20 块,一顿火锅。价签这一段,先把它放回食物尺度上,才不会把"便宜"两个字读成"白菜价"。
原帖的核心数字其实站得住:AA Intelligence Index v4.3.2 给 44 分(200 模型里第 24 位,与 Kimi K3 同档,比 GLM-5.3 低 1 分)【直引·AA 跑分记录】;Terminal-Bench 4.0 上 33.3%,低于 GLM-5.3 的 41.9%、Claude Opus 5 的 52.3% 与 GPT-6 Astra 的 57.9%【直引·同份独立评测】。这两条单独看,是把"挤进全球开源模型前三"和"离绝对前沿还差一截"两个判断同时坐实。
但有一个对比需要再核:原帖把这三款同档 MoE 列在表里——Step 5 Preview 600B 激活 4.5%(27B)、DeepSeek V4.1 Flash 552B 激活 8B-16B("非对称激活")、GLM-5.3-Flash 320B 激活 18B(5.6%)。"非对称激活"这个说法在公开材料里我核不到对应口径——DeepSeek 那边对外一直挂的是 V3.1 末代命名,V4.1 是 2026 年下半年内部代号还是外部正式版,发布会上没见正式公告【判断:建议引用前换成"激活范围 8B-16B",并标"原文称非对称激活,未见独立验证"】。
接下来是这一批帖子里真正值得拧的那一笔账:1.6 亿 vs 9200 万。
AA 这轮独立评测跑下来,Step 5 Preview 共输出了 1.6 亿 token,同批模型中位 9200 万,差不多 1.7 倍。AA 措辞"速度高于平均,回答非常冗长"【直引·AA 评测页】。把这两条放回价签:输出 2.70 美元 / 百万 token × 1.6 亿 = 432 美元,而单看输入 1.00 美元 + 缓存折扣,跑完全套智能指数总花费约 918 美元。价签上的便宜,AA 折算出来的单任务加权成本是 0.71 美元/任务【直引·AA 单任务加权成本口径】。
这就把一件事摆到桌面上:1.00/2.70 是单 token 价,0.71 是单任务总价,两个数字说的不是同一件事。原帖已经点到了,但没收到底。我再往下压一句——单任务加权成本才是采购方真正要付的那一格,token 单价是市场宣传那一格。同样的中文语境里,国内 7 元/20 元那条线我没看到 AA 的对位换算,需要国内采购方自己跑一遍中文 benchmark 才能对齐口径【推论】。
最后讲一个原帖里被压到边角的风险:BF16 精度开源 + 许可证未公布。10/15 那天你拿到权重之后,部署前还得再等一份许可证——这是企业采购最大的未知项。原帖在第一段就提了,但后面再没展开【判断:商业部署的真正阻塞不在模型能力,而在许可文件落地】。
> 小贴士:长上下文单价的换算要分两层。第一层是 token 单价(市场报价那一格),第二层是单任务加权成本(实际账单那一格)。同样"便宜",两层各自差几倍。
下一根钉子:10/15 之后,第一个被外人按 AA v4.3.2 完整口径复测的数字会是谁的?如果 Step 5 Preview 在第三方手里还是 44 分,那这一轮就真的稳了;如果掉到 38 分以下,原帖"挤进全球开源前三"的措辞就要往回收半格。等外人跑。