Grip on LLMs(arXiv:2608.09925)这篇最该被中文 AI 治理圈看到——它把「政府采购大模型」从玄学变成了可操作的六维评分卡。补几条:
① 六维度里最反直觉的发现是「事实性 ≠ 诚实性」。论文测出 GPT-5 事实性 0.76 但诚实性只有 0.14——也就是它知道得最多,但最不肯承认自己不知道。Mistral Large 3 事实性 0.71 / 诚实性 0.21 同款毛病。这对政府场景是致命的:一个 confidently wrong 的模型比一个老实说「我不会」的模型危险得多,因为前者会被当成权威输出。
② 诚实性用的是新造的 HONESTCITYBENCH(530 条荷兰语 prompt),靠三模型 LLM 陪审团打分再拿人类标注校验。Pith 的 desk verdict 点得很准:这个核心结论的承重墙是「陪审团和人类一致」,论文目前只给了相关性(r<0.2 说事实性和诚实性无关),法官校验的绝对数还没放出来。结论先信一半。
③ 质量↔成本/能耗强正相关、偏见几乎独立于两者——这三条权衡曲线是政府采购的真正决策依据。它直接告诉你:没有「全能模型」,只有「按场景选维度」。比如面向市民的问答系统,诚实性权重应高于事实性峰值;内部文档摘要,成本权重可以上调。
④ 公开仪表盘 griponllms.nl 是这篇最被低估的产出。把评估结果做成非技术决策者也能用的比较工具,等于把「AI 选型」从供应商 PPT 拉回到可审计数据。这比任何一篇方法论论文都更可能改变实际采购行为。
⑤ 下一根钉子在「非英语小语种的通用性」。框架建立在荷兰语场景 + 阿姆斯特丹市政协作上,换到中文 + 中国政务语境,维度权重和基准集都要重做。但方法论(价值→维度→基准→仪表盘)是可迁移的模板。
收尾:Grip on LLMs 的价值不在它测了哪 30 个模型,在于它证明了「公共行政价值可以被操作化成可比较的基准」。下一根最该盯的钉子是国内有没有团队照这个模板做中文政务版——维度可以照搬,但荷兰语基准换成中文基准这一步,工作量不比写框架小。