From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

研究领域: NLP 作者: Laurens Samson, Iva Gornishka, Gossa Lô 发布时间: 2026-08-11 arXiv: 2508.03803

论文概要

研究领域: NLP 作者: Laurens Samson, Iva Gornishka, Gossa Lô 发布时间: 2026-08-11 arXiv: 2508.03803

中文摘要

大语言模型越来越多地被部署在政府环境中,但现有的评估框架很少能同时反映公共行政的价值观和非英语环境的语言要求。我们提出了「Grip on LLMs」框架,这是一个与荷兰主要市政组织的领域专家合作开发的荷兰政府使用系统评估套件。通过咨询委员会流程、用户研究和对公务员聊天机器人用户的调查,我们确定了六个评估维度(事实性、诚实性、社会偏见、能耗、成本和训练数据透明度),并将它们转化为一个涵盖30多个多语言和荷兰特定模型的基准套件。我们的结果显示,没有单一模型在所有维度上表现出色,权衡是不可避免的:更高的质量始终伴随着更大的环境影响和财务成本,而偏见在很大程度上与两者无关。我们进一步发现,事实性(模型是否正确回答)和诚实性(模型是否承认不知道)由不同的属性决定,高事实性并不意味着高诚实性。为了使这些发现对非技术受众可操作,我们发布了一个公开可访问、用户友好的模型概览,专为参与政府LLM选择的全范围利益相关者设计,从工程师到政策制定者。

原文摘要

Large language models are increasingly being deployed in governmental settings, yet few existing evaluation frameworks jointly reflect the values of public administration and the linguistic requirements of non-English contexts. We present the 'Grip on LLMs' framework, a systematic evaluation suite for Dutch governmental use developed in collaboration with domain experts from a major Dutch municipal organisation. Through an advisory board process, user research, and a survey of the users of a civil-servant chatbot, we identify six evaluation dimensions (factuality, honesty, social bias, energy consumption, cost, and training data transparency) and operationalise them into a benchmark suite covering more than 30 multilingual and Dutch-specific models. Our results reveal that no single model ...


*自动采集于 2026-08-12*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

Grip on LLMs(arXiv:2608.09925)这篇最该被中文 AI 治理圈看到——它把「政府采购大模型」从玄学变成了可操作的六维评分卡。补几条:

① 六维度里最反直觉的发现是「事实性 ≠ 诚实性」。论文测出 GPT-5 事实性 0.76 但诚实性只有 0.14——也就是它知道得最多,但最不肯承认自己不知道。Mistral Large 3 事实性 0.71 / 诚实性 0.21 同款毛病。这对政府场景是致命的:一个 confidently wrong 的模型比一个老实说「我不会」的模型危险得多,因为前者会被当成权威输出。

② 诚实性用的是新造的 HONESTCITYBENCH(530 条荷兰语 prompt),靠三模型 LLM 陪审团打分再拿人类标注校验。Pith 的 desk verdict 点得很准:这个核心结论的承重墙是「陪审团和人类一致」,论文目前只给了相关性(r<0.2 说事实性和诚实性无关),法官校验的绝对数还没放出来。结论先信一半。

③ 质量↔成本/能耗强正相关、偏见几乎独立于两者——这三条权衡曲线是政府采购的真正决策依据。它直接告诉你:没有「全能模型」,只有「按场景选维度」。比如面向市民的问答系统,诚实性权重应高于事实性峰值;内部文档摘要,成本权重可以上调。

④ 公开仪表盘 griponllms.nl 是这篇最被低估的产出。把评估结果做成非技术决策者也能用的比较工具,等于把「AI 选型」从供应商 PPT 拉回到可审计数据。这比任何一篇方法论论文都更可能改变实际采购行为。

⑤ 下一根钉子在「非英语小语种的通用性」。框架建立在荷兰语场景 + 阿姆斯特丹市政协作上,换到中文 + 中国政务语境,维度权重和基准集都要重做。但方法论(价值→维度→基准→仪表盘)是可迁移的模板。

收尾:Grip on LLMs 的价值不在它测了哪 30 个模型,在于它证明了「公共行政价值可以被操作化成可比较的基准」。下一根最该盯的钉子是国内有没有团队照这个模板做中文政务版——维度可以照搬,但荷兰语基准换成中文基准这一步,工作量不比写框架小。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens