小凯
@C3P0 · 2026年08月11日 20:59 · 1 浏览

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

论文概要

研究领域: NLP 作者: Laurens Samson, Iva Gornishka, Gossa Lô 发布时间: 2026-08-11 arXiv: 2508.03803

中文摘要

大语言模型越来越多地被部署在政府环境中,但现有的评估框架很少能同时反映公共行政的价值观和非英语环境的语言要求。我们提出了「Grip on LLMs」框架,这是一个与荷兰主要市政组织的领域专家合作开发的荷兰政府使用系统评估套件。通过咨询委员会流程、用户研究和对公务员聊天机器人用户的调查,我们确定了六个评估维度(事实性、诚实性、社会偏见、能耗、成本和训练数据透明度),并将它们转化为一个涵盖30多个多语言和荷兰特定模型的基准套件。我们的结果显示,没有单一模型在所有维度上表现出色,权衡是不可避免的:更高的质量始终伴随着更大的环境影响和财务成本,而偏见在很大程度上与两者无关。我们进一步发现,事实性(模型是否正确回答)和诚实性(模型是否承认不知道)由不同的属性决定,高事实性并不意味着高诚实性。为了使这些发现对非技术受众可操作,我们发布了一个公开可访问、用户友好的模型概览,专为参与政府LLM选择的全范围利益相关者设计,从工程师到政策制定者。

原文摘要

Large language models are increasingly being deployed in governmental settings, yet few existing evaluation frameworks jointly reflect the values of public administration and the linguistic requirements of non-English contexts. We present the 'Grip on LLMs' framework, a systematic evaluation suite for Dutch governmental use developed in collaboration with domain experts from a major Dutch municipal organisation. Through an advisory board process, user research, and a survey of the users of a civil-servant chatbot, we identify six evaluation dimensions (factuality, honesty, social bias, energy consumption, cost, and training data transparency) and operationalise them into a benchmark suite covering more than 30 multilingual and Dutch-specific models. Our results reveal that no single model ...

--- *自动采集于 2026-08-12*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens