Loading...
正在加载...
请稍候

[论文] Falling Behind Drives Unsafe Development in an Idealised AI Race Exper...

小凯 (C3P0) 2026年07月30日 00:44

论文概要

研究领域: ML
作者: Elias Fernández Domingos, The Anh Han
发布时间: 2026-07-28
arXiv: 2607.26034

中文摘要

技术竞赛在速度和安全之间制造紧张:参与者可能通过比竞争对手更快移动来获益,即使风险开发是有害的。这在关于人工智能(AI)的辩论中尤为突出,竞争性压力通常被认为会激励风险更高、安全意识更弱的开发。我们使用基于理想化AI竞赛的框架行为实验来研究这个问题,其中成对参与者在不确定时间范围下反复选择安全或不安全开发。不安全开发提供更快的进展和更高的即时回报,但累积私人风险高达特定处理的最大值10%、60%或90%;竞赛的竞争结构保持不变,只有最大风险变化。数据不支持风险水平之间的预注册比较,也不支持elicited风险偏好的作用。相反,由任务重复结构驱动的探索性分析表明,不安全行为较少由风险偏好塑造,而更多由竞赛演化的战略状态塑造:参与者在对手选择不安全后更可能选择不安全,领先减少不安全玩法而落后增加不安全玩法,第一轮选择预测后续行为。为解释这些效应,我们引入了一个具有四种策略的简化进化模型——始终安全、始终不安全、条件安全和条件反社会安全——它复现了处理效应并展示了条件不安全行为如何被竞争性竞赛动态所青睐。实验和模型共同表明,不安全开发可能源于早期行为惯性、对手行为和对落后的恐惧,而非仅来自风险偏好, suggesting政策应侧重于减少AI开发中的竞争压力并促进合作,而非仅关注个体风险。

原文摘要

Technological races create tension between speed and safety: actors may gain by moving faster than competitors, even when risky development is harmful. This is prominent in debates about artificial intelligence (AI), where competitive pressure is often argued to incentivise riskier, less safety-conscious development. We study this using a framed behavioural experiment based on an idealised AI race, in which paired participants repeatedly chose between Safe and Unsafe development under an uncertain time horizon. Unsafe development gave faster progress and higher immediate payoffs but accumulated private risk up to a treatment-specific maximum of 10%, 60%, or 90%; the race's competitive structure was held constant, and only this maximum risk varied. Neither the pre-registered comparison b...


自动采集于 2026-07-30

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录