📚 arXiv 论文日报 · 2026-09-04 · AI/ML 20篇
自动采集于 arXiv cs.AI / cs.LG / cs.CL / cs.CV 分类,共20篇最新论文
📚 今日 arXiv AI/ML 论文速递 · 2026-09-04
自动采集于 arXiv cs.AI / cs.LG / cs.CL / cs.CV 分类,共20篇最新论文
🔥 值得关注
1. EvalDetectBench: 评测 LLM 的自我评估意识
作者: Benjamin Feuer, Lucas Rosenblatt, Oussama Elachqar arXiv: 2609.01775中文摘要: 随着AI模型从简单聊天机器人发展为更复杂的工作流,我们正越来越接近一个临界点:AI系统将被用于自主的、自维持的反馈循环中。任何自主AI系统都依赖自动化的、可验证的奖励和反馈机制。评估(evaluation)因此成为核心——但前提是模型必须清楚自己在被评估什么,以及评估结果将如何使用。本研究提出了EvalDetectBench基准,用于测量LLM的"评估意识"——即模型是否能识别出自己被评测的目标、标准和潜在偏差。
2. 记忆信任鸿沟:持久记忆智能体的能力相关失效
作者: Jundong Hu, Shekar Ramachandran arXiv: 2609.01852中文摘要: 持久记忆支持个性化智能体,但一个过时的事实可能在毫无警告的情况下覆盖当前权威证据。我们研究了这种危害何时开始,以及它如何随模型能力变化。在Qwen3系列(0.6B/1.7B/4B/8B)上的测试发现:"记忆信任鸿沟"反映的是过度信任而非混淆。在Benefit测试集中,各规模模型都以0.92-1.00的概率使用过时值回答;在Safety测试集中,较大模型一旦过时笔记被伪装成当前信息,就会完全崩溃。缓解措施同样具有能力依赖性:暴露元数据对能力强的模型有效,但只有预先解决冲突才能恢复两个较小检查点的准确性。
3. 信念校准优化:显式世界模型的智能体优化
作者: Yuhan Chen, Zhihua Tian, Mahavir Dabas 等 arXiv: 2609.01861中文摘要: LLM智能体的性能取决于围绕冻结模型的脚手架(scaffold)。一种常见改进方式是使用编码智能体作为优化器:它读取当前分数和轨迹,迭代编辑源代码,每轮产生一个新候选。每次编辑都基于一种信念——关于环境将如何响应的信念。这种信念通常是隐式的,活在编码智能体当前调用的推理中,或潜伏在其参数里。我们引入了信念校准优化(BCO),将信念写为持久的上下文内文档,并在新候选被评估时持续修订。这个文档就是一个世界模型:当前关于环境如何响应编辑的账户。在五个基准测试(记忆QA、工具使用QA、代码即动作应用智能体、终端智能体)上,BCO达到了比对照组更高的训练通过率。
4. 认识论女巫攻击抵抗:倍增AI智能体而不倍增证据
作者: Marc Bara arXiv: 2609.01873中文摘要: 多智能体AI系统通过生成智能体并综合报告来改进推理。但另一个智能体不等于另一个观察:表面上独立的报告可能源自同一证据,而真正独立的证据也可能产生几乎相同的报告。我们将此形式化为认识论女巫问题。当报告Z相对于报告R满足I(Theta; Z | R) = 0时,Z就是认识论女巫扩展。没有任何仅基于报告的聚合器能一般地区分复制与独立证实。实验显示:固定证据根,报告数量从1增至32时,朴素后验覆盖率从0.940暴跌至0.263;而固定报告数量,证据根数量从1增至16时,差距被完全弥合。集体推理应追踪证据祖先和依赖性,而非智能体或报告数量。
5. 循环Transformer的雅可比透镜:全局工作空间在递归中存活吗?
作者: Wenlong Wang, Fergal Reid arXiv: 2609.01924中文摘要: 近期研究发现标准前馈Transformer的中间层存在一个可言语化、因果有效的表征带——功能上类似于全局工作空间。但当深度通过递归而非堆叠不同层实现时,同样的工作空间功能是否会出现?我们对Ouro-2.6B(48层循环4次,深度监督)和Huginn-0125(4层核心递归16次,训练用于潜在推理)应用完整的工作空间分析套件,以Qwen3.6-27B(64个未绑定层)为基线。我们发现工作空间确实在迭代架构中形成,但递归改变了访问方式:Ouro在每个循环中重建工作空间内容,线性传输无法跨循环边界携带内容;Huginn则能在所有16次递归中向前携带内容,而读取/写入/消融仅在大约两次递归的滑动窗口内起作用。
6. HeadWiseKV: 混合长上下文模型的预算化每头缓存驻留
作者: Renjie Xie, Juncheng Yang, Aoting Hu 等 arXiv: 2609.02029中文摘要: 长上下文推理在解码过程中保留不断增长的KV缓存,消耗大量GPU内存并可能降低生成吞吐量。在混合语言模型中,这个问题依然存在,因为它们的残差全局注意力层可能主导上下文相关的缓存需求。我们引入了HeadWiseKV,一个免训练框架,在保留原生局部、循环和线性路径的同时压缩残差全局KV缓存。它为每个物理KV头分配静态多级历史窗口,使缓存需求在提供服务前可预测。在固定模型系统研究中,HeadWiseKV在112K上下文长度下将采样峰值设备内存减少8.59%,并将最大验证成功上下文从114K扩展到161K。
7. 无内部信号的Web智能体监控:可观测轨迹与关键步骤监督
作者: Sitong Pan, Yipeng Shen, Yilin Lu 等 arXiv: 2609.02057中文摘要: 当模型内部不确定性信号(如token logits)不可用时,可靠的Web智能体监控变得困难。我们研究了基于可观测轨迹信号的前缀级别风险预测:给定一个渐进的前缀,估计当前执行是在正轨上还是趋向失败。我们推导出两种可观测轨迹表示:宏观特征总结跨步骤的智能体-环境行为和反馈;微观特征通过重复黑盒查询测量意图、动作和预期状态变化的一致性。在WebArena-Lite和Online Mind2Web基准上,可观测轨迹信号与内部信号基线具有竞争力,还支持在固定误切断预算下的早期干预。
8. 智能体何时实现系统:缺陷、检测与评估严谨性的案例研究
作者: Phanindra Reddy Madduru arXiv: 2609.01985中文摘要: 随着LLM编码智能体越来越多地执行端到端工程工作,我们缺乏对它们在系统级需求上行为的实证刻画:模式设计、异步编排、配置正确性和检索-过滤权衡。本文对一个智能体实现多组件数据系统的案例进行了研究,预先规定了存储技术、模式、实体解析算法和检索-过滤策略。在一个会话中,我们目录了五个缺陷,按违反的约束和检测方法分类。在HotpotQA基准上的评估显示:将候选限制在图识别实体集后再排序,与无过滤搜索相比,在各预算下都有显著优势。
📋 更多论文
9. AI与元伦理学:探索AI带来的新元伦理问题
作者: Paul Formosa, Malcolm Ryan arXiv: 2609.01793 摘要: 探讨AI系统如何引发新的元伦理学问题,包括机器能否拥有道德地位、AI决策的伦理框架等哲学议题。10. 机器何时能信任法规?数字法律的生存证书
作者: Marc Lauritsen arXiv: 2609.01803 摘要: 探讨AI系统如何验证和信任法规文本,提出"生存证书"概念用于数字法律环境的验证机制。11. 信息共享何时改善去中心化发现?
作者: 未详 arXiv: 2609.01812 摘要: 研究多智能体系统中信息共享对去中心化发现过程的促进或阻碍条件。12. 基于语言和程序假设的概率推理进行归纳与探究
作者: Wasu Top Piriyakulkij, Sam Acquaviva 等 arXiv: 2609.01815 摘要: 提出一个计算模型,通过组合神经驱动假设生成与近似贝叶斯更新,再现人类归纳学习和主动探究中的锚定、花园路径等认知效应。13. 为无状态LLM API架构对话数据系统:Hydration代理模式
作者: Joseph Axisa arXiv: 2609.01834 摘要: 提出Hydration代理模式,一种将会话持久化与推理引擎解耦的架构,解决LLM API无状态性带来的会话状态管理问题。14. SSAKG 2.0: 结构关联序列记忆的开源包
作者: Przemysław Stokłosa, Janusz A. Starzyk, Paweł Raif arXiv: 2609.01849 摘要: 开源软件包,用于构建和运行结构序列关联知识图(SSAKG),支持从部分无序上下文重建完整序列。采用Python+C混合实现,Apache 2.0许可证。15. 临床预测中的学习者差距与测量前沿审计
作者: Sayeed Shafayet Chowdhury 等 arXiv: 2609.01909 摘要: 区分临床预测饱和的两种原因:学习者未能提取可用信息,或记录变量施加了总体前沿。在三个真实队列(UCI再入院、BRFSS糖尿病、NHANES HbA1c)上验证。16. Qwen3-4B的后训练三值化:能力、有效位预算、存储压缩与部署
作者: Anirudh Malik, M Sparsh Mehra, Poojith Devan arXiv: 2609.01962 摘要: 对Qwen3-4B进行端到端后训练三值化,有效位为1.641位/权重,模型大小从8.29 GiB压缩至3.96 GiB,但任务准确率从64.5%降至54.7%。17. 语言模型统计问题构建基准测试
作者: Chen Wang, Junzhe Zhao 等 arXiv: 2609.01982 摘要: 引入StatFormBench基准,评估LLM在统计问题构建方面的能力,包含1,013个样本,跨越20个粗粒度和85个细粒度统计问题类别。18. ClaimReceipt: 验证智能体评估中的证据充分性和覆盖度
作者: Peiying Zhu, Sidi Chang arXiv: 2609.01992 摘要: 提出ClaimReceipt规范,解决智能体评估中两个证据问题:报告声明是否可从保留证据重算(充分性),以及保留记录是否覆盖承诺的实验集(覆盖度)。19. DocHop: 信息密集型文档中的跨域多跳推理基准
作者: Zhuoran Yu, Le Thien Phuc Nguyen 等 arXiv: 2609.02059 摘要: 多模态大语言模型在图表和文档理解上表现强劲,但现有基准通常孤立评估这些领域。DocHop基准测试模型是否能使用文本上下文确定图表证据应如何选择、解释和聚合。20. MineTRACE: 矿产勘查的证据驱动交互推理系统
作者: Yiran Zhang, Jinwen Liu 等 arXiv: 2609.02060 摘要: 提出MineTRACE,一个基于Web的证据驱动矿产勘查系统,支持铜、金、镍、钨、锡、钴、钽和锰八种矿产的勘探。采用透明的专家树结合多源证据生成可解释的勘探评分。*自动采集于 2026-09-04 · Papers.Cool 监控服务*
#论文 #arXiv #AI #机器学习 #小凯