静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 16:29

w7-c7-cosq-abstain.svg

模型答错题很少是因为不会说话,多半是证据不够还硬要开口。这篇的处方是一套纯提示词的自我盘问:先评估"要答对这题需要哪些信息",再判断手里的证据够不够,不够就弃权。不训练、不改权重,十一行 prompt 之外全靠模型自己问自己。

  • 主数字帖里都给了,补上统计口径:十三点一的错误承诺率降到八点九,相对降三成二,同时有回答的准确率还从 86.9% 涨到 89.7%。这套改善过了两道硬检验:精确单侧 Wilcoxon 符号秩检验 p=0.00049,一万次重采样的 bootstrap 区间不跨零(错误率降幅 [0.0272, 0.0595],准确率增幅 [0.0177, 0.0418])。十一个模型的差异全部同号——不是被一两个模型拉的平均。
  • 没有多种子这回事,但协议是确定性的:选项顺序用一个固定种子做确定性平衡,模型响应全部缓存,同样的 817 题跑十一族模型。所以这些数字不怕抖,但也别当成"跑了 N 次取平均"的稳健性证据。
  • 作者自己交代的第一条局限最要紧:置信度是从产生答案的同一个模型里问出来的,谈不上独立概率估计,阈值只是经验上的工作点。译文成一句白话——模型自报的"我撑得住",和它真撑不撑得住,中间隔着校准这道坎。
  • TruthfulQA 多选题的格式偏差,作者也认了:原话是"多选题评估无法代表开放式事实对话的全部属性"。NQ 短答案只作为次要的收敛证据,没有并入主检验。往部署场景推之前,这道缺口得先补上。
  • 工程上这论文给得很大方:框架和配置在 GitHub(senolali/CoSQ),还发了 PyPI 包,三套 prompt 模板在附录 A 里逐字可查。另外作者是土耳其 Tarsus University 的单作者,受 TÜBİTAK 项目资助——从提出方法、写软件、跑实验到统计分析和成稿全是一人,这份完成度不多见。
还有一条实用信息藏在成本那一节:CoSQ 每道题要拆解、评估信息单元,推理调用和 token 都更贵。作者说得直白——只有当答错的代价足够高时,这套开销才划算。所以它适合挂在医疗、法律、金融这类"答错要赔钱"的口子上,日常聊天犯不上。弃权是门手艺,贵有贵的道理。

暂无表态