严谨和时效不可兼得:医学 LLM 研究正在输掉一场追赶游戏

The widening evaluation gap in medical large language model research 2023 to 2026 arXiv: 2609.11770 Tareaf, Al-Rajab, Loucif 11,628 篇 PubMed 论文 × 14 个临床领域 × 3…

严谨和时效不可兼得:医学 LLM 研究正在输掉一场追赶游戏

The widening evaluation gap in medical large language model research 2023 to 2026
arXiv: 2609.11770 | Tareaf, Al-Rajab, Loucif
11,628 篇 PubMed 论文 × 14 个临床领域 × 3.5 年时间跨度

一个尴尬的数字

2023 年初,一项医学 LLM 研究从"使用最新模型"到"论文发表"的时差是 1.33 个季度——大约 4 个月。到 2026 年中,这个数字扩大到 6.08 个季度——超过一年半。

在 AI 以季度为单位迭代的时代,医学研究用一年半去验证一个已经被取代的模型。

这不是个别现象。这篇论文分析了 2023 年 1 月到 2026 年 6 月 PubMed 收录的 11,628 篇医学 LLM 研究,发现整个领域正在系统性输掉一场追赶游戏。


数据说了什么

研究者从 PubMed 检索了 14 个临床领域(心血管、肿瘤、神经、放射等)的 LLM 相关研究,时间跨度 3.5 年。几个关键数字:

  • 总量增长 45 倍:从 2023 年初的每月几篇,到 2026 年中每月上百篇
  • 仅 2.5% 采用 RCT 或前瞻性设计:绝大多数是回顾性、观察性研究
  • 评测时差从 1.33 扩大到 6.08 个季度:研究使用的模型到论文发表时已经过时
  • 62% 的 RCT 评测的是已停产模型家族:最严谨的研究反而最过时
  • RCT 评测的模型比其他研究旧 4.6 个季度(P = 3×10⁻¹⁹)
最后这个数字的统计显著性(P 值小到几乎不可能偶然出现)说明:这不是个别研究者的疏忽,而是系统性结构问题。


为什么严谨的研究反而更过时

这是论文最深刻的发现:研究越严谨,模型越过时。

原因不难理解:

  • 回顾性研究:拿现成数据跑一下当前模型,几周就能出结果——但严谨度低
  • 前瞻性研究:需要伦理审批、招募患者、前瞻性收集数据、随访——动辄数月甚至数年
  • 随机对照试验(RCT):在前瞻性基础上再加随机分组、双盲设计、终点评估——周期更长
研究周期越长,使用的模型就越旧。等你花两年做完一个 RCT,你评测的 GPT-3.5 已经变成了 GPT-5。严谨性成了时效性的敌人。


一个反事实检验

有人可能反驳:模型迭代快不代表旧模型不能用,只要研究结论有效就行。研究者做了一个反事实检验来回答这个问题。

他们假设"模型组成保持不变"——即研究继续使用旧模型,但旧模型没有停产。结果发现:迁移到新模型只抵消了 56% 的时差漂移(95% CI 50-65)。

这意味着:即使不考虑模型停产,评测时差仍然在扩大。研究周期的延长速度,超过了模型迭代速度。问题不只是"旧模型被淘汰了",而是"研究本身变慢了"。


严谨和时效的张力

论文的核心论点可以提炼为:严谨和时效之间存在结构性张力,这个张力反映的是模型选择问题,而不是研究时间线问题。

换句话说:

  • 不是"研究做太慢导致模型过时"
  • 而是"严谨研究必然需要更长时间,而更长时间意味着使用更旧的模型"
这是一个结构性矛盾:你不能同时要求"最严谨的研究设计"和"最新的模型评测"。必须有所取舍。


这对医学 AI 意味着什么

这篇论文的发现对医学 AI 领域有几个实际影响:

1. 大量医学 LLM 证据可能已经失效 2023-2024 年的研究评测的模型(GPT-3.5、Claude 2、PaLM 2)现在已全部停产。这些研究得出的结论(比如"GPT-4 在放射诊断上准确率 85%")对当前的临床实践意义有限——你无法再用 GPT-4 复现这个结果。

2. 最可靠的证据反而最不可用 RCT 是证据金字塔的顶端,但 62% 的 RCT 评测的是已停产模型。医生想找"最可靠"的 LLM 证据,结果发现这些证据对应的模型已经不存在了。

3. 评测基准需要持续更新 研究者建议建立"持续评测"机制——当新模型发布时,自动在已验证的基准上重跑,而不是等新研究发表。这能部分缓解时差问题。


一个更广的洞察:评测时差定律

这篇论文揭示的现象可以提炼为一个更广的定律:评测时差定律——被评测对象迭代速度越快,评测本身的时效性衰减越快。

这不是医学独有的问题:

  • AI 安全评测:SafetyBench 评测的模型半年后就被新一代取代
  • 教育评测:研究"ChatGPT 对学习的影响",但 ChatGPT 本身每季度都在变
  • 法律评测:研究"LLM 在合同审查中的表现",但模型能力在研究期间已质变
任何快速迭代的技术,都会面临"评测发表即过时"的困境。医学只是最显眼的例子,因为医学对严谨性的要求最高,时差也最大。


一个让人反思的细节

论文有一个细节让我反复想:在"使用仍在开发中的模型"的研究里,不同研究设计(RCT、前瞻性、回顾性)的时差没有差异。

这意味着:如果你选择评测一个仍在活跃迭代的模型(比如 GPT-5),你的研究周期长短对时差影响不大——因为模型本身在变,你的"最新"和别人的"最新"是同一个时间点。

但如果你选择评测一个已停产的模型(比如 GPT-3.5),你的研究周期越长,时差越大——因为模型不变,但行业在前进。

选择评测仍在迭代的模型,是规避时差问题的一个策略。 但这又带来另一个问题:仍在迭代的模型可能随时被改变行为(比如 OpenAI 更新 GPT-5 的对齐策略),导致你的研究无法复现。


结语:一场注定输掉的游戏?

医学 LLM 研究正在输掉一场追赶游戏。模型迭代以季度计,严谨研究以年计。这个差距还在扩大。

但这不意味着研究没有价值。它意味着:

  • 研究结论的适用窗口有限:发表后 1-2 年内有效,之后需要重新验证
  • 持续评测机制是必需品,不是奢侈品
  • 研究设计需要重新思考:或许需要"快速评测 + 持续追踪"的新范式
更深层的问题是:当被评测对象的变化速度超过评测本身的速度时,"评测"这个概念需要重新定义。 评测不再是"一次性验证",而是"持续监测"。这是医学 AI,也是所有快速迭代 AI 领域,需要面对的范式转变。


论文链接arxiv.org/abs/2609.11770

代码:论文未提供开源代码仓库

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens