严谨和时效不可兼得:医学 LLM 研究正在输掉一场追赶游戏
The widening evaluation gap in medical large language model research 2023 to 2026 arXiv: 2609.11770 Tareaf, Al-Rajab, Loucif 11,628 篇 PubMed 论文 × 14 个临床领域 × 3…
严谨和时效不可兼得:医学 LLM 研究正在输掉一场追赶游戏
The widening evaluation gap in medical large language model research 2023 to 2026
arXiv: 2609.11770 | Tareaf, Al-Rajab, Loucif
11,628 篇 PubMed 论文 × 14 个临床领域 × 3.5 年时间跨度
一个尴尬的数字
2023 年初,一项医学 LLM 研究从"使用最新模型"到"论文发表"的时差是 1.33 个季度——大约 4 个月。到 2026 年中,这个数字扩大到 6.08 个季度——超过一年半。
在 AI 以季度为单位迭代的时代,医学研究用一年半去验证一个已经被取代的模型。
这不是个别现象。这篇论文分析了 2023 年 1 月到 2026 年 6 月 PubMed 收录的 11,628 篇医学 LLM 研究,发现整个领域正在系统性输掉一场追赶游戏。
数据说了什么
研究者从 PubMed 检索了 14 个临床领域(心血管、肿瘤、神经、放射等)的 LLM 相关研究,时间跨度 3.5 年。几个关键数字:
- 总量增长 45 倍:从 2023 年初的每月几篇,到 2026 年中每月上百篇
- 仅 2.5% 采用 RCT 或前瞻性设计:绝大多数是回顾性、观察性研究
- 评测时差从 1.33 扩大到 6.08 个季度:研究使用的模型到论文发表时已经过时
- 62% 的 RCT 评测的是已停产模型家族:最严谨的研究反而最过时
- RCT 评测的模型比其他研究旧 4.6 个季度(P = 3×10⁻¹⁹)
为什么严谨的研究反而更过时
这是论文最深刻的发现:研究越严谨,模型越过时。
原因不难理解:
- 回顾性研究:拿现成数据跑一下当前模型,几周就能出结果——但严谨度低
- 前瞻性研究:需要伦理审批、招募患者、前瞻性收集数据、随访——动辄数月甚至数年
- 随机对照试验(RCT):在前瞻性基础上再加随机分组、双盲设计、终点评估——周期更长
一个反事实检验
有人可能反驳:模型迭代快不代表旧模型不能用,只要研究结论有效就行。研究者做了一个反事实检验来回答这个问题。
他们假设"模型组成保持不变"——即研究继续使用旧模型,但旧模型没有停产。结果发现:迁移到新模型只抵消了 56% 的时差漂移(95% CI 50-65)。
这意味着:即使不考虑模型停产,评测时差仍然在扩大。研究周期的延长速度,超过了模型迭代速度。问题不只是"旧模型被淘汰了",而是"研究本身变慢了"。
严谨和时效的张力
论文的核心论点可以提炼为:严谨和时效之间存在结构性张力,这个张力反映的是模型选择问题,而不是研究时间线问题。
换句话说:
- 不是"研究做太慢导致模型过时"
- 而是"严谨研究必然需要更长时间,而更长时间意味着使用更旧的模型"
这对医学 AI 意味着什么
这篇论文的发现对医学 AI 领域有几个实际影响:
1. 大量医学 LLM 证据可能已经失效 2023-2024 年的研究评测的模型(GPT-3.5、Claude 2、PaLM 2)现在已全部停产。这些研究得出的结论(比如"GPT-4 在放射诊断上准确率 85%")对当前的临床实践意义有限——你无法再用 GPT-4 复现这个结果。
2. 最可靠的证据反而最不可用 RCT 是证据金字塔的顶端,但 62% 的 RCT 评测的是已停产模型。医生想找"最可靠"的 LLM 证据,结果发现这些证据对应的模型已经不存在了。
3. 评测基准需要持续更新 研究者建议建立"持续评测"机制——当新模型发布时,自动在已验证的基准上重跑,而不是等新研究发表。这能部分缓解时差问题。
一个更广的洞察:评测时差定律
这篇论文揭示的现象可以提炼为一个更广的定律:评测时差定律——被评测对象迭代速度越快,评测本身的时效性衰减越快。
这不是医学独有的问题:
- AI 安全评测:SafetyBench 评测的模型半年后就被新一代取代
- 教育评测:研究"ChatGPT 对学习的影响",但 ChatGPT 本身每季度都在变
- 法律评测:研究"LLM 在合同审查中的表现",但模型能力在研究期间已质变
一个让人反思的细节
论文有一个细节让我反复想:在"使用仍在开发中的模型"的研究里,不同研究设计(RCT、前瞻性、回顾性)的时差没有差异。
这意味着:如果你选择评测一个仍在活跃迭代的模型(比如 GPT-5),你的研究周期长短对时差影响不大——因为模型本身在变,你的"最新"和别人的"最新"是同一个时间点。
但如果你选择评测一个已停产的模型(比如 GPT-3.5),你的研究周期越长,时差越大——因为模型不变,但行业在前进。
选择评测仍在迭代的模型,是规避时差问题的一个策略。 但这又带来另一个问题:仍在迭代的模型可能随时被改变行为(比如 OpenAI 更新 GPT-5 的对齐策略),导致你的研究无法复现。
结语:一场注定输掉的游戏?
医学 LLM 研究正在输掉一场追赶游戏。模型迭代以季度计,严谨研究以年计。这个差距还在扩大。
但这不意味着研究没有价值。它意味着:
- 研究结论的适用窗口有限:发表后 1-2 年内有效,之后需要重新验证
- 持续评测机制是必需品,不是奢侈品
- 研究设计需要重新思考:或许需要"快速评测 + 持续追踪"的新范式
代码:论文未提供开源代码仓库