当 LLM 看着你的 500 天手环数据发呆:WearableQA 暴露的健康推理鸿沟
场景:一个无声的失败
你戴了 500 天智能手环。心率、血氧、睡眠时长、步数、皮肤温度——每天几十个指标,连续记录了一年半。现在你问 AI:"我最近两周的静息心率比上个月高了多少?这正常吗?"
一个能在 MedQA 上考 90 分的 LLM,面对这个问题会怎样?
它会先从你的 500 天数据里找到最近两周的静息心率值,然后找到上个月的对应值,计算平均值差值,再把这个差值放到生理学语境里判断是否异常。听起来很简单——但 WearableQA 的测试结果显示,最强的模型在这种任务上也只有 72.9% 的准确率,最差的只有 19.6%,而随机猜的基线是 10%。
这意味着即使是最好的模型,也有超过四分之一的概率答错。而最差的模型,几乎和瞎猜差不多。
WearableQA 是什么
WearableQA 是一个针对可穿戴设备数据的健康推理基准。规模不小:4,084 道十选一的多选题,来自 200 个真实用户的可穿戴数据,每个用户最多有 500 天的每日测量记录。数据包括:
- 时间序列信号:心率、血氧、皮肤温度、步数、睡眠时长等
- 血液生物标志物:血脂、血糖、炎症指标等
- 人口统计信息:年龄、性别等
WearableQA 的核心设计是两条评估轴线:
轴线一:数据推理 vs 健康推理
- 数据推理:从原始测量值中计算趋势、异常、关系。比如"用户 A 在第 30-60 天的平均步数比第 0-30 天多多少?"
- 健康推理:在生理学语境下解释这些数据。比如"用户 B 最近一周的静息心率升高,可能提示什么健康问题?"
- 单信号:只看一个指标。比如只看心率。
- 跨信号:需要整合两个或更多信号。比如"用户 C 的睡眠时长下降是否和皮肤温度升高相关?"
双重锚定:如何从脏数据里构造可靠问题
从真实可穿戴数据出题,最大的挑战是怎么确定答案。
如果让人来出题,主观性太强,而且规模上不去。如果让 LLM 来出题,它可能编造不存在的生理学关系。WearableQA 用了一个叫"双重锚定"的框架:
锚定一:文献锚定。 从同行评审的生理学文献中提取已知的健康模式——比如"静息心率升高与睡眠不足相关"这种有文献支撑的发现。这保证了题目考察的关系在科学上是成立的。
锚定二:人群锚定。 从 200 个用户的真实数据中统计验证这些模式——比如在数据中确认静息心率升高确实和睡眠不足相关。这保证了题目考察的模式在真实数据中是可观测的。
然后,这些模式被实例化到每个用户的具体测量数据上,通过确定性计算生成问题和答案。整个过程还有审计和反馈循环来保证质量。
这个框架的精妙之处在于:它把"出题"从主观判断变成了确定性计算。 给定一个用户的数据和一个已验证的生理学模式,答案是唯一确定的——不是"大概是什么",而是"精确是什么"。
14 个模型的体检报告
WearableQA 测试了 14 个模型,包括闭源和开源。结果有几个值得注意的发现:
发现一:数据推理比健康推理更难。
这反直觉。你可能会想,从数据里算个数不是最简单的吗?知道静息心率升高的健康含义不是更难吗?
但结果恰恰相反。模型在"从原始测量值中计算"这件事上表现更差。 原因是:LLM 不擅长处理长序列数值数据。500 天的每日心率值,序列长度可能超过模型的上下文窗口;即使不超,模型也容易在中间步骤算错——它不是计算器,是语言模型。
而健康推理虽然需要医学知识,但至少是在"语言"这个模型擅长的模态里操作。模型可以调用预训练时学到的医学知识来辅助判断,但无法调用一个计算器来精确算数。
发现二:跨信号推理是分水岭。
强模型在单信号题目上表现不错,但一到跨信号题目,准确率明显下降。整合多个信号的能力,是区分强模型和弱模型的关键指标。
这和人类医生的诊断过程很像。一个实习医生可能能看懂单一指标异常,但要综合多个指标做出判断,需要经验积累。LLM 目前卡在"实习医生"阶段——单指标还行,多指标综合就力不从心。
发现三:开源模型差距明显。
开源模型在两个子集上都大幅落后于闭源模型。论文没有详细分析原因,但可能的解释是:开源模型在长上下文数值推理上的训练数据不够,且模型规模可能不足以同时处理多信号整合。
为什么这件事重要
WearableQA 揭示了一个被现有基准忽略的盲区:LLM 对"个体纵向数据"的推理能力严重不足。
现有医疗基准(MedQA、MedMCQA、PubMedQA)考的是医学知识——"以下哪种疾病会导致 X 症状?"这种题目,答案是通用知识。HealthBench 更进一步,模拟医患对话,但仍然是文本驱动的静态场景。
ECG-QA 引入了生理信号,但只看短时片段(一段心电图),不是个体的纵向历史。
WearableQA 填补了这个空白:它考察的是模型能否理解"一个具体的人"的长期健康数据,并做出针对这个人的判断。 这正是个性化健康助手需要的能力。
随着 LLM 驱动的健康助手开始落地(Apple Health AI、Fitbit AI 等都在路上),这个能力的评估变得越来越紧迫。如果一个 AI 健康助手连"你最近两周静息心率比上个月高了多少"都算不对,你怎么敢让它给你健康建议?
更深层的洞察:计算 vs 知识
WearableQA 的结果指向一个更根本的问题:LLM 是知识引擎,不是计算引擎。
模型在预训练时学到了海量的医学知识——疾病症状、药物作用、生理机制。这些知识在健康推理任务上可以直接调用。但当任务变成"从 500 天的数值序列中提取趋势并计算差值"时,模型需要的是精确计算能力,而不是知识。
这就像一个博览群书的医生,理论知识丰富,但给他一个计算器让他算"这个病人最近两周的平均心率比上个月高了多少",他可能算错——不是因为他不懂心率,而是因为他不擅长处理长序列数值。
解决方案可能不是让 LLM 变得更聪明,而是给它配工具。 让 LLM 负责理解问题和调用知识,让外部计算器负责数值计算,让数据库负责数据检索。这其实是 Agent 架构的核心思想——把推理和计算解耦,各做各的擅长的事。
WearableQA 的价值在于:它精确地测量了"LLM 在没有工具辅助时,对个体健康数据的推理能力有多差"。这个测量结果,可以作为未来 Agent 架构设计的基线——有了工具之后能改善多少,需要对照基线才知道。
局限与思考
WearableQA 也有局限。十选一的格式虽然便于评分,但可能高估模型能力——模型可能通过排除法猜对,而不是真正理解。200 个用户虽然不少,但相比全球可穿戴设备用户的多样性,仍然有限。血液生物标志物数据通常不是连续测量的,可能只是几个时间点的快照,这限制了纵向推理的深度。
另外,WearableQA 目前没有开源代码和数据。这对于社区复现和改进来说是个障碍。希望作者团队能尽快开放。
但作为一个"诊断工具",WearableQA 已经做到了它该做的:精确地暴露了 LLM 在个体健康数据推理上的短板。 接下来的问题是——谁来补这个短板?
---
论文: arXiv 2609.05405 数据规模: 200 用户 × 500 天 × 4,084 题 × 16 题型 模型范围: 14 个闭源+开源 LLM 准确率范围: 19.6% ~ 72.9%(基线 10%)