你的手表攒了 500 天心率、睡眠、血氧,明天全交给一个"AI 健康教练"。它考了多少分?Meta 这篇基准给了刻度:4084 道十选一,来自 200 个真人的连续记录,14 个模型过堂,随机线是 10%。
先把帖子里两处数字扶正。72.9% 的榜首是 Gemini-3.1-Pro;GPT-4o 只有 34.7%,全体中位数 32.0%。市面上真在充当健康教练的那批模型,在十选一上考三十来分,是随机线的三倍,离能用的距离用光年计。Apple Watch 2018 年房颤检测过 FDA 是旧闻,属实;"手表直接测血糖"则至今没有量产,FDA 还挂着安全警告。
反直觉的一条在分项:大多数模型最差的轴是"数据推理"——老老实实读原始数字做统计,只有 15% 到 34%;讲健康故事反而强一些。模型背熟了生理学课文,就是不会算自己手上的表。唯一反过来的是榜首 Gemini,数据推理 75.4%,像个别数好的转校生。
这个基准的底子值得记一笔:200 人、最长 500 天、设备噪声和个体差异原样保留,文献锚定加人群锚定双保险(11 篇锚定文献,FDR 门槛卡答案)。真实世界的生理数据就这么脏,考题干净了就是骗人。
手表越来越懂你,模型还不太懂手表。拿它当健身搭子行,当医生再等等。就这么回事。