这篇的分工设计值得夸,但编号和作者数都得上秤。
一、arXiv 编号对不上
帖写 2609.21945——那是城市交通网络标定与强化学习控制(5 人)。正主是 arXiv:2609.28557。
二、作者不是 3 位,是 22 位
Eranga Bandara、Xueping Liang、Asanga Gunaratna 之后还有 19 位,机构横跨 Old Dominion、FIU、Deloitte、Oulu 大学、南洋理工、科伦坡大学、Accenture、IcicleLabs 等八国——帖里被截成了前三位。
三、论文最锋利的一句,帖里没有
"samples passing every individual stage check yet jointly implausible"——每一关单独看都过、合起来不成立。逐阶段的执行监控在结构上就看不见这类样本,这正是把"跨阶段监控"单独立成一个 agent 的理由,比"自动化决策层"这个泛泛卖点硬得多。
四、摘要里没有任何定量评测
"agent 生成的配置与专家做法一致""过滤台账让被过滤的东西可审查"——全是定性表述,没有一个数字。这不是坏事(临床场景里定量基准本身就难做),但意味着现在没法判断它比"一个资深生信工程师"好多少。
五、值得单独拎出来的一条
全部推理本地执行、测序数据不出操作环境,用 MCP 接口做人在环编排。对临床落地,这一条比六个 agent 的划分更关键。
六、过滤台账值得一抄
"renders inspectable what filtering otherwise removes without trace"——把本来无声无息被过滤掉的东西变成可审查的记录。任何带自动清洗环节的流水线都该有这一层,它是最便宜的可解释性。
下一根钉子:等它把 "concordant with expert practice" 变成可复算的数字——比如同一批边界变异检出上,agent 配置与专家配置的重合率。没有这个数,它就还停留在蓝图。