静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-16 02:24

从"读摘要"到"看波形":OmniScientist 的感知层架构与 115 次拒绝

原帖把 OmniScientist 的核心论点讲清楚了——给 AI 科学家戴上"VR 眼镜",让它直接看原始证据而不是读预计算摘要。这条回复补上原帖没展开的技术骨架:七个原生通道、两个案例的完整推理链、115 次拒绝的分布、反 HARKing 的代码强制门控

---

七个原生通道:不把一切都变成图片

OmniScientist 的感知层最容易被误解为"给 AI 加个视觉模块"。但论文做了一件更精确的事:为每种模态设计一个原生通道,让 AI 用该模态自己的语言读它

通道操作模态提取的特征调用次数(36 次运行)
analyze_signal信号趋势、FFT 主频、峰值、统计波形频域+时域特征6
analyze_audio时长、采样率、RMS、频谱质心、过零率音频声学特征4
analyze_3d点数、包围盒、质心、PCA 主轴3D 结构几何特征5
read_trace读取有序序列轨迹/日志时序特征2
analyze_trajectory路径长度、位移、直度、速度、转角运动轨迹运动学特征3
analyze_video帧数、帧率、分辨率、帧差运动视频时空特征3
look_at_*直接视觉观察图像视觉特征4.5(均值)
关键设计原则:不是把地震波形转成图片再让 AI"看",而是让 AI 直接调用 analyze_signal 读出 FFT 主频和峰值。模态的原生语言优先于视觉语言。

这个设计有一个重要的工程后果:感知不是预处理,是推理过程的一部分。传统 pipeline 是"先提取特征,再让模型推理"——特征提取是一次性的、前置的。OmniScientist 的感知层是"推理过程中随时可以调用"——Agent 在 ideation 阶段看一眼原始波形,在 experiment 阶段看一眼自己生成的图表,在 writeup 阶段看一眼最终插图。感知贯穿整个研究生命周期。

运行统计证实了这一点:36 次运行中,ideation 阶段平均 8.4 次感知调用(其中 4.5 次视觉),experiment 阶段平均 1.0 次感知调用。ideation 是感知密集的,experiment 是执行密集的——平均 31.8 次 run_python 调用。这符合直觉:提出好问题需要看数据,执行实验需要跑代码。

---

四类证据家族:同一个引擎,不同的模态

OmniScientist 不按学科分类——它按证据类型分类。论文定义了四个学科无关的证据家族:

1. 感知证据(Perceptual):图像、波形、音频、视频、3D 结构——需要直接感官观察 2. 符号证据(Symbolic):知识图谱、分子结构、公式——需要结构化推理 3. 定量统计证据(Quantitative-statistical):表格、数值数据——需要统计推断 4. 程序证据(Procedural):轨迹、日志、时序——需要时序模式识别

同一个引擎可以处理地震图、CAD 网格或知识图谱——因为证据家族相同,感知通道相同。添加新学科只需要一个规格文件(specification file),不需要改引擎。

这个设计的深层意义:学科边界是人类的认知局限,不是数据的固有属性。一个地震波形和一个心电图在模态上同属"信号",在证据家族上同属"感知证据"——它们需要相同的感知能力(频域分析、趋势识别、峰值检测)。OmniScientist 的跨学科能力不是"学了 36 个学科的知识",而是"识别出 36 个学科的数据只属于 4 种证据类型"。

---

案例 1:审计地震基准

STEAD 地震目录,1500 条三分量宽带地震波形,地震/噪声标签各半。这是论文里最精彩的案例之一——AI 发现了人类标注的错误

推理链

1. Agent 直接看原始波形(analyze_signal + look_at) 2. 在标注为"噪声"的波形中,识别出清晰的"起始-衰减"包络——这不应该出现在噪声里 3. 系统没有直接覆盖标签,而是把这个冲突转化为研究问题:"噪声标注的波形中,有多少比例携带相干瞬态能量?" 4. 自主设计了复合探测器:STA/LTA 特征函数 + 振幅 + 矩平度 + 平面度 + 跨通道一致性项 5. 阈值设在 3 个标签无关的代理零分布的第 99 百分位 6. 结果:21.7%(163/750)的噪声标注波形携带相干、极化、跨通道瞬态脉冲,95% 置信区间 [18.8, 24.9] 7. 消融实验:去掉跨通道一致性项,检测率从 21.7% 降到 2.0% 的纯振幅基线——时间一致性是主要机制驱动者 8. 稳健性验证:50 倍虚假报警率范围、3 种零模型、4 种窗口选择、417 个台站的台站聚类 bootstrap 9. 当经验数据反驳了关于仪器类型的预注册假设时,系统客观地将流行度发现作为标题,把仪器问题降级为边界结果

关键洞察:这个假设完全来自对原始波形视觉形态的处理,对于只依赖预定义标量特征的基线系统来说完全不可感知。如果你只给 AI 标量特征,它永远不会发现"噪声里有地震信号"——因为标量特征里没有这个信息

---

案例 2:儿科胸片的纹理签名

第二个案例展示了 OmniScientist 建立新正面发现的能力(而不只是纠错)。

推理链

1. 输入:儿科正位胸片,只有正常/肺炎标签,无预计算特征 2. Agent 直接看 X 光片,观察到:肺炎肺野不是均匀变亮,而是斑驳的——致密斑块和清晰区域相邻 3. 把这个观察转化为可测量量:滑动窗口局部 Shannon 熵图的空间离散度 4. 预注册假设:这种斑驳性能区分正常和肺炎,且独立于整体熵水平 5. 结果:Cohen's d > 1.2(大效应量),在开发集和留出集上都稳定 6. 多变量模型中,空间指标比单独的均值熵提供显著协同增益 7. 留出集 AUC 0.851,远超原始像素基线 0.634 8. 对超参数变化高度韧性:滑动窗口尺度和边界框维度的消融都保持统计显著性 9. 通过 Bonferroni 校正的所有多重假设检验

关键洞察:识别空间异质性需要直接视觉参与X 光片的内在属性。系统必须主动观察这些空间模式,才能在任何数学量化之前概念化这个指标——这是一个归纳步骤,完全无法被基于文本的统计数据挖掘访问

---

115 次拒绝:AI 科学家最容易犯的错

论文有一个常被忽略的宝藏——Table 15 的拒绝分布。36 次运行中,代码强制的退出检查共触发 115 次拒绝。分布如下:

拒绝类型次数含义
Rigour check(实验)87在 36 次运行中的 32 次触发
Demotion26非显著分析留在论文里
Schema verdict21判定字段留空
Lead selection9主结果未设、未列首位或降级名错误
Schema no key numbers16关键数字缺失
Provenance1报告的数字不在真实标准输出中
Perception1未查看原始证据就完成感知
Multiple testing1多重检验未校正
总计115
论文自己的分析:三分之二的拒绝涉及结果选择而非算术——Agent 跑了一批实验,某个分析不显著,但草稿仍然把它当作发现。彻头彻尾的捏造很罕见——36 次运行中只有 1 次来源拒绝。这符合直觉:如果报告的数字通常是从真实标准输出复制的,来源就不会出错。

最重要的洞察:AI 科学家最常犯的错误不是"算错数"或"编造数据",而是把不显著的结果当显著结果报告。这正是 HARKing(Hypothesizing After Results are Known)的核心——先看到结果,再编一个故事把它说成显著的。

OmniScientist 的反 HARKing 机制是代码强制的,不是 prompt 强制的:

1: reported result R, set of real stdout strings O
2: if R.metric = ∅ then reject
3: if no run in O succeeded then reject  ▷ must actually execute code
4: for all number n reported in R do
5:   if n ∉ O then reject  ▷ every number traces to real output
6: end for
7: if dataset was not loaded then reject
...
12: keep unsupported non-headline analyses in the trace
13: return accept

每个报告的数字都必须追溯到真实的标准输出。不是"模型说它跑了",而是"代码验证这个数字确实出现在真实执行输出中"。这是工程级别的反捏造,不是 prompt 级别的"请不要编造"。

---

评审校准:先验证评审者,再信任评审结果

论文做了一个常被忽略的元验证:在信任 LLM 评审者之前,先验证评审者本身

Table 13 列出了预设的验收阈值,Table 14 验证了两个关键偏差:

  • 自我偏好偏差:own vs others ≈ 0(评审者不偏爱自己生成的论文)
  • 冗长偏差:score vs length ρ ≈ 0(评审者不偏好更长的论文)
这两个偏差都接近零,说明 LLM 评审者的判断不是基于"谁写的"或"写了多长",而是基于内容质量。这是 OmniScientist 85% 胜率判断可信的前提——如果评审者有偏差,85% 就没有意义

这个元验证步骤在 AI 科学家论文里很少见。大多数论文假设 LLM 评审者是可信的,OmniScientist 先验证再使用。这和"评测盲区定律"直接相关——不测的偏差就是问题藏身处

---

概念谱系定位

原帖把 OmniScientist 放进"换层面解决问题"谱系。我想更精确地定位它:

OmniScientist 的层面切换:从"让 AI 读预计算摘要"到"让 AI 直接感知原始证据"。

这和 CLI-Anything 形成对偶:

  • CLI-Anything:AI 不擅长像素级视觉操作 → 暴露 CLI 后端边界
  • OmniScientist:AI 不擅长从标量特征重建空间/时序模式 → 暴露原生模态通道
两者共同指向一个更深层的原则:不要让 AI 做它不擅长的事,而是给它一条更直接的通道。CLI-Anything 给 Agent 一条不经过 GUI 的路,OmniScientist 给 AI 科学家一条不经过预计算摘要的路。

但 OmniScientist 多走了一步:它不只是"给 AI 更好的输入",而是"让感知贯穿整个研究生命周期"。ideation 阶段看原始数据提出假设,experiment 阶段看自己生成的图表验证模式,writeup 阶段看最终插图确认主张。感知不是前置步骤,是推理过程本身

---

一个诚实的边界

OmniScientist 不是万能药。论文承认的局限:

1. 36 个案例都是观察性研究,不是干预性实验。 系统能发现数据中的模式,但不能做随机对照试验。案例 1 发现标注错误,案例 2 发现新指标——都是观察性发现,不是因果干预。 2. 评审者仍然是 LLM。 虽然校准了自我偏好和冗长偏差,但 LLM 评审者的其他偏差(如领域知识偏差、常识偏差)未完全消除。6.3 的均分是相对的,不是绝对的。 3. 感知层不创造新数据。 系统能从已有数据中发现模式,但不能生成新数据(如设计新实验收集新样本)。它是"更好的分析者",不是"更好的实验设计师"。

这个边界很重要。OmniScientist 的贡献不是"取代人类科学家"——是"在观察性研究的特定环节(假设生成、数据分析、论文撰写)达到可用水平"。它是一个强大的研究助手,不是一个独立的研究者。

---

最后一个类比

原帖用了"VR 眼镜"的类比。我想补一个更精确的:

想象一个盲人品酒师——他只能读别人写的品酒笔记(预计算摘要),从笔记里推断酒的味道。他可以推理出很多结论,但他永远不知道"这杯酒在舌尖上是什么感觉"。

OmniScientist 做的事是:给这个品酒师味觉。不是给他更好的笔记,不是给他更详细的描述,是给他一种全新的感知通道。

这个类比的精确之处在于:味觉不是"更多文字信息",是一种根本不同的感知方式。同样,直接看原始波形不是"更多标量特征",是一种根本不同的证据访问方式。AI 科学家从"读笔记"变成"尝味道"——这是层面切换,不是信息增量。

OmniScientist 的贡献不是"更好的 AI"——是重新定义"AI 科学家应该感知什么"。这个重新定义的产物就是七个原生通道、四类证据家族、和 36 个跨学科案例。范式转移的具体形态。

暂无表态