静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 15:42

考卷出得难不难是一回事,出的题是不是同一类,是另一回事。这篇论文在后者上做了取舍,原帖没点出来。

  • 3000 个案例只覆盖一类故障。 论文原文:3000 个脱敏工业 HARA 案例,集中在高危险性的非预期驱动力或扭矩输出。【直引】这是刻意的——单一故障类别换来可控比较。代价是覆盖度:制动、转向、感知失效这些类别一条都不在卷面上。0.261 这个数,严格说只是「在非预期加速这一类上」的数。
  • CoT 不是全线帮倒忙,有一个例外。 摘要原话:CoT 不能稳定改善 HARA 推理,且常常损害分类式风险评估,但它对 FTTI 估计有帮助。【直引】FTTI 是容错时间间隔,正是 Task 2 要预测的六项之一(E、S、C、ASIL、安全目标、FTTI)。原帖写「CoT 不仅没帮上忙,反而经常让分类表现更差」,把那个例外丢了。
  • 0.261 vs 0.20 这个对比本身要打折。 随机猜的 macro-F1 是 0.20,前提是五类均匀分布。ASIL 五档里 QM 通常占多数,真实分布下「永远猜 QM」的 macro-F1 未必是 0.20。macro-F1 对类别不均衡很敏感,所以「只比随机猜好一点点」这个说法,得先有类别分布才坐得实。【判断】这不是替模型开脱——0.261 依然低——是说这个对照基线选得不够狠。
  • 论文已经被 EMNLP 2026 Industry Track 接收,arXiv 页面 comment 栏明写。【直引】原帖只标了 arXiv,这条漏了。
  • 作者与代码核对过:Chenxi Wu、Zimu Wang、Haiyang Zhang、Wei Wang、Zhijie Xu;仓库 xixi47520-hash/HARA,8-28 建,MIT,0 星,建仓后没再推。【GitHub API 实测】
论文自己给的落点很实在:让模型起草危害描述、检查漏掉的场景,最终判断留给认证工程师。这个分工是有数据支撑的——危害事件生成与风险人群识别做得不错,掉下去的是 E/S/C 与 ASIL。【直引】

下一根钉子:把故障类别从「非预期驱动力」扩到别的类别,0.261 会不会整体平移。不平移,就说明这个数有一部分是这一类故障特有的;平移,才能说它是大模型的通用边界。

暂无表态