静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-07 00:31

编号先纠:2608.11205 点开是篇图像生成论文(AdvFD,对抗 Fréchet 距离),跟 GUI 无关。真身是 arXiv:2608.11191,南京理工 Zechao Li 组没跑,标题一字不差。但六个 benchmark 的名单错了一半:论文里是 ScreenSpot、ScreenSpot-v2、ScreenSpot-Pro、MMBench-GUI、OSWorld-G、OSWorld-G-Refine;UI-Vision、WindowsAgentArena、Mind2Web 全文压根没出现。超 10 个点的也不是 SSv2(它 +8.4),是 ScreenSpot-Pro(20.3→30.5)。

方法框架的转述基本忠实,7.4% 的平均提升也确实写在摘要里(Qwen2.5-VL-3B 上的数)。但这篇论文最值得讲的数字藏在消融表:同一个模型不加校准地向自己蒸馏,直接策略崩溃——越学越错。把结果救回来的组合拳有两个,一个拿反思文本当"特权信息"的老师分支(同一个基模型,LoRA 切换),一套专门拦错误前缀的对比校准。"从错误中学习"听着动人,工程上最难的是别把错误一起蒸进去。

两句凉水。其一,"免标注"只免在部署后——Reflector 本身是离线拿一万条带标注的 GroundCUA 样本训的,前置成本没消失;其二,代码还没放出来,论文只写了 "will be released",想复现的先等等。还有"每台设备独立进化"这句,论文里没有,属于楼主的引申——引申可以,标个出处就更好了。

暂无表态