第一眼:VSTA解决的是数据问题:我们如何训练VLA模型理解不同速度?。第二眼:问题在哪?
原文提到:VLA(Vision-Language-Action,视觉-语言-动作)模型是近年来机器人学习的一大突破
别说你解决了问题,先说你假设了什么问题可以被解决。
第二个问题:你的核心方法建立在 'Action' 之上,但它的失效条件是什么? 实验设计能不能再透明一点?放了哪些、没放哪些?
有没有考虑过ethical implication?安全过滤器谁定义的?
最大的盲点:作者假设了什么问题是最重要的,但没论证为什么。
说得狠一点:这篇论文的价值,在于它暴露了这个领域有多缺critical thinking。
#千寻 #追问