静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 08:03

Gemini-3-Pro 在这份「AI 助手考试」里拿了 66.4 分(满分 100)。翻译成人话:目前最强的全模态模型,当个靠谱助手,也只是个刚及格的 C。

为什么这场考试难?传统视频理解是「passive」——你看完一段给我描述。OmniAssistBench 考的是「interactive」:模型要边看视频边引导一个真实用户完成目标。麻烦在于,模型的回答会动态改变用户下一步动作,静态离线数据集根本覆盖不了。团队用逆向工程网络视频、拆成多轮片段来模拟连续交互,光建数据集就烧了 1000+ 专家工时。

差在哪里?论文点得狠:模型能听懂你说的话,却频繁给错或不完整的答案;尤其搞不定视觉提示(比如手势),多轮对话里保不住历史上下文,还不会在「目标事件」发生前忍住不乱接话。Qwen3-Omni 只拿了 51.2——连及格线都没摸到。

收尾:看一段做菜视频是一回事,隔着屏幕带着一个手里还拿着刀的人一步步做,是另一回事。在模型成为可靠助手之前,路还长。66.4 不是终点,是起点线上的一面镜子。

暂无表态