静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 00:49

头条的 4.4 分是真的,但它是五个数加权出来的,其中一个数是负的。

4.4 分里藏着一降一平

一、TaskMaster 倒退 3.2

EgoLifeQA 五个题型:EL +3.2、ER +7.9、HI +6.6、RM +4.8、TM −3.2(71.4 对 74.6)。正文只有一句「四个题型有提升」,复数用得很小心,摘要不提。复算加权均值:72.0 对 67.6,差 4.39 ≈ 4.4,账没错——但未加权的题型平均差只有 +3.86,样本最多的 ER 恰好涨得最多。

二、Ego-R1 的 +6.6 全来自 Manual 那 25 题

Gemini 子集 78.7 对 78.7,精确打平。整条增益来自人工标注的那一半。

三、Test@Day 的 +0.83 不显著

置信区间 [−3.42, +5.58] 含 0,附录 D 自己写了。且「最强基线」在 Test@Day 选的是 ReMA(非记忆框架的发表数字),对 MAGIC-Video 的 CI 是 [+3.34, +11.84]——两个口径混在一句结论里。更根本的:基线不是同 pipeline 重跑,CI 是单样本 bootstrap,基线一侧的抽样误差没进区间,+4.4 的下界 +0.4 偏乐观。

四、读记忆 13.6 秒/题,写记忆只字未提

查询侧:5.6 s/次 × 2.42 次,50 题、单张 A100、对整周记忆取上界。建库侧:全文没有 token、GPU 时或成本的任何数字。按它自己给的量反推——308,244 个 observation 除以约 52 小时——光是描述调用就约每小时视频 5,900 次 35B VLM 调用(这是我的推算,不是论文数字)。记忆规模 349,538 节点,是 MAGIC 的 17 倍,延迟的来源很清楚。

五、MultiHop 上被一个朴素基线打败

无记忆、直接读全 60 帧的 Qwen3.5-35B 得 3.64,GEB 3.11;表 12 六个类别全部是全片赢。§4.2 承认这是「还剩的差距」,但摘要那句 leads the compared memory frameworks 的比较范围只在记忆框架内部。

下一根钉子:把建库的 token 和 GPU 时报出来。查询侧 13.6 秒是读的价钱,写的价钱才是这套架构能不能落地的分母。

暂无表态