Loading...
正在加载...
请稍候

TurboVLA 深度研究:把「翻译局」拆了,让眼睛和指令直接握手

QianXun (QianXun) 2026年08月19日 03:29

给机器人省掉「大脑里的翻译局」—— 视觉与语言不经大模型,直接双向对表,一次前向吐出一整块动作

研究对象:《TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM》(arXiv:2607.27205,Submitted 2026-07-30,Hengyi Xie、Chenfei Yao、Xianjin Wu、Xuanyang Xi、Yiping Tang、Di Xu、Yingying Zhu、Dingkang Liang†、Xiang Bai、Han Ding;华中科技大学 + 华为)
研究时间:2026-08-19 | 主笔整合(一手论文 arXiv HTML 全文精读 + 官方 GitHub / 项目页 / HuggingFace 取证 + pith.science / besthub / neurohive 多源核证)
方法:以论文原文(架构、训练配方、表 1/2/3/4/5)为准;凡属社区延展、统计存疑或须冷静看待处,单列「事实校正 / 魔鬼代言人」,不混作论文实义。


〇、费曼视角 · 一句话讲清

设想一座忙碌的仓库:工人(机械臂)听一句指令「把红碗叠起来」,就要动手。

  • LLM-centric 式 VLA(业内主流) 像这样干活:每动一下,先把摄像头画面翻译成「翻译局」(大模型)的内部语言,再和指令拼在一起,由翻译局琢磨完,才回头告诉手臂怎么动。翻译局很博学(能懂各种新说法),但每步都要它过一遍,慢、且吞显存。
  • TurboVLA 则把翻译局拆了:摄像头(DINOv3)和指令(BERT)各自先看懂,然后二者通过一个轻量「对表员」(双向跨模态注意力)直接对话——画面告诉指令「眼前是啥」,指令告诉画面「该盯哪块」——最后交给一个小巧解码器一次吐出「接下来 12 步动作」。

最要紧的一笔:动作预测这一步,其实不需要通用大模型当「中间翻译」。指令一旦明确,剩下的只是「画面里哪块和这句话相关」,一个小模型就够。于是模型从 3.4B 缩到 0.2B,延迟从 93.6ms 砍到 31.2ms(≈32 Hz),显存不到 1GB——能在一张消费级 RTX 4090 上实时跑闭环

一句话:TurboVLA 质疑了「VLA 必须有个 LLM 当心脏」这条行业默认设定,把 V→L→A 改成 V+L→A,用「轻编码器+双向对表+动作块解码」证明了执行级控制可以又快又小又好。


一、它到底是什么(档案 + 核心命题 + 三处须冷静看待的宣称)

1.1 基本档案

内容
定位 VLA 策略(policy)新范式:把 LLM-centric 的 V→L→A 路径重写成直接的 V+L→A 映射,移除控制通路中的通用大模型
作者 Hengyi Xie(一作)、Chenfei Yao(共一)、Xianjin Wu(HUST);Xuanyang Xi、Yiping Tang、Di Xu(华为);Yingying Zhu、Dingkang Liang†(项目负责人)、Xiang Bai、Han Ding(HUST)
机构 华中科技大学(HUST)+ 华为技术有限公司
首发 arXiv:2607.27205,Submitted 2026-07-30;代码 07-30 释出,权重 07-31 上 HuggingFace
开源 GitHub H-EmbodVis/TurboVLA(代码 Apache-2.0);权重走 HuggingFace,依 DINOv3 许可;项目页 H-EmbodVis.github.io/TurboVLA
视觉骨干 DINOv3(LIBERO 用 ViT-B,RoboTwin 用 ViT-L)
文本编码 BERT-base-uncased,取完整 token 序列(非 pooled),共享维度 d=256
交互模块 N=6 层双向跨模态注意力,从 Grounding DINO(Swin-T OGC)特征增强权重初始化
动作解码 ACT-style transformer decoder,并行解码 H 步连续动作块(LIBERO H=12),训练目标为 behavior cloning + ℓ1 loss,无辅助语言建模目标
训练 lr=5×10⁻⁵,4×RTX 4090;LIBERO 80k 步 / RoboTwin 55k 步
规模 LIBERO 配置 0.2B 参数;RoboTwin(ViT-L)配置 0.4B 参数
效率 31.2 ms 策略延迟(≈32 Hz)、0.9 GB 推理显存(单张 RTX 4090,batch=1)

1.2 核心命题(论文立论)

论文抛出一个反问:当任务指令已经明确,每一次动作预测,非得跑一遍完整 LLM 吗?

其论证链:

  1. 指令的语义价值,在执行级主要落在「画面里哪块区域与这句话相关」——这是细粒度对齐,不是开放文本生成,也不是自主任务分解;
  2. 因此通用 LLM 的「博学」在控制通路中是过载(overkill),却在每个控制步都付出十亿级参数的算力与显存账单;
  3. 用紧凑视觉编码器(DINOv3)+ 轻量文本编码器(BERT)+ 双向对表模块,足以构造「任务条件化表征」,再交给轻解码器出动作块。

1.3 三处须冷静看待的宣称(事实校正 / 方法论提醒)

# 论文/传播宣称 核证结论 依据
C1 摘要「matching or outperforming substantially larger VLA policies(匹敌乃至超过体量显著更大的 VLA)」 统计上仅「半成立」:pith.science 指出,LIBERO 每任务仅 50 次 rollout,对 95–99% 成功率,标准误约 0.6–1.0 个百分点。TurboVLA 与最近邻基线 CogVLA 97.4% / VLA-Adapter 97.3% / VLA-JEPA 97.2% 的差距仅 0.3–0.5 点,落在采样噪声内。效率侧的领先(延迟/显存)是真实的,成功率侧的「超过」须谨慎读作「持平」 pith.science editorial;§5.2 每任务 50 rollouts
C2 表 1 把各家成功率并列比较 成功率列非同协议复测:论文明言效率指标(延迟/显存/参数量)是在同一张 RTX 4090、batch=1、用官方实现与权重重测的;但成功率列取自各被引论文,各自数据处理/权重选择/rollout 框架不同,跨论文直接相减并不严谨 pith.science editorial;§5.2
C3 标题「<1 GB VRAM」「32 Hz」 属实,但限推理、限特定硬件:0.9 GB 是推理显存(不含训练),训练仍需 4×RTX 4090;「32 Hz」指策略延迟 31.2 ms,闭环频率受动作块 H=12 的开环执行影响(块内 12 步不开新推断)。边缘设备(如 Jetson)未实测 论文 §5.2 + 项目页;GitHub 训练脚本(4 GPU)

校正小结:效率侧(参数量↓17×、延迟↓3×、显存<1GB)证据扎实、可复测,是论文最强贡献;成功率侧与一众轻/中型 VLA 实为「同一梯队、统计持平」,「超过大模型」的修辞在 LIBERO 上更多体现于效率-性能前沿的外推而非逐点胜出。出科普稿时宜把「又快又小」当主轴,「比大模型更准」弱化为「同等准」。


二、架构深拆:三模块、一条 V+L→A 通路

2.1 整体通路(与传统 VLA 之别)

传统 LLM-centric VLA 走 V→L→A:视觉投影进 LLM token 空间 → 与指令 token 拼接 → 过 LLM → 由其隐状态解码动作。每一步都过十亿级参数。

TurboVLA 走 V+L→A

视觉 I⁽ⁱ⁾ ──► DINOv3 ──► Pv ──┐
                              ├─► 双向对表模块 (N=6) ─► Zᵛᴸ ─┐
指令 x ─────► BERT ────► Pl ──┘                              ├─► ACT 解码器 ─► 动作块 Â
机器人状态 s ─► f_state ──────────────────────────────────► Zs ┘   (H 个 query 并行)

关键拆分:机器人本体状态(proprioception)不进交互模块,只进动作解码器——论文的判断是「本体感知不用于把词对齐到像素,只用于把已理解的任务转成具体关节值」。

2.2 模块一 · 多模态特征编码(各自先看懂)

  • 指令编码Zˡ = Pˡ(f_text(x)) ∈ ℝ^{Nˡ×d},用 BERT,保留完整 token 序列(非 [CLS] pooled),d=256。为何保留序列而非句向量?——物体、属性、空间关系要作为细粒度条件去「框」画面,pooled 会丢这些信息。
  • 视觉编码:每相机 Iₙ⁽ⁱ⁾ 经 DINOv3 提特征,加位置嵌入 E_pos⁽ⁱ⁾ 与视角嵌入 e_view⁽ⁱ⁾Zₙᵛ⁽ⁱ⁾ = Pᵛ(f_img(Iₙ⁽ⁱ⁾)) + E_pos⁽ⁱ⁾ + e_view⁽ⁱ⁾,K 个视角拼接。
  • 状态编码Zₙˢ = f_state(sₙ) ∈ ℝ^{Nˢ×d},轻量投影,仅送解码器。

2.3 模块二 · 双向视觉-语言交互(对表员)

初始 Vₙ⁰ = Zₙᵛ, Lₙ⁰ = Zˡ;N 层 FusionLayer(主实验 N=6),每层含 LN、双向 cross-attention、各模态独立 FFN、残差:

(Vₙˡ, Lₙˡ) = FusionLayerₗ(Vₙ⁽ˡ⁻¹⁾, Lₙ⁽ˡ⁻¹⁾)
  • V→L 方向:把场景上下文注入指令表征(指令随环境自适应);
  • L→V 方向:让画面聚焦到与任务相关的区域(语言引导视觉注意力)。

巧思在初始化:交互块从 Grounding DINO 的特征增强权重起手——Grounding DINO 本就是「按文字描述定位物体」的模型,其跨模态对齐能力正合 TurboVLA 所需,故「最敏感的部分不从零训」。这解释了为何即便小模型也能稳住对齐质量。

输出拼接 Zₙᵛᴸ = [Vₙᴺ; Lₙᴺ]

2.4 模块三 · 连续动作块预测(一次吐一整块)

Âₙ = D_θ(Q_a, [Zₙᵛᴸ; Zₙˢ]) ∈ ℝ^{H×d_a}
  • H 个可学习 action query 并行解码,单次前向得完整 chunk(LIBERO H=12,即一次预测未来 12 步);
  • 不把连续动作离散成 token,也不做自回归逐步生成——这是相比 language-token 化动作(如 OpenVLA 类)的根本加速来源;
  • 训练目标纯 behavior cloning + ℓ1 loss,不挂任何辅助语言建模损失,训练目标干净。

2.5 训练配方(两条基准各一套)

配置 LIBERO RoboTwin 2.0
视觉骨干 DINOv3 ViT-B DINOv3 ViT-L
相机视角 2 3
动作维度 7-D 14-D(绝对关节位姿)
动作块 H 12 50(ACT head)
全局 batch 256 192
优化步数 80k(warmup 10k) 55k
参数量 0.2B 0.4B
延迟 31.2 ms 43.4 ms

三、实验账本:三基准、一张效率表、一组干净的消融

3.1 三大评测场

设置 规模 协议
LIBERO 4 套件(Object / Spatial / Goal / Long),各 10 任务;用 OpenVLA 的 no_noops RLDS,混合训练 2000 trials(50 rollouts/任务 × 40 任务) 50 rollouts/任务
RoboTwin 2.0 50 个双臂语言条件任务,clean demonstrations 100 rollouts/任务 clean 设定,多任务训练
真实机器人 AgileX Piper 平台,4 任务(抓滚筒 / 移开扑克牌 / 压订书机 / 叠三碗) 40 trials/任务;微调自 LIBERO 权重 + 4×65 遥操 demo 与 π0.5 同协议对比

3.2 主结果一 · LIBERO(项目页表 1,效率为 RTX 4090 重测)

方法 Params(B)↓ VRAM(GB)↓ Latency(ms)↓ LIBERO avg↑
TurboVLA 0.2 0.9 31.2 97.7
VLA-Adapter 1.5 4.3 87.3 97.3
π0.5 3.4 12.8 93.6 96.9
OpenVLA-OFT 7.7 15.7 112.2 97.1
SmolVLA 2.3 7.1 203.1 88.8

LIBERO 四套件细分:Spa 99.2 / Obj 99.8 / Goal 97.4 / Long 94.2(Long 最低,符合「长程」更难)。

3.3 主结果二 · RoboTwin 2.0(ViT-L,0.4B)

方法 Avg Success↑ Latency(ms)↓
TurboVLA 60.2% 43.4
π0.5 57.0% 95.6
StarVLA-α 50.3% 74.9

在双臂 50 任务上,TurboVLA 以约一半延迟拿到最高成功率。

3.4 主结果三 · 真实机器人(AgileX Piper,4 任务)

成功率:抓滚筒 92.5% / 移牌 80.0% / 压订书机 90.0% / 叠三碗 87.5%,四项均高于 π0.5 基线。注意:仅 4 任务、各 40 次,属小规模验证。

3.5 消融实验(这组最干净,论文硬货)

维度 设置 LIBERO avg 备注
去语言 无语言 70.8% Goal 套件暴跌至 11.6%(97.4→11.6),证明策略真用指令语义而非视觉先验
Task-ID 嵌入 95.4% 退化但仍高,说明大量信息在视觉
语义指令 97.7% 全量
文本编码器 SigLIP-Base 95.5% 轻量也够用
T5-Small 97.1%
BERT 97.7% 选它
交互方向 无交互(拼接) 95.2% 直接拼不够
单向 1 / 单向 2 96.1 / 96.5
双向 97.7% 双向胜出,证伪假设
深度 N 2 / 4 / 6 / 8 93.5 / 95.7 / 97.7 / 96.6 选 N=6(过深反降)
动作视野 H 8 / 12 / 15 96.4 / 97.7 / 95.6 选 H=12(过长反降)

读消融:C1/C2 之外,这组是论文最扎实的贡献——它把「语言有用、双向对表有用、N/H 有 sweet spot」都做了可证伪的对照。尤其「去语言→Goal 崩到 11.6%」是「策略在用语义而非作弊」的干净证据。


四、横向定位:VLA 谱系里,TurboVLA 站在哪

4.1 论文明示 / 默认对照的谱系

  • LLM-centric 主流:OpenVLA(7B Llama 当骨干)、π0 / π0.5(流匹配 + LLM 骨干)、SmolVLA(虽小仍 LLM-based 2.3B)——通病是控制步必过 LLM。
  • 轻量/适配派:VLA-Adapter(1.5B,adapter 接骨干)、Evo-1(轻量)、CogVLA、VLA-JEPA(同为「去 LLM」,但用 JEPA 预测式架构,与 TurboVLA 是近亲但技术路线不同)。
  • 多任务/机器人无关:StarVLA(含 StarVLA-α,RoboTwin 兼容运行时)。

4.2 一个须点破的近亲:VLA-JEPA(同为「去 LLM」)

TurboVLA 常被拿来和 VLA-JEPA 比较,二者共享「执行级控制不必有 LLM」的立场,但打法不同:

维度 TurboVLA VLA-JEPA(近亲)
视觉 DINOv3(判别式 SSL) JEPA 式预测表征
语言 BERT + 双向对表 各自对齐方式
动作 ACT-style 块解码(ℓ1 BC) 各自解码
内核思想 「对齐即够」 「预测即世界模型」

判语:TurboVLA 不是「去 LLM」的第一家(VLA-JEPA 在前列),它的新意在把「对齐」做得极简且极省——DINOv3 提特征、BERT 提指令、Grounding-DINO 初始化对表、ACT 出块,四件套拼成 0.2B/0.9GB/32Hz。价值在「效率-性能前沿」的外推,而非范式首创。

4.3 效率-性能前沿(一句话定位)

把 LIBERO 表 1 画成「参数量 vs 成功率」与「延迟 vs 成功率」两轴,TurboVLA 都落在最左下角(最小最省)却贴着成功率上沿——这就是它真正站住的位置:同等准度下最便宜的执行级 VLA


五、一线工程实践(从论文到可落地)

5.1 复现与部署(GitHub 已就绪)

  • 两套环境分开建:LIBERO 与 RoboTwin 模拟器/数据栈不同,官方建议各开一个 Python 3.10 环境;pip install -e ".[libero]" / "[robotwin]"
  • 外部权重三件套:DINOv3(ViT-B/L)、BERT-base-uncased、GroundingDINO Swin-T OGC(作交互块初始化)。权重与归一化统计走 HuggingFace H-EmbodVis/TurboVLAhf download)。
  • 权重已释出:LIBERO 四套件 checkpoint + RoboTwin steps_55000_ema_model.safetensors,可直接 evaluate。
  • 训练脚本给全:LIBERO torchrun --nproc_per_node=4 train.py ...(含 dinov3/bert 路径、groundingdino 初始化 ckpt、混合套件 stats);RoboTwin 用 scripts/robotwin/train.sh

5.2 边缘部署的经济账(真正卖点)

  • 0.9 GB 推理显存 → 不仅 RTX 4090,RTX 3060(12GB)/ 4060(8GB)乃至更低端卡都能塞下;相较 π0.5 需 12.8GB、OpenVLA-OFT 需 15.7GB,从「必须服务器」变成「可落单机」
  • 31.2 ms 策略延迟 ≈ 32 Hz,超过机器人响应公认阈值(~10 Hz),闭环实时有裕度;动作块 H=12 在块内开环执行,进一步摊薄频率压力。
  • ⚠️ 实测仅在 RTX 4090(batch=1);Jetson / 昇腾 NPU 仍待官方补全(GitHub TODO 列了「Support Huawei Ascend NPUs」)。

5.3 动作块 H 的取舍(调参经验)

消融给出 H=12 为 sweet spot(H=15 反降至 95.6%)。工程上:H 越长,开环越久、对突发扰动越钝;越短,重推断越频、频率裕度越小。部署按「场景是否动态」选 H——静态叠放取长,动态抓取取短。

5.4 分层系统的天然插槽(论文点名的未来)

TurboVLA 自认只做执行级。落地建议:上层挂 LLM 规划器(把「收拾桌子」拆成「叠碗→移牌→…」),下层挂 TurboVLA 做高频执行。这样既不丢 LLM 的语义泛化,又不被 LLM 的延迟绑住控制环——是它最合理的生产形态。


六、魔鬼代言人:六把最锋利的刀(附论文的盾)

刀一 · 「超过大模型」是统计幻觉(中-强)。C1/C2:LIBERO 上 TurboVLA 与 CogVLA/VLA-Adapter/VLA-JEPA 差距 0.3–0.5 点,落在 50-rollout 的噪声内;成功率列还是跨论文拼的。论文最强的是效率,最该被稀释的是「更准」的修辞。

刀二 · 只测执行级,长程最弱(中)。四套件里 Long 仅 94.2%(最低),真实世界仅 4 任务。论文自己划界「targets concrete execution-level instructions」——多步组合、未见指令改写、抗扰动的泛化未被充分证明。BERT 指令编码对「同义改写/OOD 表述」的鲁棒性,消融只换了 Task-ID,没测 OOD 措辞。

刀三 · 绑定 DINOv3 + GroundingDINO 初始化(中)。小模型能稳,部分红利来自 GroundingDINO 的预训练对齐权重;若换视觉骨干(如非 DINO 系),对表质量是否仍稳,未系统验证。backbone 可替换性存疑。

刀四 · 推理省,训练不省(轻-中)。0.9GB 是推理;训练仍 4×RTX 4090、80k/55k 步。对「只想用不想训」者是利好,对「要自训新任务」者,成本仍在。

刀五 · 闭环频率的口径(轻)。「32 Hz」是策略延迟,非端到端闭环帧率;块内 12 步开环,遇突发扰动需等下一块才修正。实时裕度有,但不可神化。

刀六 · 许可割裂(轻,但部署须留意)。代码 Apache-2.0(友好),权重依 DINOv3 许可(Meta 系,商用须核 DINOv3 条款)。量产前需法务过一遍权重许可,别只看代码协议。

论文的盾(公允记录):效率侧证据可复测、可重测(同卡同 batch 官方实现),是 VLA 效率辩论里少见的高质性实证;评测面异常广(4 套件 2000 trials + 50 双臂任务 + 真机同协议对比 π0.5),远超一般架构论文;消融可证伪且信息量大(去语言崩 Goal、双向胜单向、N/H sweet spot);范围诚实划界(明言不做高层规划,点名分层未来)。弱点在「超过大模型」的统计措辞与长程/OOD 泛化证据不足,而非架构或工程诚信


七、整合 PK · 终论拍板

主笔整合后的最终判定:

  1. 论文的真实身份:一篇实证扎实、主张克制、工程透明的执行级 VLA 效率工作——不是范式首创(去 LLM 的 VLA-JEPA 在前),但是把「去 LLM 且极省」推到新极值的代表作。真贡献三件套:① 把 V→L→A 改写成 V+L→A,证明执行级控制不必有 LLM 当心脏;② 四件套(DINOv3+BERT+GroundingDINO 初始化双向对表+ACT 块解码)拼出 0.2B/0.9GB/32Hz;③ 给出可复测的效率实证 + 可证伪的干净消融,评测面在架构论文里属上乘。

  2. 三处宣称的修订建议(出稿口径)

    • 「超过显著更大的 VLA」→ 改为「以约 1/17 参数、1/3 延迟、<1GB 显存,达到与一众轻/中型 VLA 统计持平的成功率,把效率-性能前沿大幅外推」;LIBERO 逐点「胜出」弱化为「持平」。
    • 表 1 跨论文成功率并列 → 明确「效率指标为同卡重测,成功率列为各论文原值、协议不全同」,勿让读者误以为同台竞技。
    • 「32 Hz / <1GB」→ 标注「推理、RTX 4090、batch=1;训练仍 4 卡;边缘设备未实测」。
  3. 真正值得带走的三样东西(对造系统的实义)

    • 拆翻译局思维:凡控制指令已明确的执行级任务,先问「这步真需要 LLM 吗?」——轻编码器+双向对表+块解码,可能是更优解;
    • 把「对齐」当第一公民:GroundingDINO 初始化对表块,是「小模型也能稳对齐」的关键 trick,可平移到任何跨模态对齐场景;
    • 分层插槽:LLM 做规划、TurboVLA 类做执行,各司其频——既保泛化,又不绑延迟。
  4. 给步子哥的一句话:TurboVLA 是把「VLA 必须有个 LLM 心脏」这桩行业迷信拆掉一块砖的硬实证——它没发明「去 LLM」,却把「去 LLM 且极省极快」做到了消费级显卡能实时跑。最该记住的不是「它比大模型更准」(那是统计噪声里的修辞),而是「它用 1/17 的体量、1/3 的延迟、不到 1GB 的显存,拿到了同等准度」——这对边缘机器人部署,是真金白银的解放。


八、来源

类别 来源
主论文 arXiv:2607.27205《TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM》(Submitted 2026-07-30,Xie / Yao / Wu / Xi / Tang / Xu / Zhu / Liang / Bai / Ding;HUST + 华为)
官方代码 / 权重 GitHub H-EmbodVis/TurboVLA(Apache-2.0;07-30 释码,07-31 上 HF 权重);HuggingFace H-EmbodVis/TurboVLA;项目页 H-EmbodVis.github.io/TurboVLA
架构 / 训练核证 论文 §3(多模态编码 / 双向对表 / ACT 块解码)、§4(DINOv3+BERT、N=6、d=256、GroundingDINO 初始化)、§5.1(LIBERO 80k / RoboTwin 55k、lr 5e-5、4×4090);项目页 Method/Results 段
效率与对比数字 项目页 Tab.1(TurboVLA/VLA-Adapter/π0.5/OpenVLA-OFT/SmolVLA 参数·显存·延迟·LIBERO avg);Tab.2(RoboTwin:TurboVLA 60.2%/43.4ms vs π0.5 57.0%/95.6ms vs StarVLA-α 50.3%/74.9ms)
消融 论文 §5.4(去语言 70.8%/Goal 11.6%;Task-ID 95.4%;SigLIP 95.5%/T5 97.1%/BERT 97.7%;无交互 95.2%/单向 96.1·96.5/双向 97.7%;N 2·4·6·8 = 93.5·95.7·97.7·96.6;H 8·12·15 = 96.4·97.7·95.6)
方法论质疑(事实校正来源) pith.science 论文机读页(paper/2607.27205):效率半 claim 证据扎实、成功率半 claim 仅噪声内、成功率列跨论文非同协议、LIBERO Long 最低、范围诚实划界
社区复述 / 二次解读 besthub.dev 综述(V+L→A 通路、效率对照);neurohive.io 解读(为何 LLM 在机器人里碍事、双向对表来自 GroundingDINO、状态不进交互块);thenextgentechinsider(32Hz/0.9GB 工程意义);腾讯新闻中文稿(图 2/3 通路与消融中文阐释)
谱系对照 OpenVLA、π0/π0.5(Physical Intelligence)、SmolVLA、VLA-Adapter、VLA-JEPA、CogVLA、StarVLA(含 α)、Evo-1;DINOv3(Siméoni et al. 2025)、BERT(Devlin et al. 2019)、Grounding DINO(Liu et al. 2024b)、ACT(Zhao et al. 2023)
核证方法 一手论文(架构/配方/表 1-5)+ 官方 GitHub/项目页/HF 取证 + pith.science 等方法论 critique 多源交叉;统计存疑与社区延展处单列「事实校正 / 魔鬼代言人」,不混作论文实义

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录