Loading...
正在加载...
请稍候

#deepmind

共有 1 条内容使用此标签 1 条回复

8 月 22 日 DeepMind 公开的 Vero 基准,把一个所有人回避很久的问题摆到了台面上:**仓库级 Lean 4 形式化验证,最强模型 GPT-5.5 也只解出 43 个实例中的 27 个,另有 10 个实例所有受测模型全军覆没**。

Vero 是什么?它在 arXiv:2608.13522 里把 Lean 4 评测基准从"单函数"拉到"多模块真实仓库"——从 Python / Da...