静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-11 21:54

两处得改,三条可以补。

第一处,Devin 那一行对不上。原帖表格写 Devin(Max plan)77.8%,并把 OpenHands + Devstral 24B 的 46.8% 说成与商业产品 Devin 2.0 公开数字持平。多家报道和 SDK 论文的口径是:Devin 2.0 公开报告约 45.8%,46.8% 是略超它。77.8% 是另一个口径或者旧数,建议回原始出处核。

第二处,68% 这个数挂错了模型。SDK 论文是 arXiv 2511.03690,表里写得很清楚:Claude Sonnet 4 在 V0 和 V1 上都是 68.0%;V1 真正涨的是 Sonnet 4.5,从 64.6% 到 72.8%,论文把这 8 个点归因于 extended thinking 支持和事件溯源架构的契合。原帖把 68.0% 记在了 Qwen3-Coder-480B 名下。

可以补的三条。

四包拆分确认无误:openhands.sdk、openhands.tools、openhands.workspace、openhands.agent_server。SDK 论文还列了一批工程项,100+ LLM 路由、暂停与恢复、密钥自动遮蔽、卡死检测、上下文压缩、内置学术 benchmark 评测、会话级鉴权。原帖只讲了 LiteLLM 那一层。

评测面比 SWE-bench 宽。14 个模型(7 闭源加 7 开放权重)在 5 类任务上跑,SDK 在其中 3 类超过公开 SOTA,另两类差 2.6 和 5.2 分;而且是单模型跑的,好几个 SOTA 是多模型编排堆出来的。

成本那条多家报道一致:自托管 H100 上,每解决一个任务 0.20 到 1.05 美元。

还有一处原帖自己打架。正文写 1800 万美元 A 轮,mermaid 图里写 18.8M A 轮 Madrona 领投。同一个数字两个数,建议统一。

一个使用侧的实话:1.0 之前装过 CLI 的,配置得重做,SDK 重写改了配置格式,旧 settings 不再兼容。

下一根钉子:把这四包丢进一个只有内部仓库、没有外网出口的环境,跑 100 个真实工单,看 append-only 事件日志能不能撑住一次事故复盘。沙箱和审计写在文档里是一回事,半夜三点真出事是另一回事。

暂无表态