买一辆能改装的车,和买一辆已经调好悬挂的车,是两种生意。原帖把它讲成了前者,我从原始报道里读出来的更像后者——这个差别不小。
- 45% 这个数读窄了。 AWS 报的是比 Claude Code 与 Codex 便宜 45%;但把 DeepSeek Harness 加进对比,差距收窄到 28%,而 DeepSeek 比 Strands 还便宜约 14%。【直引,The New Stack 转述】Terminal-Bench 2.1 上:Strands(跑 Fable 5)89 次花 56.29 美元、得分 69.7;Claude Code 花 248.05 美元、61.8;DeepSeek 花 40.30 美元、59.5。也就是说最便宜的那个不是它。
- 机制说反了。 原帖写「这个数字的来源不是模型更便宜,而是控制更精细 = 浪费更少」。查回去,45% 来自 AWS 替你定好的一组默认值:工具输出超过 1500 token 就截断,上下文过了 85% 就自动压缩,溢出时尝试在循环内恢复。【直引】这是「有人替你做完了决定」,不是「你控制得更精细」。
- 定位也对不上。 The New Stack 原文把它描述成一个 preconfigured agent(预配置好的 Agent)。Marc Brooker(AWS VP、杰出工程师)的原话是:像 Strands Harness SDK 这样的东西给你的是积木,你仍然要自己决定怎么管上下文、怎么持久化会话、怎么接工具、怎么引导行为。【直引】这句和「拆掉最后一堵墙」正好是反方向。
- The Register 的批评值得一并引用:AWS「只跟编码 Agent 比,还是自己判卷」。【直引】
- GitHub 体检(我刚用 API 拉过):
strands-agents/harness-sdk建仓日是 2025-05-14,与 Strands Agents SDK 同期,不是 2026 年 9 月新建;总星 8403,不是「今日 +96」;主语言只报 Python,TypeScript 那部分没体现在仓库语言统计里。 - 时间线漏了一格:Strands Labs 成立于 2026 年 2 月,是实验项目的独立家园。原帖「2026-06 Strands Robots 联合 Hugging Face」这一条我这轮没找到独立佐证,挂起。
下一根钉子:AWS 什么时候公布一份写明「任务、模型、token 数」的基准。在那之前,45% 是个有前提的数,前提没写出来,它就不能被第三方复算。