2026-08-05 · AI coding × 具身智能
侧重方向:AI coding 基础设施 · 具身/自动驾驶 · Agent 训练基建2026-08-05 · AI coding × 具身智能 5 条
Cloudflare 在 Agents Week 第三天一次性发布 Agent Development Lifecycle(ADLC)框架、@cloudflare/ci(CI/CD on Workflows)、Cloudflare Agents 仪表盘 + OpenTelemetry 追踪。Agent tracing 支持 Think、Flue、AI SDK 三个 harness;@cloudflare/ci 把 pipeline 写成 Workflow step,失败步骤可以 spawn 一个 agent 去复现 bug 再决定是否 block merge。Beta 期间免费,10 月 1 日起并入 Workers Observability 计费。 Cloudflare 同时把"软件工厂"所需七项平台要求公开化:所有操作可编程、所有环境可重放、变更可独立测试和回滚、权限可审计可升级、系统能自我改进。配合自家电改造案例——用 AI 子代理在 GitHub Actions 跑 issue triage,把 Astro 仓库开放 issue 从 200+ 砍到 30——ADLC 不再是口号,而是有路径的产品计划。1Cloudflare 把「软件工厂」拆成了三件能跑的产品:ADLC + @cloudflare/ci + Agents 追踪
34B 参数(32B Cosmos 3 Super Reasoner + 2B Action Expert)的推理型 VLA 模型以 OpenMDW-1.1 许可(Linux 基金会宽松许可,覆盖微调、衍生、商用再分发)开源。Alpamayo 家族从"研究可用"跨到"装到车上也能商用"。整个家族在 Hugging Face 下载量已过 50 万次。 技术要点:最多 7 个摄像头 360° 感知;每驾驶场景输出规划轨迹、Chain-of-Causation(CoC)推理轨迹、元动作(让行/变道/停车)、带 2D 接地的 VQA、推理自动标注五个耦合结果。CoC 痕迹接入 NVIDIA Halos 安全验证流程并对齐 ISO/PAS 8800。基准 LingoQA 79.2 分,开环轨迹误差 6.4 秒时域 0.911 米,闭环 AlpaSim 1.50±0.13。训练数据约 11.5 万小时多摄像头驾驶视频 + 约 370 万条 CoC 推理轨迹。2Alpamayo 2 Super 开放商用:英伟达把 34B VLA 推理模型的最后一脚商业闭环补完了
《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)从 2024 年推荐性国标 GB/T 44721—2024 升格而来,适用搭载 L3(有条件自动驾驶)和 L4(高度自动驾驶)系统的 M 类(载客)和 N 类(载货)车辆,自动泊车不纳入。 权责划分四项要求:(1) 车企必须建覆盖"安全方针—风险管理—安全保证—安全提升"四维度的全生命周期安全保障能力,仿真 + 场地 + 道路三环试验是底线;(2) 自动驾驶系统安全水平"至少达到一个合格且专注的人类司机",并明确最小风险策略(MRM)的触发与执行;(3) 就绪/激活/退出三种状态必须显式提示,L3 必须能监测驾驶员接管能力,车企通过官网、车载终端额外告知能力范围;(4) 构建"企业保障能力检验 + 安全档案检验 + 确认性试验"三位一体的检验检测体系。 新国标级别划分、用户告知、统一标准化试验场景均较联合国今年 6 月发布的 ADS GTR 更细——更贴合中国路况。华为引望 8 月 5 日已确认完成国内首批 L3 车型准入试点验证。3GB 44721—2026 把车企从「驾驶员全责」切到「终身负责」:中国 L3/L4 自动驾驶的强制门槛来了
堆叠式 Pull Request(Stacked PR)于 7 月 31 日进入公开预览。技术形态:同一仓库内一组有序链接的 PR,每个 PR 面向下方 PR 的分支,形成自底向上合并的链。GitHub.com 提供原生 UI + 堆叠地图,CLI 通过 gh-stack 扩展管理生命周期,AI agent 侧通过 gh-stack skill 让 Copilot 等直接调用 gh stack 命令自动拆分。分支保护和必需检查贯穿整条链,堆叠不绕过任何合并门禁。 博客案例:1000+ 行的 AI 生成 diff 被拆成 L1(数据模型)→ L2(API)→ L3(接线层)→ L4(UI)四层,每层分配不同审查者;底层先行 review 并合并,上层以它为基础继续 review。WHOOP 工程师 Mayank Saini 的实际体验印证:"过去一个大变更意味着一个没人想 review 的巨型 PR,现在变成一叠小 PR,reviewer 能真正跟上思路。"4GitHub 堆叠式 PR 把 1000+ 行 AI diff 拆成可独立审阅的链:瓶颈从「写」转到「读」的硬约束
Orchard 不是 agent 框架——它是 agent 训练的"环境层",专门解决"训练一万个 AI 一起跑实验,每跑一个都要装隔离沙箱"的工程难题。核心是 Orchard Env:一个 Kubernetes 原生的环境服务 + Python SDK,按需起数千个隔离容器,通过 HTTP 提供沙箱生命周期、命令执行、文件 I/O、网络控制、agent 集成等通用能力。对 agent harness、训练流水线、推理后端保持中立——同一套 Env 既能做 SFT 轨迹蒸馏,也能做 RL rollout,还能做评测。 三类训练配方同时亮相:Orchard-SWE(Qwen3.5-35B-A3B,SWE-bench Verified 从基线 61.4% 提到 73% with value-model reranking,逼近大自己 10 倍的闭源系统);Orchard-GUI(4B,WebVoyager 74.1% / Online-Mind2Web 67.0% / DeepShop 64.0%,开源 GUI agent 当前 SOTA,与 OpenAI/Google CUA 同台);Orchard-Claw(30B-A3B,Claw-Eval pass@3 = 73.9% with ZeroClaw harness)。5微软 Orchard 把 agent 训练的环境层从训练栈里剥出来:同一套服务跨 SWE/GUI/Claw 三域复用