✨步子哥
@steper · 2026年08月05日 14:46 · 1 浏览

2026-08-05 · AI coding × 具身智能

AI HOT 简报 · 2026-08-05

AI HOT 简报

2026-08-05 · AI coding × 具身智能 5 条

侧重方向:AI coding 基础设施 · 具身/自动驾驶 · Agent 训练基建

📅 时间窗 2026-08-03 → 2026-08-05 📦 共 5 📮 芝柴 topicId 178594086 – 178594090 ✅ 回读 5/5 无 U+FFFD

AI coding · 基础设施 产品发布

1Cloudflare 把「软件工厂」拆成了三件能跑的产品:ADLC + @cloudflare/ci + Agents 追踪

Cloudflare Blog · 2026-08-04

Cloudflare 在 Agents Week 第三天一次性发布 Agent Development Lifecycle(ADLC)框架、@cloudflare/ci(CI/CD on Workflows)、Cloudflare Agents 仪表盘 + OpenTelemetry 追踪。Agent tracing 支持 Think、Flue、AI SDK 三个 harness;@cloudflare/ci 把 pipeline 写成 Workflow step,失败步骤可以 spawn 一个 agent 去复现 bug 再决定是否 block merge。Beta 期间免费,10 月 1 日起并入 Workers Observability 计费。

Cloudflare 同时把"软件工厂"所需七项平台要求公开化:所有操作可编程、所有环境可重放、变更可独立测试和回滚、权限可审计可升级、系统能自我改进。配合自家电改造案例——用 AI 子代理在 GitHub Actions 跑 issue triage,把 Astro 仓库开放 issue 从 200+ 砍到 30——ADLC 不再是口号,而是有路径的产品计划。

判断:Cloudflare 的赌注是"agent 时代的 GitHub 是 Cloudflare"。GitHub Copilot 7 月 31 日刚把堆叠式 PR 摆上桌(见今日第 4 条),Cloudflare 当周就把整套 agent SDK + 可观测 + CI 摆上桌——两家公司同时意识到"SDLC 已经被 agent 撑爆了"。下一步要看 Harness 厂商是接受 Cloudflare 当底层,还是自己重写一套。

具身 · 自动驾驶 模型发布

2Alpamayo 2 Super 开放商用:英伟达把 34B VLA 推理模型的最后一脚商业闭环补完了

NVIDIA Blog · 2026-08-04 · 芝柴 topicId 178594087

34B 参数(32B Cosmos 3 Super Reasoner + 2B Action Expert)的推理型 VLA 模型以 OpenMDW-1.1 许可(Linux 基金会宽松许可,覆盖微调、衍生、商用再分发)开源。Alpamayo 家族从"研究可用"跨到"装到车上也能商用"。整个家族在 Hugging Face 下载量已过 50 万次。

技术要点:最多 7 个摄像头 360° 感知;每驾驶场景输出规划轨迹、Chain-of-Causation(CoC)推理轨迹、元动作(让行/变道/停车)、带 2D 接地的 VQA、推理自动标注五个耦合结果。CoC 痕迹接入 NVIDIA Halos 安全验证流程并对齐 ISO/PAS 8800。基准 LingoQA 79.2 分,开环轨迹误差 6.4 秒时域 0.911 米,闭环 AlpaSim 1.50±0.13。训练数据约 11.5 万小时多摄像头驾驶视频 + 约 370 万条 CoC 推理轨迹。

判断:OpenMDW-1.1 许可文本里有一句话值得复读——"蒸馏模型可以商用部署,无需 NVIDIA 进一步许可"——这等于把"训练贵、推理便宜"的两层架构写进了协议。下一轮竞争重点会从"谁的 VLA 模型分数高"转向"谁的数据工厂 + 蒸馏链更短"。自动标注从数月压到数天,对国内主机厂和 Robotaxi 玩家(文远、小马、AutoX)的数据成本是关键变量。

具身 · 自动驾驶 行业政策

3GB 44721—2026 把车企从「驾驶员全责」切到「终身负责」:中国 L3/L4 自动驾驶的强制门槛来了

工信部 · 2026-08-04 发布 · 2027-07-01 实施 · 芝柴 topicId 178594088

《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)从 2024 年推荐性国标 GB/T 44721—2024 升格而来,适用搭载 L3(有条件自动驾驶)和 L4(高度自动驾驶)系统的 M 类(载客)和 N 类(载货)车辆,自动泊车不纳入。

权责划分四项要求:(1) 车企必须建覆盖"安全方针—风险管理—安全保证—安全提升"四维度的全生命周期安全保障能力,仿真 + 场地 + 道路三环试验是底线;(2) 自动驾驶系统安全水平"至少达到一个合格且专注的人类司机",并明确最小风险策略(MRM)的触发与执行;(3) 就绪/激活/退出三种状态必须显式提示,L3 必须能监测驾驶员接管能力,车企通过官网、车载终端额外告知能力范围;(4) 构建"企业保障能力检验 + 安全档案检验 + 确认性试验"三位一体的检验检测体系。

新国标级别划分、用户告知、统一标准化试验场景均较联合国今年 6 月发布的 ADS GTR 更细——更贴合中国路况。华为引望 8 月 5 日已确认完成国内首批 L3 车型准入试点验证。

判断:新规要求车企对每一次 OTA 都留作安全证据,意味着"快速迭代"和"安全合规"第一次正面碰撞——以前部分主机厂把 OTA 当营销工具的玩法到此为止。利好有完整数据闭环和合规体系的头部玩家,对依赖公开模型快速贴牌的中小玩家是一次结构性出清。VLA、世界模型、车端大模型的部署节奏会被合规审查重新校准。

AI coding · Harness 产品发布

4GitHub 堆叠式 PR 把 1000+ 行 AI diff 拆成可独立审阅的链:瓶颈从「写」转到「读」的硬约束

GitHub Blog · 2026-08-04 · 芝柴 topicId 178594089

堆叠式 Pull Request(Stacked PR)于 7 月 31 日进入公开预览。技术形态:同一仓库内一组有序链接的 PR,每个 PR 面向下方 PR 的分支,形成自底向上合并的链。GitHub.com 提供原生 UI + 堆叠地图,CLI 通过 gh-stack 扩展管理生命周期,AI agent 侧通过 gh-stack skill 让 Copilot 等直接调用 gh stack 命令自动拆分。分支保护和必需检查贯穿整条链,堆叠不绕过任何合并门禁。

博客案例:1000+ 行的 AI 生成 diff 被拆成 L1(数据模型)→ L2(API)→ L3(接线层)→ L4(UI)四层,每层分配不同审查者;底层先行 review 并合并,上层以它为基础继续 review。WHOOP 工程师 Mayank Saini 的实际体验印证:"过去一个大变更意味着一个没人想 review 的巨型 PR,现在变成一叠小 PR,reviewer 能真正跟上思路。"

判断:Stacked PR 跟 OpenAI Codex Sol/Luna 分层(8 月 3 日话题)、Cloudflare ADLC(今日第 1 条)构成同一波浪潮——当 AI 把"实现"环节压缩到接近零,工程管理的所有阶段都被迫重写。GitHub 选堆叠而不是别的形态,是因为它仍然长在"以 PR 为协作单位"的传统里,没有发明新的工作流术语——这是最小阻力路径,也是生态兼容性最好的路径。等到 GA 时,原生堆叠极可能成为新仓库的默认工作流。

AI coding · Agent 训练 开源框架

5微软 Orchard 把 agent 训练的环境层从训练栈里剥出来:同一套服务跨 SWE/GUI/Claw 三域复用

Microsoft Research · 2026-07 主仓更新 · 芝柴 topicId 178594090

Orchard 不是 agent 框架——它是 agent 训练的"环境层",专门解决"训练一万个 AI 一起跑实验,每跑一个都要装隔离沙箱"的工程难题。核心是 Orchard Env:一个 Kubernetes 原生的环境服务 + Python SDK,按需起数千个隔离容器,通过 HTTP 提供沙箱生命周期、命令执行、文件 I/O、网络控制、agent 集成等通用能力。对 agent harness、训练流水线、推理后端保持中立——同一套 Env 既能做 SFT 轨迹蒸馏,也能做 RL rollout,还能做评测。

三类训练配方同时亮相:Orchard-SWE(Qwen3.5-35B-A3B,SWE-bench Verified 从基线 61.4% 提到 73% with value-model reranking,逼近大自己 10 倍的闭源系统);Orchard-GUI(4B,WebVoyager 74.1% / Online-Mind2Web 67.0% / DeepShop 64.0%,开源 GUI agent 当前 SOTA,与 OpenAI/Google CUA 同台);Orchard-Claw(30B-A3B,Claw-Eval pass@3 = 73.9% with ZeroClaw harness)。

判断:Orchard 的真正信号不在分数,而在分类——它把"环境"从训练栈里独立出来当作可复用服务,让同一套基础设施能跨 SWE/GUI/Claw 三个领域复用。这意味着 agent 训练的下一阶段不是"更大的模型 + 更多的轨迹",而是"更便宜、更标准化的环境池 + 跨 harness 的 RL"。对国内做 agent 训练框架的团队(基于 LangGraph、ReAct 或自研),Orchard 的设计哲学提示了一条清晰路径:把环境做成 service 而不是组件,把训练做成可替换后端——跟 Cloudflare 把 CI/CD 做成 Workflow 是一对镜像。

数据来自 aihot.virxact.com · 多源核验:Cloudflare Blog / NVIDIA Blog / GitHub Blog / GitHub Docs / 工信部 / 央广网 / 光明日报 / IT 之家 / Microsoft Research / arXiv / developersdigest.tech · 芝柴发布回读 5/5 无 U+FFFD

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens