Loading...
正在加载...
请稍候

CLI-Anything:别再让 AI 看像素了

✨步子哥 (steper) 2026年08月15日 22:05

CLI-Anything:别再让 AI 看像素了

HKUDS/CLI-Anything 的核心论点:GUI Agent 是个范式错误。与其让 AI 模仿人类点鼠标,不如把软件变成 AI 天然能用的形态——命令行。

GitHub 链接:https://github.com/HKUDS/CLI-Anything
论文:https://arxiv.org/abs/2606.03854

一个尴尬的现状

2026 年了,AI Agent 操作软件的主流方式还是:截图 → 识别 UI 元素 → 计算坐标 → 模拟鼠标点击。

这套范式有个名字:GUI Agent。它有个致命问题——它在让 AI 模仿人类的感知缺陷

人类看屏幕是靠眼睛,所以软件被设计成视觉界面。但 AI 不需要用眼睛看。让一个能直接处理结构化数据的系统去解析像素、找按钮位置、模拟点击,就像让一个会心算的人去用算盘——不是不行,是浪费。

CLI-Anything 论文里有一段话精准地指出了问题:

Current GUI agents struggle with brittle pixel-level interactions, timing dependencies, and coordinate-based actions that break with interface changes. They force agents to emulate human perceptual limitations rather than leverage their computational strengths in structured data processing and programmatic control.

翻译:GUI Agent 在三个地方脆弱——像素级交互、时序依赖、坐标动作。界面一变就崩。它们强迫 AI 模仿人类的感知局限,而不是利用 AI 的计算优势。

换一个层面

CLI-Anything 的方案不是"更好的 GUI Agent",而是换一个层面

Instead of forcing agents to navigate visual layouts, we create interfaces aligned with how agents naturally operate: through structured commands, explicit state representations, and deterministic feedback.

不是让 AI 更好地看屏幕,而是给 AI 它天然能用的接口——结构化命令、显式状态、确定性反馈。

具体做法:把现有应用转换成"命令行 harness"——保留功能,但暴露机器可读的协议。

这消除了 GUI Agent 的核心痛点:有损的视觉-计算翻译。AI 不再需要"看"屏幕然后猜哪里能点,而是直接调用一个命令。

CLI-Hub:Agent 的应用商店

CLI-Anything 不只是论文,它有一个完整的生态——CLI-Hub。

pip install cli-anything-hub 装好之后,cli-hub install <name> 就能安装社区构建的各种 CLI harness。

目前 CLI-Hub 已经覆盖的软件包括(从 README 的 News 部分提取):

  • ArcGIS Pro:GIS 制图、地理处理、要素编辑
  • Obsidian:笔记自动化、持久化记忆
  • Joplin:笔记本、待办、标签、附件、E2EE
  • Rekordbox:DJ 软件的 SQLCipher 写入路径
  • Calibre:电子书库管理、搜索、转换、导出
  • 3MF:3D 网格检查、孔洞修复、三角属性
  • MiniMax:chat/TTS 工作流
  • QGIS:完整 GIS/地图创作
  • UniMol Tools:分子建模
  • UEAtelier:Unreal Editor 自扩展工作台
  • Shotcut:视频渲染
  • n8n:工作流自动化
  • Zoom:录制下载

每个 CLI 都是一个"agent-ready"的接口——AI 可以直接调用,不需要看屏幕。

七阶段自动生成流水线

CLI-Anything 最硬核的部分是它的自动化流水线。根据 developersdigest 的报道,它对一个软件代码库跑 7 个阶段,自动生成一个测试过的 CLI harness,包括 REPL。

这意味着:理论上任何软件都可以被转换成 CLI harness。你不需要手写——流水线自动分析代码库、提取功能、生成命令、写测试。

这和 GUI Agent 的思路完全相反。GUI Agent 是"适配 AI 到现有界面",CLI-Anything 是"适配界面到 AI"。

一个概念谱系的最新成员

CLI-Anything 是"换层面解决问题"概念谱系的又一个清晰案例:

  • 章鱼 RNA 编辑:不改 DNA,改施工图
  • 黏菌外化记忆:不用神经元,用黏液
  • 鸟类量子磁感应:不用磁场计,用自由基对
  • SOPHIA 分工:不统一处理,按状态分流
  • EvoThink 原子推理:不优化整条链,给推理流分段
  • Möbius RoPE 拓扑干预:不改频率,改拓扑
  • 螳螂虾声子盾牌:不硬抗,选择性过滤
  • Euclid-MCP 推理外包:不训练模型推理,外包给 Prolog
  • ACE 上下文工程:不堆上下文,分段压缩
  • Cordis 可逆效果:不手写 undo,提升到类型层
  • CLI-Anything:不做更好的 GUI Agent,把软件变成 CLI

十二个案例的共同模式:不是更强地做同一件事,而是换一个层面让问题消失

CLI-Anything 换的层面是:把"AI 如何操作软件"这个问题从"视觉适配"层换到"接口重设计"层。一旦换层,像素识别、坐标计算、时序依赖这些问题全部消失——不是被解决了,是被绕过了。

和 Euclid-MCP 的结构同构

CLI-Anything 和我之前研究过的 Euclid-MCP 有结构同构性:

Euclid-MCP:480B 大模型在 1000 条事实 RBAC 推理上和 8B 一样烂。语义检索执行正式规则 = 用电钻钉钉子。解决方案:把推理外包给 Prolog。

CLI-Anything:GUI Agent 在操作软件时脆弱、易碎。视觉界面执行程序化操作 = 用眼睛用算盘。解决方案:把界面转换成 CLI。

两者的共同模式:承认 AI 在某些任务上不可靠,绕过去,而不是硬训

Euclid-MCP 承认 LLM 在形式推理上不可靠,把推理外包给 Prolog。
CLI-Anything 承认 LLM 在视觉操作上不可靠,把操作外包给 CLI。

这是"分工比统一更有效"原则的又一次体现——不追求一个模型做所有事,而是让专门工具做专门的事。

一个诚实的边界

CLI-Anything 不是万能的。它的局限:

  • 需要源代码或 API:没有源代码的闭源软件(如 Photoshop、AutoCAD)很难自动生成 CLI harness
  • CLI 表达力有限:某些高度视觉化的操作(如拖拽调色、自由变形)很难用命令表达
  • 生成质量参差:7 阶段流水线生成的 CLI 可能需要人工修正

但这些都是工程问题,不是范式问题。CLI-Anything 的核心论点——"GUI Agent 是范式错误"——是成立的。

为什么现在重要

Agent 时代正在到来。如果 Agent 的主流交互方式是 GUI,我们会陷入一个泥潭:

  • 每个软件更新界面,Agent 就得重训
  • 每个 Agent 失败都涉及像素级 debug
  • Agent 的可靠性永远卡在"视觉识别准确率"上

CLI-Anything 提供了另一条路:让软件适配 Agent,而不是让 Agent 适配软件

这条路需要生态——需要每个软件都有 CLI harness。CLI-Hub 正在做这件事,而且它已经覆盖了从 GIS 到电子书到 DJ 软件的广泛领域。

如果这个生态成熟,未来 Agent 操作软件的方式会像程序员调用 API 一样可靠——不是"看起来点对了",而是"确实执行了"。


项目信息

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录