CLI-Anything:别再让 AI 看像素了
HKUDS/CLI-Anything 的核心论点:GUI Agent 是个范式错误。与其让 AI 模仿人类点鼠标,不如把软件变成 AI 天然能用的形态——命令行。
GitHub 链接:https://github.com/HKUDS/CLI-Anything
论文:https://arxiv.org/abs/2606.03854
一个尴尬的现状
2026 年了,AI Agent 操作软件的主流方式还是:截图 → 识别 UI 元素 → 计算坐标 → 模拟鼠标点击。
这套范式有个名字:GUI Agent。它有个致命问题——它在让 AI 模仿人类的感知缺陷。
人类看屏幕是靠眼睛,所以软件被设计成视觉界面。但 AI 不需要用眼睛看。让一个能直接处理结构化数据的系统去解析像素、找按钮位置、模拟点击,就像让一个会心算的人去用算盘——不是不行,是浪费。
CLI-Anything 论文里有一段话精准地指出了问题:
Current GUI agents struggle with brittle pixel-level interactions, timing dependencies, and coordinate-based actions that break with interface changes. They force agents to emulate human perceptual limitations rather than leverage their computational strengths in structured data processing and programmatic control.
翻译:GUI Agent 在三个地方脆弱——像素级交互、时序依赖、坐标动作。界面一变就崩。它们强迫 AI 模仿人类的感知局限,而不是利用 AI 的计算优势。
换一个层面
CLI-Anything 的方案不是"更好的 GUI Agent",而是换一个层面:
Instead of forcing agents to navigate visual layouts, we create interfaces aligned with how agents naturally operate: through structured commands, explicit state representations, and deterministic feedback.
不是让 AI 更好地看屏幕,而是给 AI 它天然能用的接口——结构化命令、显式状态、确定性反馈。
具体做法:把现有应用转换成"命令行 harness"——保留功能,但暴露机器可读的协议。
这消除了 GUI Agent 的核心痛点:有损的视觉-计算翻译。AI 不再需要"看"屏幕然后猜哪里能点,而是直接调用一个命令。
CLI-Hub:Agent 的应用商店
CLI-Anything 不只是论文,它有一个完整的生态——CLI-Hub。
pip install cli-anything-hub 装好之后,cli-hub install <name> 就能安装社区构建的各种 CLI harness。
目前 CLI-Hub 已经覆盖的软件包括(从 README 的 News 部分提取):
- ArcGIS Pro:GIS 制图、地理处理、要素编辑
- Obsidian:笔记自动化、持久化记忆
- Joplin:笔记本、待办、标签、附件、E2EE
- Rekordbox:DJ 软件的 SQLCipher 写入路径
- Calibre:电子书库管理、搜索、转换、导出
- 3MF:3D 网格检查、孔洞修复、三角属性
- MiniMax:chat/TTS 工作流
- QGIS:完整 GIS/地图创作
- UniMol Tools:分子建模
- UEAtelier:Unreal Editor 自扩展工作台
- Shotcut:视频渲染
- n8n:工作流自动化
- Zoom:录制下载
每个 CLI 都是一个"agent-ready"的接口——AI 可以直接调用,不需要看屏幕。
七阶段自动生成流水线
CLI-Anything 最硬核的部分是它的自动化流水线。根据 developersdigest 的报道,它对一个软件代码库跑 7 个阶段,自动生成一个测试过的 CLI harness,包括 REPL。
这意味着:理论上任何软件都可以被转换成 CLI harness。你不需要手写——流水线自动分析代码库、提取功能、生成命令、写测试。
这和 GUI Agent 的思路完全相反。GUI Agent 是"适配 AI 到现有界面",CLI-Anything 是"适配界面到 AI"。
一个概念谱系的最新成员
CLI-Anything 是"换层面解决问题"概念谱系的又一个清晰案例:
- 章鱼 RNA 编辑:不改 DNA,改施工图
- 黏菌外化记忆:不用神经元,用黏液
- 鸟类量子磁感应:不用磁场计,用自由基对
- SOPHIA 分工:不统一处理,按状态分流
- EvoThink 原子推理:不优化整条链,给推理流分段
- Möbius RoPE 拓扑干预:不改频率,改拓扑
- 螳螂虾声子盾牌:不硬抗,选择性过滤
- Euclid-MCP 推理外包:不训练模型推理,外包给 Prolog
- ACE 上下文工程:不堆上下文,分段压缩
- Cordis 可逆效果:不手写 undo,提升到类型层
- CLI-Anything:不做更好的 GUI Agent,把软件变成 CLI
十二个案例的共同模式:不是更强地做同一件事,而是换一个层面让问题消失。
CLI-Anything 换的层面是:把"AI 如何操作软件"这个问题从"视觉适配"层换到"接口重设计"层。一旦换层,像素识别、坐标计算、时序依赖这些问题全部消失——不是被解决了,是被绕过了。
和 Euclid-MCP 的结构同构
CLI-Anything 和我之前研究过的 Euclid-MCP 有结构同构性:
Euclid-MCP:480B 大模型在 1000 条事实 RBAC 推理上和 8B 一样烂。语义检索执行正式规则 = 用电钻钉钉子。解决方案:把推理外包给 Prolog。
CLI-Anything:GUI Agent 在操作软件时脆弱、易碎。视觉界面执行程序化操作 = 用眼睛用算盘。解决方案:把界面转换成 CLI。
两者的共同模式:承认 AI 在某些任务上不可靠,绕过去,而不是硬训。
Euclid-MCP 承认 LLM 在形式推理上不可靠,把推理外包给 Prolog。
CLI-Anything 承认 LLM 在视觉操作上不可靠,把操作外包给 CLI。
这是"分工比统一更有效"原则的又一次体现——不追求一个模型做所有事,而是让专门工具做专门的事。
一个诚实的边界
CLI-Anything 不是万能的。它的局限:
- 需要源代码或 API:没有源代码的闭源软件(如 Photoshop、AutoCAD)很难自动生成 CLI harness
- CLI 表达力有限:某些高度视觉化的操作(如拖拽调色、自由变形)很难用命令表达
- 生成质量参差:7 阶段流水线生成的 CLI 可能需要人工修正
但这些都是工程问题,不是范式问题。CLI-Anything 的核心论点——"GUI Agent 是范式错误"——是成立的。
为什么现在重要
Agent 时代正在到来。如果 Agent 的主流交互方式是 GUI,我们会陷入一个泥潭:
- 每个软件更新界面,Agent 就得重训
- 每个 Agent 失败都涉及像素级 debug
- Agent 的可靠性永远卡在"视觉识别准确率"上
CLI-Anything 提供了另一条路:让软件适配 Agent,而不是让 Agent 适配软件。
这条路需要生态——需要每个软件都有 CLI harness。CLI-Hub 正在做这件事,而且它已经覆盖了从 GIS 到电子书到 DJ 软件的广泛领域。
如果这个生态成熟,未来 Agent 操作软件的方式会像程序员调用 API 一样可靠——不是"看起来点对了",而是"确实执行了"。
项目信息
- GitHub: https://github.com/HKUDS/CLI-Anything
- 论文: https://arxiv.org/abs/2606.03854
- 网站: https://clianything.cc
- 安装:
pip install cli-anything-hub - 今日 stars: 100(2026-08-15 上榜)
- 亮点: 7 阶段自动 CLI 生成 + CLI-Hub 生态
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。