OpenIntelligentUI:当 AI 回答不再只是文字——它会自己长出 3D 模型和计算器
它给你一段文字解释。你看懂了,但只是勉强。因为这三个概念本质上是三维空间里的旋转——文字描述天然是降维的。
目录
OpenIntelligentUI:当 AI 回答不再只是文字——它会自己长出 3D 模型和计算器
仓库:CopilotKit/OpenIntelligentUI
语言:TypeScript / Python
Stars Today:309
创建时间:2026 年
一个不同的问题
你问 ChatGPT:「什么是俯仰、滚转和偏航?」
它给你一段文字解释。你看懂了,但只是勉强。因为这三个概念本质上是三维空间里的旋转——文字描述天然是降维的。
你问 OpenIntelligentUI 同样的问题。
它给你一个 3D 飞机模型。你可以拖动旋转角度,看俯仰怎么动、滚转怎么转、偏航怎么变。你改一个数值,飞机立刻响应。
这不是「文字 + 配图」的多模态。这是回答本身就是交互式工具。
核心机制:Agent 选择呈现形式
OpenIntelligentUI 的架构分三层:
1. Agent 层:一个 LLM agent(叫 Jev)接收你的问题 2. 路由层:Agent 判断这个问题最适合用什么形式回答——纯文字?表格?图表?3D 模型?计算器?地图? 3. 渲染层:前端根据路由结果,动态渲染对应的交互组件
关键在第二步。传统 chatbot 的回答是「文字 → 文字」。OpenIntelligentUI 的回答是「文字 → Agent 判断 → 最适合的 UI 形式」。
四种回答模式:
- Understand(理解):探索一个机制,改变一个变量看效果。比如 3D 飞机演示俯仰滚转偏航。
- Compare(比较):把选项并排放,用表格列差异,用图表可视化。比如比较三个旅游方案的成本和体验。
- Make a tool(造工具):生成一个计算器、规划器或交互模型。比如分账计算器,改人数和小费比例,实时算结果。
- Direct answer(直接回答):简单问题就给文字,不画蛇添足。
为什么这很重要
过去两年,LLM 的能力增长主要在两个方向:
1. 推理能力:更长链的思考、更复杂的工具调用 2. 多模态:能看图、能听音频、能生成视频
但输出形式几乎没变——还是文字。偶尔加个代码块或表格。
这是一个奇怪的瓶颈。LLM 的理解能力已经足够强,它知道「俯仰滚转偏航」是三维旋转,知道「分账」需要交互计算。但它的输出通道被限制在了 Markdown 文本流里。
OpenIntelligentUI 做的事情是:打通 Agent 能力和前端渲染之间的最后一层。Agent 知道什么形式最好,前端有能力渲染任何形式,中间缺的是一个「路由协议」。
AG-UI 协议:Agent 和 UI 的通用接口
OpenIntelligentUI 建立在 CopilotKit 的 AG-UI(Agent-UI)协议上。这个协议定义了:
- Agent 如何声明「我需要渲染一个 3D 组件」
- 前端如何注册「我支持这些组件类型」
- 中间如何传递交互事件(用户拖动了滑块、改了数值)
一旦协议标准化,任何 Agent 可以对接任何前端,任何前端可以渲染任何 Agent 的输出。这比硬编码「这个模型配这个 UI」灵活得多。
实际效果
从 launch film 的 demo 场景看:
1. 3D 飞机:标注俯仰/滚转/偏航轴,可拖动角度,有平滑演示动画和重置按钮 2. 表格→图表:先列数值比较,追问后转成可视化图表 3. 分账计算器:总金额、小费比例、人数三个输入,实时更新每人应付 4. 海岸旅行地图:USGS 地图底图,编号 pin 标注目的地,照片配图,可暂停/回放/选择停靠点
这些不是预录视频——是 Agent 实时生成的。每次问同一个问题,输出形式可能不同,因为 Agent 会根据上下文选择最佳呈现。
技术栈
- 前端:React + TypeScript
- Agent:Python,支持 OpenAI 等模型
- 协议:AG-UI
- 3D 渲染:Three.js
- 图表:AG-UI 的图表组件
- 地图:USGS tiles
git clone https://github.com/CopilotKit/OpenIntelligentUI.git
cd OpenIntelligentUI
make setup
make dev
需要 Node.js 22+、pnpm 9+、Python 3.12+、uv。
适用的场景
- 教育:解释三维概念、物理机制、生物结构——3D 模型比文字强 10 倍
- 决策辅助:比较方案时,表格+图表比纯文字更容易看出差异
- 工具生成:临时需要一个计算器或规划器,Agent 现场造一个
- 旅行/规划:地图+pin+照片的交互式行程比文字描述直观
- 简单事实查询(杀鸡用牛刀)
- 需要精确数值的金融/医疗场景(demo 场景的数据是示意,不是实时业务数据)
更深一层的思考
OpenIntelligentUI 揭示了一个趋势:AI 的下一个战场不只是模型能力,而是输出维度。
当所有模型都能流利地写文字时,「文字质量」不再是差异化因素。差异化在于——你的回答能不能变成一个工具?能不能变成一个可视化?能不能变成一个交互式体验?
这和 ArtCraft(用 3D 场景控制图像构图)、YuE2(用符号规划控制音乐旋律)是同一个方向:模型趋同时,控制层分化。
文字是信息密度最低的输出形式。当 Agent 能直接生成「可交互的回答」时,纯文字回答就变成了降维。不是所有问题都需要 3D 模型——但有些问题,只有 3D 模型才是真正的回答。
项目地址:https://github.com/CopilotKit/OpenIntelligentUI