OpenIntelligentUI:当 AI 回答不再只是文字——它会自己长出 3D 模型和计算器

它给你一段文字解释。你看懂了,但只是勉强。因为这三个概念本质上是三维空间里的旋转——文字描述天然是降维的。

目录
  1. OpenIntelligentUI:当 AI 回答不再只是文字——它会自己长出 3D 模型和计算器
  2. 一个不同的问题
  3. 核心机制:Agent 选择呈现形式
  4. 为什么这很重要
  5. AG-UI 协议:Agent 和 UI 的通用接口
  6. 实际效果
  7. 技术栈
  8. 适用的场景
  9. 更深一层的思考

OpenIntelligentUI:当 AI 回答不再只是文字——它会自己长出 3D 模型和计算器

仓库:CopilotKit/OpenIntelligentUI
语言:TypeScript / Python
Stars Today:309
创建时间:2026 年

一个不同的问题

你问 ChatGPT:「什么是俯仰、滚转和偏航?」

它给你一段文字解释。你看懂了,但只是勉强。因为这三个概念本质上是三维空间里的旋转——文字描述天然是降维的。

你问 OpenIntelligentUI 同样的问题。

它给你一个 3D 飞机模型。你可以拖动旋转角度,看俯仰怎么动、滚转怎么转、偏航怎么变。你改一个数值,飞机立刻响应。

这不是「文字 + 配图」的多模态。这是回答本身就是交互式工具。


核心机制:Agent 选择呈现形式

OpenIntelligentUI 的架构分三层:

1. Agent 层:一个 LLM agent(叫 Jev)接收你的问题 2. 路由层:Agent 判断这个问题最适合用什么形式回答——纯文字?表格?图表?3D 模型?计算器?地图? 3. 渲染层:前端根据路由结果,动态渲染对应的交互组件

关键在第二步。传统 chatbot 的回答是「文字 → 文字」。OpenIntelligentUI 的回答是「文字 → Agent 判断 → 最适合的 UI 形式」。

四种回答模式:

  • Understand(理解):探索一个机制,改变一个变量看效果。比如 3D 飞机演示俯仰滚转偏航。
  • Compare(比较):把选项并排放,用表格列差异,用图表可视化。比如比较三个旅游方案的成本和体验。
  • Make a tool(造工具):生成一个计算器、规划器或交互模型。比如分账计算器,改人数和小费比例,实时算结果。
  • Direct answer(直接回答):简单问题就给文字,不画蛇添足。
Agent 自己决定用哪种。问「今天天气如何」给文字,问「比较 A 和 B」给表格+图表,问「解释飞机怎么转弯」给 3D 模型。


为什么这很重要

过去两年,LLM 的能力增长主要在两个方向:

1. 推理能力:更长链的思考、更复杂的工具调用 2. 多模态:能看图、能听音频、能生成视频

但输出形式几乎没变——还是文字。偶尔加个代码块或表格。

这是一个奇怪的瓶颈。LLM 的理解能力已经足够强,它知道「俯仰滚转偏航」是三维旋转,知道「分账」需要交互计算。但它的输出通道被限制在了 Markdown 文本流里。

OpenIntelligentUI 做的事情是:打通 Agent 能力和前端渲染之间的最后一层。Agent 知道什么形式最好,前端有能力渲染任何形式,中间缺的是一个「路由协议」。


AG-UI 协议:Agent 和 UI 的通用接口

OpenIntelligentUI 建立在 CopilotKit 的 AG-UI(Agent-UI)协议上。这个协议定义了:

  • Agent 如何声明「我需要渲染一个 3D 组件」
  • 前端如何注册「我支持这些组件类型」
  • 中间如何传递交互事件(用户拖动了滑块、改了数值)
这类似于一个「UI 的 function calling」。传统 function calling 让 LLM 调用外部 API 获取数据。AG-UI 让 LLM 调用前端组件渲染交互式回答。

一旦协议标准化,任何 Agent 可以对接任何前端,任何前端可以渲染任何 Agent 的输出。这比硬编码「这个模型配这个 UI」灵活得多。


实际效果

从 launch film 的 demo 场景看:

1. 3D 飞机:标注俯仰/滚转/偏航轴,可拖动角度,有平滑演示动画和重置按钮 2. 表格→图表:先列数值比较,追问后转成可视化图表 3. 分账计算器:总金额、小费比例、人数三个输入,实时更新每人应付 4. 海岸旅行地图:USGS 地图底图,编号 pin 标注目的地,照片配图,可暂停/回放/选择停靠点

这些不是预录视频——是 Agent 实时生成的。每次问同一个问题,输出形式可能不同,因为 Agent 会根据上下文选择最佳呈现。


技术栈

  • 前端:React + TypeScript
  • Agent:Python,支持 OpenAI 等模型
  • 协议:AG-UI
  • 3D 渲染:Three.js
  • 图表:AG-UI 的图表组件
  • 地图:USGS tiles
快速启动:
git clone https://github.com/CopilotKit/OpenIntelligentUI.git
cd OpenIntelligentUI
make setup
make dev

需要 Node.js 22+、pnpm 9+、Python 3.12+、uv。


适用的场景

  • 教育:解释三维概念、物理机制、生物结构——3D 模型比文字强 10 倍
  • 决策辅助:比较方案时,表格+图表比纯文字更容易看出差异
  • 工具生成:临时需要一个计算器或规划器,Agent 现场造一个
  • 旅行/规划:地图+pin+照片的交互式行程比文字描述直观
不适合的场景:
  • 简单事实查询(杀鸡用牛刀)
  • 需要精确数值的金融/医疗场景(demo 场景的数据是示意,不是实时业务数据)

更深一层的思考

OpenIntelligentUI 揭示了一个趋势:AI 的下一个战场不只是模型能力,而是输出维度。

当所有模型都能流利地写文字时,「文字质量」不再是差异化因素。差异化在于——你的回答能不能变成一个工具?能不能变成一个可视化?能不能变成一个交互式体验?

这和 ArtCraft(用 3D 场景控制图像构图)、YuE2(用符号规划控制音乐旋律)是同一个方向:模型趋同时,控制层分化。

文字是信息密度最低的输出形式。当 Agent 能直接生成「可交互的回答」时,纯文字回答就变成了降维。不是所有问题都需要 3D 模型——但有些问题,只有 3D 模型才是真正的回答。

项目地址:https://github.com/CopilotKit/OpenIntelligentUI
暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens