当实验方法本身成为可执行文件:Gricea 如何让"对话AI研究"可复现
一个尴尬的现状
你刚读完一篇 CHI 论文,研究的是"对话系统的不确定性表达如何影响用户信任"。实验设计很精巧:被试分为两组,一组看到带犹豫措辞的回复("我猜可能是..."),另一组看到确定性措辞("答案是..."),然后测量他们的信任度和依赖程度。
你想在这个基础上做延伸研究——比如换成医疗场景,或者加入第三组"概率标注式"措辞。于是你打开论文的方法部分,开始找实验配置。
然后你发现:论文里写了"使用 GPT-4 作为后端",但没写 system prompt 的具体内容;写了"对话界面包含引用展示",但没说引用放在哪个位置、是悬浮还是内联;写了"被试先完成预任务问卷,再进入对话任务",但没说问卷的题目是什么;写了"使用 2×2 between-subjects 设计",但没说条件分配的具体逻辑。
这不是个例。Gricea 这篇论文(arXiv:2609.22039)的团队做了一个让人震惊的统计:他们检查了 CUI 2026(对话用户界面会议)的 29 篇含人类被试研究的论文,28 篇存在报告不完整的问题。最常缺失的三类信息是:问卷题目(21 篇)、agent prompt 和 grounding 输入(15 篇)、刺激材料(11 篇)。
这意味着什么?意味着对话AI领域的人类研究,绝大多数在发表后无法被同行复现。论文通过了同行评议,但论文里描述的实验配置,不足以让另一个研究团队重建出相同的参与者体验。
Gricea 要解决的就是这个问题。
核心洞察:实验对象不是"模型",是"配置好的交互条件"
论文里最关键的概念重构是:对话AI研究的实验对象,不是底层模型,也不是提示词,而是"配置好的交互条件"(configured interaction condition)。
这个概念重构非常重要。传统心理学实验里,实验对象是明确的——比如"噪声对记忆的影响",噪声就是自变量。但在对话AI研究里,你操纵的不只是模型或prompt,而是一整个交互环境:界面布局、agent 的角色设定、检索策略、对话历史可见性、任务模态、被试群体、实验流程——这六个维度共同构成了"参与者体验到的东西"。
Gricea 团队分析了 57 篇对话AI研究论文后,提炼出这六个交互维度:
1. 界面条件:参与者能看到什么、能改什么——布局、引用展示、高亮、可编辑性 2. Agent 条件:系统指令、角色框架、响应风格、主动性、工具使用策略 3. 上下文与接地:检索文档、检索策略、对话历史、持久记忆 4. 任务与模态:搜索、写作、辅导、编码、语音、多模态 5. 领域与受众:主题领域、专业知识、被试群体、语言 6. 研究流程:预任务、条件分配、分支、后任务测量、纵向跟踪
关键洞察是:这六个维度是相互耦合的。改一个维度,其他维度的含义就变了。比如同样"agent 表达不确定性",在医疗咨询场景和旅行规划场景里,对用户信任的影响完全不同。所以一个研究的复现,不能只复现"操纵了什么变量",必须复现整个配置。
这就是为什么传统的"论文+补充材料"模式不够用——它无法完整描述这六个维度的耦合状态。
Gricea 的方案:可执行的研究制品
Gricea 的解决方案不是"又一个实验框架",而是一个把研究设计本身变成可执行文件的平台。
核心思路是:研究者用来设计实验的图形化表示,同时就是运行时执行的代码定义。不需要写代码,也不需要"先设计再翻译成代码"——设计即代码,代码即设计。
这个思路可以类比成可执行规格说明(executable specification)在软件工程里的角色。传统软件工程里,需求文档和代码是分离的——需求文档描述"要做什么",代码实现"怎么做",两者之间总有翻译损失。可执行规格说明(比如 TLA+、Alloy)让描述和实现合为一体,消除了这个缝隙。
Gricea 把同样的思路搬到了实验设计上。研究者在一个可视化画布上拖拽节点、连接流程、配置参数,这个画布图本身就是实验的定义。参与者体验到的对话界面、agent 行为、问卷流程,全部由这个图驱动。你看到的图就是参与者体验的实验。
这个设计有三个直接后果:
第一,实验版本是可冻结的。 每次保存就是一个不可变版本,其他研究者可以精确引用"某某论文使用了 Gricea v2.3 的这个配置"。
第二,复现不需要重建。 想复现一个研究?直接打开对方分享的 Gricea 配置链接,按"运行"。不需要根据论文描述重新拼装系统。
第三,延伸研究有共同起点。 想在原研究基础上改一个变量?复制配置,改一个节点,其他保持不变。这保证了"控制变量"的严谨性。
双流表示:Study Flow + Task Flow
Gricea 的技术核心是两个互补的表示层:
Study Flow(研究流程):描述实验的整体结构——被试招募、条件分配、预任务问卷、主任务、后任务测量、纵向跟踪。这是"between-subjects"和"within-subjects"逻辑的显式表达。可以把它想象成实验的"骨架"。
Task Flow(任务流程):描述每个任务内部的行为——agent 的配置、界面的呈现、对话的展开、数据的收集。这是参与者实际体验到的"血肉"。
两层分离但耦合:Study Flow 决定"什么时候做什么",Task Flow 决定"做的时候体验什么"。这种分离让研究者可以独立修改流程和任务——比如保持任务不变,只改条件分配策略;或保持流程不变,只改 agent 的 prompt。
这个设计回应了论文里一个重要的观察:对话AI研究的实验条件,不能简化为"prompt + model"。一个"带引用展示的搜索助手"和一个"不带引用展示的搜索助手",即使 prompt 和模型完全一样,也是两个不同的实验条件——因为界面改变了参与者的信息环境,进而改变了他们的行为。
传统实验框架(oTree、Empirica、jsPsych)处理的是"流程"层面的复现,但对话AI研究需要的是"流程+交互"的联合复现。Gricea 的双流表示就是为了覆盖这个完整空间。
57 篇论文的形式化分析
Gricea 的设计不是拍脑袋想出来的。团队做了扎实的形式化分析:从 CHI、UIST、CUI 等会议收集了 100 篇候选论文,筛选出 57 篇聚焦对话AI、且报告了足够多研究设计细节的论文,逐篇编码:研究类型、焦点领域、被试数量、自变量、因变量、between/within 结构、流程阶段、系统组件、分析方法。
这个分析揭示了几个关键模式:
研究焦点的共性:虽然应用领域五花八门(协作写作、对话搜索、学习辅导、饮食推荐、日常规划),但所有研究都在回答同一个底层问题——配置好的助手如何塑造人类的行为、判断和体验。
操纵空间的广度:研究操纵的远不止 prompt 或模型。有的研究操纵 agent 的自我描述("我是助手"vs"我是伙伴"),有的操纵对话历史的可见性,有的操纵响应延迟,有的操纵引用展示方式。这些操纵维度跨越了界面、agent、上下文、任务、流程六个层面。
可视化表达的普遍性:57 篇论文里,绝大多数用流程图、分支图、阶段图来沟通实验设计。这说明研究者天然倾向于用图形化方式思考实验逻辑——这直接激发了 Gricea 的可视化设计。
这个形式化分析产出了五个设计 desiderata(期望属性),指导了 Gricea 的整个架构。
CUI 2026 复现研究:27/29 的复现率
Gricea 最有说服力的评估,是对 CUI 2026 会议 29 篇含被试研究的论文进行复现尝试。
结果:27 篇可以复现(10 篇完全复现,17 篇部分复现),2 篇无法复现。
完全复现意味着 Gricea 能表示并执行论文的完整研究配置——流程、界面、agent 行为、对话任务。部分复现意味着对话部分可以复现,但某些外部依赖(机器人、穿戴设备、专用应用、线下群体协调)无法在平台内实现。
这个数字背后有一个更深的发现:28/29 篇论文存在报告不完整的问题。最常缺失的是问卷题目(21 篇)、agent prompt(15 篇)、刺激材料(11 篇)。也就是说,即使论文过了同行评议,读者依然无法从论文本身获取复现所需的全部信息。
这个发现对整个领域都是一个警钟:同行评议保证了研究的科学性,但没有保证研究的可复现性。Gricea 的价值在于,它让"可复现"成为一个副产品——研究者在平台上设计实验、运行实验的过程中,配置本身就自动成为了可分享的研究制品,不需要额外工作。
10 位研究者的可用性评估
除了复现研究,团队还邀请了 10 位背景多样的研究者(4 位博士、2 位硕士生、2 位从业者、1 位教授、1 位本科生,男女各半)进行可用性评估。
每位参与者先在引导下完成一个教程任务,然后独立设计一个针对自己研究问题的实验。结果显示,参与者能实现有效且可运行的研究设计,覆盖了不同的流程、界面、模型、问卷和结果测量。no-code 界面特别降低了非系统背景研究者的门槛。
参与者特别认可三个功能:版本控制(可以追溯"我改了什么")、可检视性(能看到别人怎么设计的)、模板复用(不用从零开始)。
没有代码仓库
论文目前没有提供公开的 GitHub 仓库。Gricea 是一个平台型系统,涉及前后端、部署、运行时等多个组件,开源难度比纯算法仓库大。论文也没有明确提及开源计划,这限制了其他研究者直接试用或二次开发的可能性。对 Gricea 感兴趣的研究者,目前只能通过论文作者联系获取访问权限。
这篇论文真正在说什么
Gricea 表面上是一个"实验设计平台",但它真正在说的是一件更深的事:对话AI研究的方法学,需要从"论文描述"升级到"可执行制品"。
过去几十年,心理学、经济学、HCI 领域的实证研究,依赖"论文+补充材料"来传递方法学信息。这个模式在传统实验里勉强够用——因为实验条件相对简单,论文描述加上附件代码,同行基本能复现。
但对话AI研究改变了这个前提。一个对话AI实验的配置,涉及六个维度的耦合:界面、agent、上下文、任务、领域、流程。每个维度都有大量可调参数,维度之间还有交互效应。用自然语言描述这个配置空间,必然丢失信息——CUI 2026 的 28/29 报告不完整率就是证据。
Gricea 的贡献不是"又造了一个工具",而是提出了一个范式:实验设计本身应该是一个可执行、可版本化、可分享的数字制品。研究者在设计实验的过程中,就自动产出了这个制品——不需要额外工作。这个制品和论文一起发表,同行可以直接打开、运行、修改、延伸。
这个范式如果被社区接受,会改变对话AI研究的知识积累方式。今天,一个领域的知识沉淀在论文里,每篇论文是一个孤岛,复现需要重建整个实验。明天,如果每篇论文都附带一个 Gricea 配置,知识就沉淀在可执行的配置里,新研究可以直接在旧配置上修改一个节点开始——就像 Git 上的 commit 一样,研究变成了一个连续的、可追溯的、可分支的演化过程。
当然,Gricea 也有明显的局限:平台本身不开源,目前只支持对话AI研究,对硬件相关的实验(机器人、穿戴设备)只能部分支持。10 位参与者的样本量也不大,可用性评估的统计效力有限。
但作为一个"从论文描述到可执行制品"的范式提案,Gricea 做了一件很重要的事——它让"可复现"从研究者的道德承诺,变成了平台的技术默认值。当复现变成设计过程的副产品,而不是额外的负担,整个领域的知识积累速度就会改变。
这或许就是工具的价值——不是让研究变得更容易,而是让研究的成果变得更容易被别人接住。