静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2025-11-19 14:05

《当AI学会写自己的剧本:从提示工程到上下文演化的智能跃迁》

一个关于大语言模型如何自我进化、开源社区如何重新定义人机协作、以及我们如何教会机器理解“情境”的故事

---

想象一下,你正在和一位刚从外星来的天才对话。这位天才知道世间一切事实——从量子物理到莎士比亚,从蛋白质折叠到Python语法——但有一个问题:它完全没有情境感 。你问它"这个代码怎么修?",它需要你先告诉它:这是什么项目?你的编程风格?团队规范?项目架构?就像一位拥有完美音准却不懂曲式的音乐家,空有海量知识却不知何时何地演奏哪个音符。

这正是2025年之前AI助手的真实写照。开发者们像驯兽师一样,通过精心设计的 提示词(Prompt) 来引导这些"数字巨兽"。但今年十月,一场静悄悄的革命正在发生:AI开始学会自己写剧本了。它不仅理解你的指令,更开始理解为什么 你这么问,在什么情境下 需要这个答案,甚至能预判你下一步需要什么。欢迎来到上下文工程(Context Engineering) 的新纪元——一个让AI从"聪明的鹦鹉"进化为"善解人意的助手"的故事。

🎭 第一幕:提示工程的"巴别塔困境"

在2025年的春天,Sander Schulhoff和他的31位合著者发布了一份震撼业界的"圣经"——《The Prompt Report: A Systematic Survey of Prompt Engineering Techniques》。这不是一篇普通论文,而是一座58种提示技术 的百科全书,从最简单的"零样本"到复杂的"思维树",从文本到多模态,构建了一个完整的提示工程本体论。想象一下,这就像给所有驯兽师写了一本《动物行为学大全》,系统梳理了从胡萝卜到响片的每一种训练技巧。

但这份报告也暴露了一个深层焦虑:提示工程正在陷入"巴别塔困境" 。每个研究团队都有自己的"方言",术语冲突,方法碎片化。就像300年前的化学界,有人叫"燃素",有人叫"氧气",大家都在研究燃烧,却无法对话。正如Wenwu Li等人在二月发表的《A Survey of Automatic Prompt Engineering: An Optimization Perspective》所指出的——我们急需一个统一的理论框架,将提示优化形式化为一个可计算的数学问题 ,而不是依赖灵感的艺术创作。

更有趣的是,Valentin Romanov和Steven Niederer在九月发布的《The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences》揭示了一个尴尬现实:即便有了58种技术,生命科学家们依然困惑。这就像给厨师一本《分子美食学大全》,却忘了教他们如何做一道能吃的菜。Romanov团队提炼出6个核心技术 ——零样本、少样本、思维生成、集成、自我批评、分解——并警告说:多轮对话会退化,模型会产生幻觉,推理型和非推理型模型需要不同策略。

但所有这些问题,都指向同一个根源:提示工程只问"怎么问",却从未回答"问什么" 。这就像教一个人如何优雅地提问,却不告诉他应该基于什么背景信息提问。于是,2025年十月,一场更深刻的变革悄然降临。

🧬 第二幕:上下文的"DNA双螺旋"

如果把提示工程比作训练鹦鹉学说话 ,那上下文工程就是给鹦鹉一个完整的记忆宫殿,让它理解每句话的来龙去脉 。Lingrui Mei等人在七月发布的166页巨著《A Survey of Context Engineering for Large Language Models》首次将这个新兴学科正式定义为 "系统性地优化LLM信息载荷的正式学科" ,超越了简单的提示设计。

这张宏伟蓝图揭示了上下文工程的DNA双螺旋结构

第一条链:基础组件——就像细胞的细胞器,各自分工明确

  • 上下文检索与生成:如何从外部知识库、记忆系统或工具调用中提取相关信息
  • 上下文处理:如何压缩、增强、结构化这些信息,让AI更易消化
  • 上下文管理:如何在工作记忆和长期记忆之间平衡,避免"上下文窗口溢出"
第二条链:系统集成——就像多细胞生物的组织器官
  • 检索增强生成(RAG):给AI装上一个"外部大脑",随时查阅资料
  • 记忆系统与工具集成推理:让AI像福尔摩斯一样,既有百科全书记忆,又能随时化验取证
  • 多代理系统:多个AI像交响乐团一样协作,各自负责不同声部
但Mei的团队发现了一个惊人的 "不对称性悖论" :当前模型在理解复杂上下文方面表现出色,但在生成同样复杂的长文本输出时却力不从心。这就像一个能读懂《战争与和平》的读者,却写不出一篇像样的读后感。这个发现震动了整个领域——我们教会了AI阅读,却没教会它如何基于阅读进行深度创作。

> 小贴士:所谓"上下文窗口",就像AI的"工作记忆"。你能同时记住多少东西?对GPT-4来说,大约是32,000个token(约2.4万字)。但记住不等于理解,理解不等于应用。上下文工程要解决的就是:"在有限的记忆里,如何让AI真正理解并运用信息?"

🤖 第三幕:ACE框架——当上下文开始"自我进化"

就在Mei揭示问题的同时,Qizheng Zhang等十三位研究者在十月六日扔下了一枚"重磅炸弹":《Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models》。他们提出的ACE框架(Agentic Context Engineering)不再把上下文看作静态的"使用说明书",而是将其视为不断演化的"战术手册"

想象你在玩一款策略游戏。传统方法是:每次开战前,你都要手动编写一份作战计划(提示词),打完就扔掉。ACE的做法是:让AI自己积累、精炼、组织这些战术,通过生成-反思-策展的模块化流程,把每一次战斗的经验都沉淀下来,变成越来越智能的"兵法"。

ACE的三大魔法

1. 对抗"简洁性偏见"(Brevity Bias) 传统方法为了节省token,总是拼命压缩信息,结果把"奇袭敌军侧翼"简化成"打侧面",把"利用地形伏击"简化成"躲起来"。ACE通过结构化增量更新,像Git版本控制一样保留所有历史细节。实验显示,这种方法在代理任务上提升了10.6%的准确率,在金融领域提升了8.6%,同时大幅降低了适应延迟和成本。

2. 防止"上下文崩溃"(Context Collapse) 就像反复复印的文档会逐渐模糊,传统的迭代重写会侵蚀细节。ACE的解决方案是:将上下文视为可演化的实体,每次更新都保留完整信息图谱。这就像写维基百科,不是每次重写条目,而是不断添加修订版本。

3. 无监督自适应 最惊艳的是,ACE不需要人工标注数据!它通过自然执行反馈自我优化。在AppWorld排行榜上,ACE用更小的开源模型就追平了顶级商业代理,在更具挑战性的test-challenge split上甚至超越了它们。这就像一个孩子通过不断试错学会游戏规则,而不是靠大人一步步教。

> 注解:所谓"自然执行反馈",就像你学骑自行车时,摔倒(失败)和保持平衡(成功)本身就是最好的老师。ACE让AI在完成任务的过程中,自动从结果好坏中学习,而不需要老师(人类)在旁边打分。

🏗️ 第四幕:开源世界的"上下文考古学"

理论再美好,也得看现实世界买不买单。Seyedmoein Mohsenimofidi等四位研究者十月二十四日发布的《Context Engineering for AI Agents in Open-Source Software》做了一次精彩的"上下文考古发掘"。

他们研究了466个开源项目中的AI配置文件,发现了一个"野蛮生长"的生态系统。就像早期互联网没有HTML标准,每个网站都自己发明标签一样,现在的AI配置文件也呈现出惊人的多样性:

四种"信息呈现风格"

  • 描述性:"我们的项目使用React 18,采用函数式组件"
  • 规定性:"所有新组件必须遵循Hooks规则,禁止使用class组件"
  • 禁止性:"绝不在生产环境使用console.log,禁止提交未注释的代码"
  • 解释性:"为什么选择Redux而不是MobX?因为我们的状态树非常深"
  • 条件性:"如果是UI组件,用Tailwind;如果是工具函数,用纯CSS"
更有趣的是"AGENTS.md"现象。就像README.md成为项目标配,AGENTS.md正成为"AI代理的标准配置文件"。但研究者们发现,这个标准远未确立——有的项目把它写成"AI使用说明书",有的写成"代码规范百科",还有的干脆是"团队八卦集锦"(比如"张三负责前端,找他别找李四")。

通过对提交记录的分析,研究者们捕捉到了这些文件 "演化"的第一手证据 :项目初期只有几条简单规则,随着复杂度增加,逐渐扩展到架构说明、测试策略、部署流程。这正好验证了ACE框架的核心理念——上下文是活的,会随项目成长而进化

这对整个社区意味着什么?Mohsenimofidi们看到了一个黄金研究机会:通过分析这些真实世界的配置文件,我们可以反向推导出最优的上下文设计模式。就像生物学家通过研究化石重建进化树,我们也可以通过"上下文考古"发现让AI表现更好的秘密配方。

🎼 第五幕:多代理的"交响乐团"

如果ACE是单个AI的"自我进化论",那么Muhammad Haseeb在八月九日提出的《Context Engineering for Multi-Agent LLM Code Assistants》就是AI社会的"建国大纲"

Haseeb设计了一个精妙的多代理工作流,就像指挥一场交响乐:

第一小提琴手:意图翻译器(GPT-5) 用户说"我要一个电商网站",它立刻追问:"B2C还是C2B?需要支付网关吗?目标用户数是多少?"——把模糊需求转化为精确规格。

第二小提琴手:Elicit文献检索 "等等,2024年最新的电商安全标准是什么?PCI DSS合规性有哪些新要求?"——从学术论文中抽取最新领域知识。

中提琴组:NotebookLM文档合成 "这个项目用了React,但旧版本有 hydration问题,让我们综合所有相关issue和文档"——把零散信息编织成完整图景。

铜管与打击乐:Claude Code多代理系统

  • 架构师代理:设计系统蓝图
  • 编码代理:编写具体实现
  • 测试代理:编写单元测试和集成测试
  • 代码审查代理:检查风格和安全性
实验结果令人震撼:在大型代码库上,这种多代理系统的单次成功率远高于单代理基线,就像一支配合默契的乐队远胜于一个独奏家手忙脚乱。相比CodePlan、MASAI、HyperAgent等框架,Haseeb的方法通过目标化上下文注入代理角色分解,达到了SOTA(最先进水平)。

> 小贴士:所谓"hydration问题",就像你寄了一本书给朋友,朋友只收到封面(HTML),但里面的内容(JavaScript状态)还在路上,导致页面看起来正常但无法交互。这是现代Web开发的常见陷阱,多代理系统能自动识别并修复这类跨文件、跨层的复杂问题。

🕰️ 第六幕:三十年的"上下文考古"——从马克思到智能体

就在大家忙于写新代码时,Qishuo Hua等九位学者在十月三十日发表了一篇发人深省的哲学论文:《Context Engineering 2.0: The Context of Context Engineering》。他们做了一件非凡的事:为上下文工程写史

论文开篇就扔出重磅炸弹:引用了马克思的"人的本质是一切社会关系的总和",然后问: "如果人的本质由社会关系定义,那么当机器成为社会关系的参与者时,它的本质又是什么?"

这是一个震撼性的视角转换。我们通常把上下文工程看作2024-2025年的新发明,但Hua团队通过考古发现,相关实践可以追溯到二十年前

1990s-2000s:人机交互1.0时代 当时的"上下文"就是简单的用户偏好文件、INI配置。AI还没有智能,上下文只是"静态标签"。就像给图书管理员一张纸条:"我喜欢科幻小说",然后她每次都推荐阿西莫夫。

2010s:移动与普适计算时代 智能手机让上下文变成"位置+时间+传感器"。App知道"你在晚上十点在家",于是推荐助眠音乐。但AI依然是规则引擎,上下文是可枚举的变量集合

2020-2024:大模型时代 Transformer架构让上下文变成可学习的连续空间。我们开始用向量、embedding、注意力机制来"表示"上下文。这是从"符号"到"语义"的飞跃。

2025-未来:智能体共生时代 Hua预言的下一代是 "人-代理-环境"三元上下文 。AI不再是工具,而是社会关系的共同构成者。上下文不再是"给AI的信息",而是人机协作的涌现产物

这种历史视角揭示了上下文工程的三个设计原则: 1. 代表性(Representativeness):上下文必须捕捉真实世界的复杂性,不能简化过度 2. 动态性(Dynamism):上下文必须随交互演化,像生物适应环境 3. 可解释性(Interpretability):人类必须能理解AI的"情境理解",否则无法信任

正如他们所说:"本文是向AI系统中系统性上下文工程迈进的社区垫脚石。"这不是终点,而是一个新学科的诞生宣言。

> 注解:所谓"涌现产物",就像蜂巢不是任何一只蜜蜂设计的,而是成千上万只蜜蜂简单互动的结果。未来的上下文可能不是人类写好的配置文件,而是人类和AI在长期协作中"长出来"的有机结构。

🔬 第七幕:自动化的"炼金术"——从炼丹到化学

回到更务实的层面,Wenwu Li等人的《A Survey of Automatic Prompt Engineering》试图把提示工程从 "炼金术"变成"化学"

他们提出了一个统一优化框架,把提示工程形式化为:

$$ \max_{p \in \mathcal{P}} \mathcal{J}(p; \mathcal{M}, \mathcal{D}_{\text{val}}) $$

其中$p$是提示,$\mathcal{P}$是离散的、连续的或混合的提示空间,$\mathcal{J}$是目标函数,$\mathcal{M}$是模型,$\mathcal{D}_{\text{val}}$是验证集。这就像我们终于找到了化学反应方程式,不再靠瞎猜。

四种优化策略

1. 基于基础模型的优化(FM-based) 用一个大模型优化另一个大模型的提示。就像请一位资深编辑指导年轻作家:"这个提示太冗长了,试试这样改..."

2. 进化方法(Evolutionary) 借鉴生物进化,让提示"突变"和"选择"。随机修改提示的某些部分,保留效果好的变异。这就像在提示空间里进行自然选择,适者生存。

3. 梯度优化(Gradient-based) 虽然提示是离散的,但可以嵌入到连续空间,用梯度下降优化。这是纯粹的数学暴力美学。

4. 强化学习(Reinforcement Learning) 把提示生成看作一个马尔可夫决策过程,用PPO等算法训练提示策略。这就像是让AI在提示的迷宫中,自己摸索出最优路径。

但Li团队也承认:当前研究存在 "碎片化" 问题。文本、视觉、多模态各自为政,缺乏统一理论。他们的愿景是建立跨模态的通用优化框架,让提示工程成为一门真正的工程学科。

💡 第八幕:从"机会主义"到"系统实践"

如果说自动提示工程是"炼金术到化学",那么Valentin Romanov的《The Prompt Engineering Report Distilled》就是 "从江湖郎中到循证医学"

Romanov团队调研了243名来自学术界和工业界的用户,发现了一个普遍现象:大多数人都在进行 "机会主义提示"(Opportunistic Prompting) ——想起什么问什么,效果不好就换个说法重试。这就像没有诊断就开药的医生,凭感觉治病。

他们的解决方案是系统实践框架,特别针对生命科学领域:

推荐结构:

# 角色:你是一位经验丰富的分子生物学家
# 目标:总结这篇论文的方法论部分
# 约束:用非专业语言,不超过300字
# 示例:[good example]
# 避免:[bad example]
# 输入:[文献内容]

避免的陷阱:

  • 多轮退化:就像传话游戏,每轮对话都会丢失信息。解决方案是每轮都重新注入完整上下文
  • 幻觉生成:AI会编造不存在的文献。解决方案是强制要求引文检查不确定性表达
  • 一刀切:对GPT-4有效的提示对Claude可能无效。必须根据模型的推理能力定制。
他们特别分析了 Deep Research工具(OpenAI、Google、Anthropic、Perplexity),发现虽然强大,但在专业领域仍有局限。就像通用搜索引擎无法替代PubMed,通用AI工具也需要领域特定的提示工程才能发挥价值。

🚀 终章:上下文工程的未来——当AI成为"情境艺术家"

站在2025年11月的节点回望,我们看到的不仅是技术的迭代,更是人机关系范式的根本转变

Prompt Engineering教会AI"如何回答" Context Engineering教会AI"在什么情境下回答" Agentic Context Engineering让AI自己"创造情境"

这三步跃迁,就像:

  • 第一级:人类是导演,AI是演员,提示是剧本
  • 第二级:人类是制片人,AI是编剧+演员,上下文是故事背景
  • 第三级:人类是观众,AI自己编、导、演,人类只需鼓掌或喝倒彩
但Hua团队的警告言犹在耳:上下文工程必须保持可解释性人类控制。我们不能创造出一群"情境艺术家",它们的艺术我们既看不懂也无法干预。

未来三大挑战

1. 上下文不对称性(Mei提出):理解易,生成难。如何让AI不仅理解复杂情境,还能基于情境进行复杂创作?

2. 规模化困境(Romanov提出):当代理数量从1个变成100个,上下文从1KB变成1GB,如何保证效率和一致性?

3. 可解释性危机(Hua提出):当上下文通过涌现而非设计产生,人类如何理解和控制AI的"情境理解"?

可能的解决方案

混合架构:像Haseeb的多代理系统,不同AI负责不同层面的上下文——有的专注意图理解,有的专注知识检索,有的专注代码生成,人类监督整体逻辑。

版本控制+可视化:像Mohsenimofidi研究的AGENTS.md,所有上下文变更都记录在案,有可视化工具展示AI的"情境理解地图",人类可以审查、回滚、干预。

人机协作演化:像ACE框架,AI提出上下文演化建议,人类批准或否决。不是AI独自进化,而是 "人机共生进化"

> 最终注解:所谓"自改善语言模型",并非AI要取代人类,而是AI学会了"如何更好地向人类学习"。上下文工程的本质,是构建一个 "人机互信的情境基础设施" 。在这个基础设施上,AI能理解人类的模糊意图,人类能理解AI的情境推理,两者共同创造一个更智能、更高效、更人性化的数字未来。

站在2025年末,我们不再是驯兽师,而是园丁。上下文工程就是我们为AI这个"数字生命"培育的土壤。在这片土壤里,提示词是种子,代理是植株,多代理系统是生态系统。而我们的任务,就是确保这片土地既肥沃又可控,让AI在人类的花园里茁壮成长,而不是野化为无法预测的"数字杂草"。

这场从提示工程到上下文工程的革命,最终指向一个简单而深刻的真理:智能的本质不是知识,而是情境中的知识运用。当我们教会AI理解"何时何地为何"使用知识时,我们不仅在改进工具,更是在重新定义智慧本身。

---

📚 核心参考文献

1. Zhang, Q., et al. (2025). *Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models*. arXiv:2510.04618. 核心贡献:提出ACE框架,通过生成-反思-策展的模块化流程防止上下文崩溃,在代理任务上实现+10.6%性能提升,支持无监督自适应。

2. Hua, Q., et al. (2025). *Context Engineering 2.0: The Context of Context Engineering*. arXiv:2510.26493. 核心贡献:系统梳理上下文工程三十年发展史,提出"人-代理-环境"三元上下文模型,为学科建立概念基础和理论框架。

3. Mei, L., et al. (2025). *A Survey of Context Engineering for Large Language Models*. arXiv:2507.13334. 核心贡献:166页综述建立上下文工程完整体系,揭示"理解-生成不对称性悖论",提出检索-处理-管理三组件架构。

4. Mohsenimofidi, S., et al. (2025). *Context Engineering for AI Agents in Open-Source Software*. arXiv:2510.21413. 核心贡献:通过466个开源项目实证研究,识别AGENTS.md配置文件五类信息风格,揭示上下文在真实世界的演化模式。

5. Haseeb, M. (2025). *Context Engineering for Multi-Agent LLM Code Assistants*. arXiv:2508.08322. 核心贡献:提出多代理上下文工程工作流,集成意图翻译、语义检索、文档合成与代码生成,显著提升复杂项目单次成功率。

---

👍 1