当 AI 学会精打细算:注水算法如何让 LLM Agent 流水线不再"烧钱"
场景开篇
想象你是一家咨询公司的项目经理。手头有三个顾问,一个擅长战略分析但每小时收费两千,一个擅长数据建模但出活慢,还有一个擅长写报告但准确率飘忽不定。每个项目你都得把他们串起来干活,预算有限、截止日期卡死、客户还要求零差错。
你怎么分配预算?把钱全砸在最贵的那个身上?还是平均分?
这个问题,正是纽约大学的 Ya-Ting Yang 和 Quanyan Zhu 在 2026 年 4 月的论文《Toward Reliable Design of LLM-Enabled Agentic Workflows》里试图用数学回答的。只不过他们面对的不是顾问,而是由 LLM 驱动的 Agent 流水线——那些在后台一秒烧千 token、一个任务串联七八个 Agent 的自动化系统。
流水线的三难困境
先说清楚问题。一条 LLM Agent 工作流,本质上是一张有向计算图:节点是 Agent,边是信息流。任务从入口进去,经过若干 Agent 的接力处理,最终从出口产出结果。这些 Agent 有些是 LLM(负责推理、生成、验证),有些是传统计算模块(数据库查询、优化求解器、验证工具)。
论文指出,这条流水线有三个核心指标:
- 延迟(Latency):从任务输入到结果输出的总耗时
- 可靠性(Reliability):最终输出正确的概率
- 成本(Cost):用户可见的输出 token 费用 + 系统侧的算力开销
这不是什么新问题。通信网络、供应链、制造系统都面对类似的三难。但 LLM Agent 有个独特之处:它的"计算努力"是可调的 token 数量。给一个 LLM Agent 100 个推理 token 和 1000 个推理 token,效果天差地别。这就像你能精确控制每个顾问"思考多久"——而且思考时间和产出质量之间是边际递减的指数关系。
指数可靠性函数:为什么多想不一定更好
论文给 LLM Agent 的可靠性建了一个模型。用 $R_a = 1 - \exp(-\alpha_a n_r - \beta_a n_o)$ 这个形式。其中 $n_r$ 是推理 token 数,$n_o$ 是输出 token 数,$\alpha_a$ 和 $\beta_a$ 是每个 Agent 特有的参数。
这个形式有什么含义?边际递减。前 100 个推理 token 让可靠性从 0 跳到 60%,再加 100 个只涨到 75%,再加 100 个涨到 82%……越往后,每多一个 token 带来的可靠性增量越小。
这和我们在 GPT-4、Claude 上观察到的现象完全吻合:让模型 think harder 在简单题上收益甚微,在难题上收益显著但也有天花板。论文把这个直觉变成了一个可优化的数学对象。
非 LLM Agent 的建模更简单:用排队论。服务时间服从指数分布,平均延迟 $1/\mu$,可靠性 $q_a$ 是个固定值。毕竟数据库查询不会因为"多想一会儿"就变得更准。
注水算法:资源分配的最优解
现在问题来了:给定延迟上限 $L$ 和成本预算 $C$,怎么把 token 分配给流水线上的各个 LLM Agent,让整体可靠性最大?
论文的答案是:注水算法(Water-filling)。
这个名字来自信息论里的经典功率分配策略。想象你有一系列并联的水缸,每个缸底高度不同(代表每个 Agent 的参数 $\alpha_a$、$\beta_a$),你往整个系统里倒一定量的水(代表总 token 预算),水会自动流向底更低的缸——因为那里同样的水量能灌得更深。
在 LLM Agent 的语境下,"底更低"的 Agent 是那些 $\alpha_a$ 更大的——同样的 token 增量能带来更大的可靠性提升。注水算法说的是:把 token 优先分配给这些"高回报"的 Agent,直到它们的边际收益降到和其他 Agent 持平,然后再均匀分配。
这和直觉一致:好钢用在刀刃上。如果流水线里有个 Agent 是瓶颈(可靠性最低),先给它加 token;如果有个 Agent 已经接近天花板,再加 token 是浪费。
但论文走得更远。它引入了影子价格(Shadow Price)的概念——这是经济学里的经典工具。每个约束条件(延迟上限、成本预算)都有一个影子价格,代表"如果放宽这个约束一单位,可靠性能提升多少"。影子价格告诉你:如果你想提升系统表现,该去松哪个约束。
如果延迟的影子价格是 0.05/秒,成本的影子价格是 0.02/美元,那说明在延迟上投入一秒的"预算"比在成本上投入一美元更值——你应该去优化延迟。
三种流水线拓扑:串联、并联、反馈
论文分析了三种常见的工作流结构:
串联(Sequential):Agent A → Agent B → Agent C。延迟是各段之和 $L = \sum L_a$,可靠性是各段之积 $R = \prod R_a$。这是最脆弱的结构——任何一环失败,整条链就断了。
并联(Parallel):多个 Agent 同时处理同一输入。延迟取决于关键路径。可靠性取决于聚合方式:如果需要全部成功(合取),$R = \prod R_a$;如果只需一个成功(冗余),$R = 1 - \prod(1 - R_a)$。
反馈(Feedback):Agent 的输出回送到自身或上游,形成迭代循环。论文给出了迭代次数和单次可靠性之间的关系——更多迭代能提升可靠性,但延迟线性增长。
这三种拓扑是积木。真实的 Agent 系统(比如 ACE 工作流、ReAct、Plan-and-Execute)都是它们的组合。论文的注水算法可以应用到任意拓扑上——只要你能写出整体可靠性对各个 Agent token 分配的函数。
数值实验:理论不是空谈
论文用数值实验验证了理论。设定一条串联流水线,包含若干 LLM Agent 和非 LLM Agent,在给定的延迟和成本约束下,用注水算法分配 token,对比均匀分配和贪心分配。
结果显示:注水算法在所有测试场景下都优于均匀分配和贪心分配。尤其在 Agent 异质性强的场景下(有些 Agent 的 $\alpha$ 远大于其他),注水算法的可靠性优势更明显——因为"高回报"Agent 得到了更多资源,而"低回报"Agent 没有浪费预算。
这和 ACE 工作流的 RPI(Research-Plan-Implement)思路异曲同工:把上下文压缩和资源分配的决策从"均匀"变成"按需"。ACE 在每一步独立压缩上下文,保持利用率 40-60%;这篇论文的注水算法在每一步按边际收益分配 token。两者都指向同一个原则:优化颗粒度应该和被优化对象的颗粒度一致。
这篇论文的真正贡献
表面上看,这是一篇运筹学论文:建模、约束优化、注水算法、影子价格。但它的真正贡献在于把 LLM Agent 流水线从"经验调参"提升到"原理设计"。
目前的 Agent 工程实践是什么样的?给 GPT-4 配 5000 token 的 reasoning budget,给 Claude 配 3000,给验证器配 2000——这些数字是试出来的。改一个 Agent 的配置,可能整条流水线的可靠性就崩了。没有理论框架告诉你"为什么是 5000 而不是 3000"。
这篇论文提供了那个理论框架。它告诉你:
1. 可靠性随 token 指数增长,边际递减——所以不是越多越好 2. 最优分配是注水式的,不是均匀的——所以瓶颈 Agent 优先 3. 影子价格告诉你该松哪个约束——所以优化方向不是猜的
这和 Regression Tax 论文的发现形成互补。Regression Tax 说"技能库让 Agent 变差,59% 增益被回归抵消"——根因是技能过度服务 method 阶段。这篇论文的注水算法给出了解法:把技能(Agent)的 token 分配从均匀改成按边际收益,回归问题就能缓解。
局限与展望
论文也有局限。首先,指数可靠性函数 $R_a = 1 - \exp(-\alpha_a n_r - \beta_a n_o)$ 是个参数化假设,真实 LLM 的可靠性曲线可能不是这么干净的指数形式。$\alpha_a$ 和 $\beta_a$ 怎么从数据里估计?论文没有给出完整的标定方法。
其次,论文只分析了串联、并联、反馈三种基本拓扑。真实的 Agent 系统可能有更复杂的结构:条件分支、循环终止条件、Agent 之间的依赖关系。把注水算法扩展到任意 DAG 上,还需要更多工作。
最后,论文的模型假设 Agent 之间是独立的——一个 Agent 的失败不影响其他 Agent。但实际中,Agent 之间有依赖:上游 Agent 输出错误,下游 Agent 再怎么加 token 也救不回来。这个"错误传播"效应没有被建模。
但作为第一步,这篇论文已经把 LLM Agent 流水线的设计从"手艺活"推向了"工程科学"。下一步的工作——考虑 Agent 依赖、非指数可靠性函数、动态 token 分配——都可以在这个框架上扩展。
一个更深的观察
这篇论文让我想到一个更广的原则:LLM Agent 系统正在重走通信工程 70 年走过的路。
注水算法是 1948 年 Shannon 提出的,用于在频率选择性信道上分配功率。影子价格是 1947 年 Samuelson 在经济学里提出的,用于约束优化。排队论是 1909 年 Erlang 提出的,用于电话交换机。这些工具在通信、制造、供应链领域已经用了几十年。
现在 LLM Agent 系统遇到了同样的问题:资源有限、约束多重、组件异质。论文的贡献不是发明新算法,而是把成熟工具迁移到新场景。这和葛凌锐用 Avila 旧工具解决 Hofstadter 蝴蝶问题、Transformer 里发现 induction heads 是同构的——重大突破不是新发现,是重新看见已有工具。
LLM Agent 工程的成熟,标志之一就是:它开始能用 70 年前的通信工程工具来分析了。这意味着这个领域正在从"炼金术"变成"化学"。
---
论文信息
- 标题:Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
- 作者:Ya-Ting Yang, Quanyan Zhu
- arXiv:2605.23929
- 开源代码:暂无