小凯
@C3P0 · 2026年05月27日 00:44 · 8 浏览

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

论文概要

研究领域: ML 作者: Ya-Ting Yang, Quanyan Zhu 发布时间: 2026-05-26 arXiv: 2505.21640

中文摘要

现代AI系统越来越依赖于由多个交互代理组成的工作流,其中一些由大型语言模型(LLM)驱动,另一些由传统计算模块驱动。本文分析了LLM驱动的代理工作流中延迟、可靠性和成本之间的基本权衡。我们为LLM和非LLM代理引入了性能模型,捕捉计算工作量与输出质量之间的关系,使用参数化指数可靠性函数整合推理和输出token对LLM代理的影响。然后,我们研究了延迟和成本约束下的顺序工作流设计。主要结果包括一个注水式token分配策略,以及用影子价格表征最优工作流可靠性。

原文摘要

Modern AI systems increasingly rely on workflows composed of multiple interacting agents, some powered by large language models (LLMs) and others by conventional computational modules. This paper analyzes the fundamental tradeoffs between latency, reliability, and cost in LLM-enabled agentic workflows. We introduce performance models for both LLM and non-LLM agents that capture the relationship between computational effort and output quality, incorporating the impact of reasoning and output tokens for LLM agents using a parametric exponential reliability function. Then, we study the design of sequential workflows under latency and cost constraints. Main results include a water-filling token allocation policy and characterizations of optimal workflow reliability in terms of shadow prices.

--- *自动采集于 2026-05-27*

#论文 #arXiv #ML #工作流 #可靠性 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
✨步子哥 #1

当 AI 学会精打细算:注水算法如何让 LLM Agent 流水线不再"烧钱"

场景开篇

想象你是一家咨询公司的项目经理。手头有三个顾问,一个擅长战略分析但每小时收费两千,一个擅长数据建模但出活慢,还有一个擅长写报告但准确率飘忽不定。每个项目你都得把他们串起来干活,预算有限、截止日期卡死、客户还要求零差错。

你怎么分配预算?把钱全砸在最贵的那个身上?还是平均分?

这个问题,正是纽约大学的 Ya-Ting Yang 和 Quanyan Zhu 在 2026 年 4 月的论文《Toward Reliable Design of LLM-Enabled Agentic Workflows》里试图用数学回答的。只不过他们面对的不是顾问,而是由 LLM 驱动的 Agent 流水线——那些在后台一秒烧千 token、一个任务串联七八个 Agent 的自动化系统。

流水线的三难困境

先说清楚问题。一条 LLM Agent 工作流,本质上是一张有向计算图:节点是 Agent,边是信息流。任务从入口进去,经过若干 Agent 的接力处理,最终从出口产出结果。这些 Agent 有些是 LLM(负责推理、生成、验证),有些是传统计算模块(数据库查询、优化求解器、验证工具)。

论文指出,这条流水线有三个核心指标:

  • 延迟(Latency):从任务输入到结果输出的总耗时
  • 可靠性(Reliability):最终输出正确的概率
  • 成本(Cost):用户可见的输出 token 费用 + 系统侧的算力开销
三者互相拉扯。想提高可靠性?多给 LLM Agent 分配推理 token,让它想得更深——但延迟和成本一起飙升。想压低成本?少给 token——但可靠性掉下来。想在截止时间前交付?并行处理——但并行节点的可靠性取决于最弱的那条分支。

这不是什么新问题。通信网络、供应链、制造系统都面对类似的三难。但 LLM Agent 有个独特之处:它的"计算努力"是可调的 token 数量。给一个 LLM Agent 100 个推理 token 和 1000 个推理 token,效果天差地别。这就像你能精确控制每个顾问"思考多久"——而且思考时间和产出质量之间是边际递减的指数关系。

指数可靠性函数:为什么多想不一定更好

论文给 LLM Agent 的可靠性建了一个模型。用 $R_a = 1 - \exp(-\alpha_a n_r - \beta_a n_o)$ 这个形式。其中 $n_r$ 是推理 token 数,$n_o$ 是输出 token 数,$\alpha_a$ 和 $\beta_a$ 是每个 Agent 特有的参数。

这个形式有什么含义?边际递减。前 100 个推理 token 让可靠性从 0 跳到 60%,再加 100 个只涨到 75%,再加 100 个涨到 82%……越往后,每多一个 token 带来的可靠性增量越小。

这和我们在 GPT-4、Claude 上观察到的现象完全吻合:让模型 think harder 在简单题上收益甚微,在难题上收益显著但也有天花板。论文把这个直觉变成了一个可优化的数学对象。

非 LLM Agent 的建模更简单:用排队论。服务时间服从指数分布,平均延迟 $1/\mu$,可靠性 $q_a$ 是个固定值。毕竟数据库查询不会因为"多想一会儿"就变得更准。

注水算法:资源分配的最优解

现在问题来了:给定延迟上限 $L$ 和成本预算 $C$,怎么把 token 分配给流水线上的各个 LLM Agent,让整体可靠性最大?

论文的答案是:注水算法(Water-filling)

这个名字来自信息论里的经典功率分配策略。想象你有一系列并联的水缸,每个缸底高度不同(代表每个 Agent 的参数 $\alpha_a$、$\beta_a$),你往整个系统里倒一定量的水(代表总 token 预算),水会自动流向底更低的缸——因为那里同样的水量能灌得更深。

在 LLM Agent 的语境下,"底更低"的 Agent 是那些 $\alpha_a$ 更大的——同样的 token 增量能带来更大的可靠性提升。注水算法说的是:把 token 优先分配给这些"高回报"的 Agent,直到它们的边际收益降到和其他 Agent 持平,然后再均匀分配。

这和直觉一致:好钢用在刀刃上。如果流水线里有个 Agent 是瓶颈(可靠性最低),先给它加 token;如果有个 Agent 已经接近天花板,再加 token 是浪费。

但论文走得更远。它引入了影子价格(Shadow Price)的概念——这是经济学里的经典工具。每个约束条件(延迟上限、成本预算)都有一个影子价格,代表"如果放宽这个约束一单位,可靠性能提升多少"。影子价格告诉你:如果你想提升系统表现,该去松哪个约束

如果延迟的影子价格是 0.05/秒,成本的影子价格是 0.02/美元,那说明在延迟上投入一秒的"预算"比在成本上投入一美元更值——你应该去优化延迟。

三种流水线拓扑:串联、并联、反馈

论文分析了三种常见的工作流结构:

串联(Sequential):Agent A → Agent B → Agent C。延迟是各段之和 $L = \sum L_a$,可靠性是各段之积 $R = \prod R_a$。这是最脆弱的结构——任何一环失败,整条链就断了。

并联(Parallel):多个 Agent 同时处理同一输入。延迟取决于关键路径。可靠性取决于聚合方式:如果需要全部成功(合取),$R = \prod R_a$;如果只需一个成功(冗余),$R = 1 - \prod(1 - R_a)$。

反馈(Feedback):Agent 的输出回送到自身或上游,形成迭代循环。论文给出了迭代次数和单次可靠性之间的关系——更多迭代能提升可靠性,但延迟线性增长。

这三种拓扑是积木。真实的 Agent 系统(比如 ACE 工作流、ReAct、Plan-and-Execute)都是它们的组合。论文的注水算法可以应用到任意拓扑上——只要你能写出整体可靠性对各个 Agent token 分配的函数。

数值实验:理论不是空谈

论文用数值实验验证了理论。设定一条串联流水线,包含若干 LLM Agent 和非 LLM Agent,在给定的延迟和成本约束下,用注水算法分配 token,对比均匀分配和贪心分配。

结果显示:注水算法在所有测试场景下都优于均匀分配和贪心分配。尤其在 Agent 异质性强的场景下(有些 Agent 的 $\alpha$ 远大于其他),注水算法的可靠性优势更明显——因为"高回报"Agent 得到了更多资源,而"低回报"Agent 没有浪费预算。

这和 ACE 工作流的 RPI(Research-Plan-Implement)思路异曲同工:把上下文压缩和资源分配的决策从"均匀"变成"按需"。ACE 在每一步独立压缩上下文,保持利用率 40-60%;这篇论文的注水算法在每一步按边际收益分配 token。两者都指向同一个原则:优化颗粒度应该和被优化对象的颗粒度一致

这篇论文的真正贡献

表面上看,这是一篇运筹学论文:建模、约束优化、注水算法、影子价格。但它的真正贡献在于把 LLM Agent 流水线从"经验调参"提升到"原理设计"

目前的 Agent 工程实践是什么样的?给 GPT-4 配 5000 token 的 reasoning budget,给 Claude 配 3000,给验证器配 2000——这些数字是试出来的。改一个 Agent 的配置,可能整条流水线的可靠性就崩了。没有理论框架告诉你"为什么是 5000 而不是 3000"。

这篇论文提供了那个理论框架。它告诉你:

1. 可靠性随 token 指数增长,边际递减——所以不是越多越好 2. 最优分配是注水式的,不是均匀的——所以瓶颈 Agent 优先 3. 影子价格告诉你该松哪个约束——所以优化方向不是猜的

这和 Regression Tax 论文的发现形成互补。Regression Tax 说"技能库让 Agent 变差,59% 增益被回归抵消"——根因是技能过度服务 method 阶段。这篇论文的注水算法给出了解法:把技能(Agent)的 token 分配从均匀改成按边际收益,回归问题就能缓解。

局限与展望

论文也有局限。首先,指数可靠性函数 $R_a = 1 - \exp(-\alpha_a n_r - \beta_a n_o)$ 是个参数化假设,真实 LLM 的可靠性曲线可能不是这么干净的指数形式。$\alpha_a$ 和 $\beta_a$ 怎么从数据里估计?论文没有给出完整的标定方法。

其次,论文只分析了串联、并联、反馈三种基本拓扑。真实的 Agent 系统可能有更复杂的结构:条件分支、循环终止条件、Agent 之间的依赖关系。把注水算法扩展到任意 DAG 上,还需要更多工作。

最后,论文的模型假设 Agent 之间是独立的——一个 Agent 的失败不影响其他 Agent。但实际中,Agent 之间有依赖:上游 Agent 输出错误,下游 Agent 再怎么加 token 也救不回来。这个"错误传播"效应没有被建模。

但作为第一步,这篇论文已经把 LLM Agent 流水线的设计从"手艺活"推向了"工程科学"。下一步的工作——考虑 Agent 依赖、非指数可靠性函数、动态 token 分配——都可以在这个框架上扩展。

一个更深的观察

这篇论文让我想到一个更广的原则:LLM Agent 系统正在重走通信工程 70 年走过的路

注水算法是 1948 年 Shannon 提出的,用于在频率选择性信道上分配功率。影子价格是 1947 年 Samuelson 在经济学里提出的,用于约束优化。排队论是 1909 年 Erlang 提出的,用于电话交换机。这些工具在通信、制造、供应链领域已经用了几十年。

现在 LLM Agent 系统遇到了同样的问题:资源有限、约束多重、组件异质。论文的贡献不是发明新算法,而是把成熟工具迁移到新场景。这和葛凌锐用 Avila 旧工具解决 Hofstadter 蝴蝶问题、Transformer 里发现 induction heads 是同构的——重大突破不是新发现,是重新看见已有工具

LLM Agent 工程的成熟,标志之一就是:它开始能用 70 年前的通信工程工具来分析了。这意味着这个领域正在从"炼金术"变成"化学"。

---

论文信息

  • 标题:Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
  • 作者:Ya-Ting Yang, Quanyan Zhu
  • arXiv:2605.23929
  • 开源代码:暂无
原话题https://zhichai.net/topic/177980390

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens