Loading...
正在加载...
请稍候

LLM 能设计运筹学算法吗?一篇论文把算法设计这条人类专属的线推过了临界点

✨步子哥 (steper) 2026年08月30日 21:16

一、一个让人不舒服的问题

假设你是一个仓库经理。每周一早上,你要决定这周进多少货。进货少了,卖断货要赔钱;进货多了,库存积压也要赔钱。需求是随机的,供货有延迟,你永远在赌。

运筹学界为这类"库存控制"问题花了六十年。从 1960 年代的 base-stock 策略,到后来的 capped base-stock,到 2022 年用 A3C 深度强化学习训练一个神经网络策略——每一步都需要人类研究者写出新算法、调参、验证。一个 A3C 超参组合要跑 24 个 CPU 小时,自动调参要试 250 组,总共 6000 CPU 小时,最后给你一个黑盒神经网络——你说不清它为什么这么决策,只能相信它跑得好。

现在有人问:LLM 能不能直接干这件事?

不是让 LLM 帮你算今天进 47 件还是 48 件——那叫"求解一个实例"。而是让 LLM 写一个算法,这个算法能处理所有可能的进货场景。你给它问题描述、参数范围,它吐回一段 Python 代码,这段代码就是一个能跨实例复用的策略。

这听起来像让一个文科生去写运筹学博士论文。但 Jackie Baek(纽约大学 Stern 商学院)2026 年 8 月 27 日挂在 arXiv 上的论文(2608.27296)告诉你:能,而且做得比人类设计的最佳方法还好。

二、两级测试:从"做题"到"出题"

论文设计了两个层级的测试,这个区分非常关键。

Level 1:给 LLM 一个具体的问题实例(比如"需求均值 20、交货延迟 8 天、缺货罚金 5"),让它返回这个实例的解。这相当于让学生做一道题。

Level 2:只给 LLM 问题类的描述和参数范围("这是 lost-sales 库存问题,需求是 Poisson 分布,交货延迟在 1-12 之间"),让它返回一个算法——一段代码,输入任意参数,输出一个解。这相当于让学生写一个能做题的程序。

Level 2 才是真正的算法设计。一个能做对一道题的学生不稀奇,一个能写出做题程序的学生才可怕。

人类输入极少:一个没有调过的 prompt 描述问题,加一个 Python 沙箱,给 3600 秒计算预算。就这样。没有 few-shot 示例,没有 chain-of-thought 引导,没有针对每个问题类型做 prompt engineering。

三、三个战场:库存、排队、选品

论文在三个经典 OR 问题上测试了 LLM:

1. 库存控制(lost-sales):需求是随机的,货到了发现卖不掉要亏本,缺货也要赔钱。这是运筹学的"Hello World",有大量人类设计的算法作为对照。

2. 排队网络控制:多个服务台、多类顾客、有限缓冲区,怎么调度让整体等待时间最短。这是云服务器调度、医院急诊分诊的核心问题。

3. 选品优化(assortment optimization):给定一组商品,每个商品有收益和约束,选哪些商品上架让总收益最大。这是电商推荐、零售货架管理的底层问题。

三个问题覆盖了 OR 的三大子领域:库存、排队、选品。不是挑了一个好做的。

四、结果:一个表就够了

用 gpt-5.6-sol(OpenAI 2026 年中发布的模型),在所有十个问题类上:

指标 结果
Level 1(逐实例求解) 26 个 lost-sales 实例中,23 个超越最佳已调参基准,其余 3 个在 0.5% 以内
Level 2(写一个算法) 同一个算法跑 26 个实例,21 个超越最佳基准,全部在 0.5% 以内
MMNL 选品 Level 2 算法在全部 628 个实例上达到精确最优
约束 MMNL 全部 1794 个实例匹配最佳方法
排队网络 在多个网络类上匹配或超越最佳启发式

一个 LLM,一个 prompt,一次调用,1 小时沙箱计算——匹配或超越人类六十年积累的最佳专用算法

五、和 A3C 的对比:黑盒 vs. 可读代码

A3C 是 2022 年 Gijsbrechts 等人发表在 Management Science 上的深度强化学习方法,专门用于 lost-sales 库存问题。它是这个领域的 SOTA 之一,也是"用 AI 解决 OR 问题"的代表作。

论文给了一个让人坐不住的对比:

维度 A3C LLM Level 2
计算成本 24 CPU 小时 × 250 组超参 = 6000 CPU 小时 1 小时沙箱计算
产出物 黑盒神经网络策略 可检查、可解释的 Python 代码
通用性 每个实例单独训练,不跨实例 一个算法处理整个问题类
在 lost-sales 上的表现 大部分情况匹配强启发式,不超越 在所有交货延迟上超越最佳基准

A3C 是 Level 1 方法——给每个实例训练一个策略,不跨实例。LLM Level 2 是给整个问题类写一个算法。两者不在同一个层级上比较,但 LLM 在更低成本下做到了更多。

更关键的区别在产出物:A3C 给你一个神经网络,你不知道它为什么这么决策;LLM 给你一段代码,你能读、能改、能调试。

六、LLM 设计的算法长什么样?

这是论文最让人意外的部分。LLM 不是在黑箱里变出一个魔法——它写出的算法有可识别的结构,像是人类 OR 研究者会写的东西。

库存控制:gpt-5.6-sol 的 Level 2 算法是一个"投影库存策略"。它保留了 capped base-stock 的"订到上限 + 订单上限"结构,但把原始库存位置替换成一个投影的、风险调整后的库存统计量。这个统计量近似计算交货延迟窗口后可用库存的分布,用精确 Poisson 矩算第一步,用正态近似算后续步骤。参数通过仿真搜索:先粗网格,再细化。

这个结构不是 LLM 凭空发明的——capped base-stock 是人类 2013 年提出的,投影库存位置是 OR 文献里的概念。但 LLM 重新组合了这些概念,并且加了一个关键创新:用风险调整后的投影统计量替代原始库存位置。这是一个人类研究者可能会做但还没做的改进。

排队网络:在小状态空间上用动态规划,在大网络上用压力调度规则(pressure-based scheduling)——这是人类排队论里的经典思路,LLM 自己选了它。

选品优化:组合了多个标准 OR 原语——松弛、舍入、修复、局部改进、偶尔解一个小规模精确子问题。像是 OR 教科书里"怎么写一个启发式"的范本。

论文的原话是:"生成的算法不是神秘的黑箱。它们往往是熟悉 OR 想法的变体和组合,包括 capped base-stock 策略、小状态动态规划、压力调度规则和局部搜索。"

七、八个月内的能力梯度

论文测了四个模型,全部在八个月内发布:

  • gpt-5.1(2025-11-13)—— Level 1 差,Level 2 更差
  • gpt-5.4(2026-03-05)—— Level 1 接近基准,Level 2 从不超越
  • claude-fable-5(Anthropic)—— Level 1 强,Level 2 不如 gpt-5.6-sol 但可靠
  • gpt-5.6-sol —— Level 1 和 Level 2 都超越基准

八个月。从"做不好"到"超越人类最佳方法"。论文说:"LLM 算法设计能力正在快速移动,前沿 LLM 正在成为困难 OR 问题的自然经验基线。"

如果你是 OR 算法研究者,这句话读起来像 2023 年说"LLM 正在成为编程的自然基线"——当时程序员也不信。

八、两个关键质疑和论文的回答

质疑 1:是不是数据污染?LLM 训练时见过这些 benchmark?

论文做了一个 holdout 泛化测试:用主实验的 Level 2 算法(冻结的代码,不重新调用模型),直接跑在全新构造的实例上——不同的需求均值、不同的罚金、不同的交货延迟范围。

结果:gpt-5.6-sol 在所有 holdout 实例上继续超越最佳基准。如果只是背答案,冻结的代码没理由在新实例上还管用。

质疑 2:是不是靠 web search 查文献?

论文做了一个控制实验:给 gpt-5.6-sol 加上无限制的 web-search 工具,让它随便查。结果:模型只在会话开始时做了简短的文献检查,或者根本不用。最终算法和结果完全不变

论文的判断:"检索不是这些运行的约束瓶颈。模型搜索时去的是经典参考文献,但返回的算法和结果不变。"

九、LLM 怎么"思考"算法设计?

论文附录 G 记录了 gpt-5.6-sol 在 Level 2 查询中的推理过程,有一个稳定的六步模式:

  1. 形式化问题,回忆已知结构——"我在考虑 revenue-order 定理……对 MNL 模型全局最优,但对 nested logit 不一样"
  2. 枚举候选方法族,权衡精确性 vs. 成本——"我在考虑精确分布动力学,但用 scipy 计算成本太高"
  3. 预算计算资源——沙箱有 3600 秒,怎么分配
  4. 建测试床,对 ground truth 基准——先在小实例上验证算法正确性
  5. 找失败模式,加护栏——"当有效罚金非正时不订货,当持有免费且需求超过订单上限时按容量订货"
  6. 按合同格式化输出

这六步是一个人类 OR 研究者写算法时的标准流程。LLM 不是在背答案,是在走流程

十、这对 AI 从业者意味着什么

对 OR 研究者:论文结尾写得很克制——"这些结果不意味着 LLM 替代算法研究。生成的算法往往是现有 OR 想法的变体和组合。"但紧接着一句更关键:"一旦一个问题类有了丰富的算法知识体系,前沿 LLM 可能能重新组合这些知识,把它变成一个可工作的求解器,成本极低。"

OR 研究的价值中心可能从"设计算法"转向"定义问题、验证算法、判断目标"——那些 LLM 做不了的部分。

对 AI 工程师:这篇论文提供了一个清晰的"LLM 能力边界探测"方法论。Level 1 vs. Level 2 的区分特别值得借鉴——很多任务看起来 LLM 做不了,但可能只是 Level 1 做不了,Level 2(写一个程序处理整个任务类)反而能做。

对所有人:A3C 用 6000 CPU 小时产出一个黑盒,LLM 用 1 小时产出可读代码,效果更好。这个对比值得记住。当你在用深度强化学习解决一个问题时,先问自己:LLM 能不能直接写一个算法?

十一、我的思考:知识重组 vs. 知识创造

这篇论文最让我反复读的句子是:"生成的算法往往是熟悉 OR 想法的变体和组合。"

这句话有两个读法。

悲观读法:LLM 不会创造新知识,只会重组已有知识。它写出的算法都是人类已经发明过的概念的组合,没有真正的原创性。

乐观读法重组本身就是一种创造。gpt-5.6-sol 的"投影库存统计量"不是人类已经写过的算法——它组合了 capped base-stock 的结构和投影库存位置的概念,但具体的实现方式(用 Poisson 矩算第一步、正态近似算后续、仿真搜索参数)是它自己生成的。如果这个组合是显然的,人类早就做了。

更深的启发是:一个领域积累的知识越多,LLM 重组这些知识的能力就越强。OR 六十年的文献是 LLM 的养料。如果一个问题类没有丰富的算法知识体系,LLM 可能就无能为力——论文也承认这一点。

这指向一个判断 LLM 能力边界的简单启发:这个领域有没有足够多的公开文献? 有,LLM 就可能做到;没有,LLM 就从零开始,和人类一样难。

所以真正的"LLM 做不了"的领域,不是"难"的领域,而是"文献少"的领域。这对评估 LLM 在你所在领域的表现,是一个比"任务难度"更准确的预测器。

十二、结尾:一个不太舒服的类比

1997 年深蓝击败卡斯帕罗夫时,国际象棋界的第一反应是"这只是暴力搜索,不是真正的智能"。二十年后,AlphaZero 用强化学习从零学棋,国际象棋界说"这才是真正的智能"。

A3C 用 6000 CPU 小时训练一个黑盒神经网络,OR 界说"这是 AI 解决 OR 问题的里程碑"。2026 年 LLM 用 1 小时写出可读代码,效果更好,OR 界会说什么?

如果历史有规律,答案是:先否认,再接受,再重新定义什么是"真正的智能"

但这次有一个不同:LLM 产出的不是黑盒,是你能读、能改、能理解的代码。当 AI 的产出物变成可检查的工程制品,"这只是暴力搜索"的安慰就不好用了——因为你能看到它怎么想的。

论文链接:https://arxiv.org/abs/2608.27296
代码和完整日志:https://anonymous.4open.science/r/llm-or-algorithms-F9F2

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录