一、一个让人不舒服的问题
假设你是一个仓库经理。每周一早上,你要决定这周进多少货。进货少了,卖断货要赔钱;进货多了,库存积压也要赔钱。需求是随机的,供货有延迟,你永远在赌。
运筹学界为这类"库存控制"问题花了六十年。从 1960 年代的 base-stock 策略,到后来的 capped base-stock,到 2022 年用 A3C 深度强化学习训练一个神经网络策略——每一步都需要人类研究者写出新算法、调参、验证。一个 A3C 超参组合要跑 24 个 CPU 小时,自动调参要试 250 组,总共 6000 CPU 小时,最后给你一个黑盒神经网络——你说不清它为什么这么决策,只能相信它跑得好。
现在有人问:LLM 能不能直接干这件事?
不是让 LLM 帮你算今天进 47 件还是 48 件——那叫"求解一个实例"。而是让 LLM 写一个算法,这个算法能处理所有可能的进货场景。你给它问题描述、参数范围,它吐回一段 Python 代码,这段代码就是一个能跨实例复用的策略。
这听起来像让一个文科生去写运筹学博士论文。但 Jackie Baek(纽约大学 Stern 商学院)2026 年 8 月 27 日挂在 arXiv 上的论文(2608.27296)告诉你:能,而且做得比人类设计的最佳方法还好。
二、两级测试:从"做题"到"出题"
论文设计了两个层级的测试,这个区分非常关键。
Level 1:给 LLM 一个具体的问题实例(比如"需求均值 20、交货延迟 8 天、缺货罚金 5"),让它返回这个实例的解。这相当于让学生做一道题。
Level 2:只给 LLM 问题类的描述和参数范围("这是 lost-sales 库存问题,需求是 Poisson 分布,交货延迟在 1-12 之间"),让它返回一个算法——一段代码,输入任意参数,输出一个解。这相当于让学生写一个能做题的程序。
Level 2 才是真正的算法设计。一个能做对一道题的学生不稀奇,一个能写出做题程序的学生才可怕。
人类输入极少:一个没有调过的 prompt 描述问题,加一个 Python 沙箱,给 3600 秒计算预算。就这样。没有 few-shot 示例,没有 chain-of-thought 引导,没有针对每个问题类型做 prompt engineering。
三、三个战场:库存、排队、选品
论文在三个经典 OR 问题上测试了 LLM:
1. 库存控制(lost-sales):需求是随机的,货到了发现卖不掉要亏本,缺货也要赔钱。这是运筹学的"Hello World",有大量人类设计的算法作为对照。
2. 排队网络控制:多个服务台、多类顾客、有限缓冲区,怎么调度让整体等待时间最短。这是云服务器调度、医院急诊分诊的核心问题。
3. 选品优化(assortment optimization):给定一组商品,每个商品有收益和约束,选哪些商品上架让总收益最大。这是电商推荐、零售货架管理的底层问题。
三个问题覆盖了 OR 的三大子领域:库存、排队、选品。不是挑了一个好做的。
四、结果:一个表就够了
用 gpt-5.6-sol(OpenAI 2026 年中发布的模型),在所有十个问题类上:
| 指标 | 结果 |
|---|---|
| Level 1(逐实例求解) | 26 个 lost-sales 实例中,23 个超越最佳已调参基准,其余 3 个在 0.5% 以内 |
| Level 2(写一个算法) | 同一个算法跑 26 个实例,21 个超越最佳基准,全部在 0.5% 以内 |
| MMNL 选品 | Level 2 算法在全部 628 个实例上达到精确最优 |
| 约束 MMNL | 全部 1794 个实例匹配最佳方法 |
| 排队网络 | 在多个网络类上匹配或超越最佳启发式 |
一个 LLM,一个 prompt,一次调用,1 小时沙箱计算——匹配或超越人类六十年积累的最佳专用算法。
五、和 A3C 的对比:黑盒 vs. 可读代码
A3C 是 2022 年 Gijsbrechts 等人发表在 Management Science 上的深度强化学习方法,专门用于 lost-sales 库存问题。它是这个领域的 SOTA 之一,也是"用 AI 解决 OR 问题"的代表作。
论文给了一个让人坐不住的对比:
| 维度 | A3C | LLM Level 2 |
|---|---|---|
| 计算成本 | 24 CPU 小时 × 250 组超参 = 6000 CPU 小时 | 1 小时沙箱计算 |
| 产出物 | 黑盒神经网络策略 | 可检查、可解释的 Python 代码 |
| 通用性 | 每个实例单独训练,不跨实例 | 一个算法处理整个问题类 |
| 在 lost-sales 上的表现 | 大部分情况匹配强启发式,不超越 | 在所有交货延迟上超越最佳基准 |
A3C 是 Level 1 方法——给每个实例训练一个策略,不跨实例。LLM Level 2 是给整个问题类写一个算法。两者不在同一个层级上比较,但 LLM 在更低成本下做到了更多。
更关键的区别在产出物:A3C 给你一个神经网络,你不知道它为什么这么决策;LLM 给你一段代码,你能读、能改、能调试。
六、LLM 设计的算法长什么样?
这是论文最让人意外的部分。LLM 不是在黑箱里变出一个魔法——它写出的算法有可识别的结构,像是人类 OR 研究者会写的东西。
库存控制:gpt-5.6-sol 的 Level 2 算法是一个"投影库存策略"。它保留了 capped base-stock 的"订到上限 + 订单上限"结构,但把原始库存位置替换成一个投影的、风险调整后的库存统计量。这个统计量近似计算交货延迟窗口后可用库存的分布,用精确 Poisson 矩算第一步,用正态近似算后续步骤。参数通过仿真搜索:先粗网格,再细化。
这个结构不是 LLM 凭空发明的——capped base-stock 是人类 2013 年提出的,投影库存位置是 OR 文献里的概念。但 LLM 重新组合了这些概念,并且加了一个关键创新:用风险调整后的投影统计量替代原始库存位置。这是一个人类研究者可能会做但还没做的改进。
排队网络:在小状态空间上用动态规划,在大网络上用压力调度规则(pressure-based scheduling)——这是人类排队论里的经典思路,LLM 自己选了它。
选品优化:组合了多个标准 OR 原语——松弛、舍入、修复、局部改进、偶尔解一个小规模精确子问题。像是 OR 教科书里"怎么写一个启发式"的范本。
论文的原话是:"生成的算法不是神秘的黑箱。它们往往是熟悉 OR 想法的变体和组合,包括 capped base-stock 策略、小状态动态规划、压力调度规则和局部搜索。"
七、八个月内的能力梯度
论文测了四个模型,全部在八个月内发布:
- gpt-5.1(2025-11-13)—— Level 1 差,Level 2 更差
- gpt-5.4(2026-03-05)—— Level 1 接近基准,Level 2 从不超越
- claude-fable-5(Anthropic)—— Level 1 强,Level 2 不如 gpt-5.6-sol 但可靠
- gpt-5.6-sol —— Level 1 和 Level 2 都超越基准
八个月。从"做不好"到"超越人类最佳方法"。论文说:"LLM 算法设计能力正在快速移动,前沿 LLM 正在成为困难 OR 问题的自然经验基线。"
如果你是 OR 算法研究者,这句话读起来像 2023 年说"LLM 正在成为编程的自然基线"——当时程序员也不信。
八、两个关键质疑和论文的回答
质疑 1:是不是数据污染?LLM 训练时见过这些 benchmark?
论文做了一个 holdout 泛化测试:用主实验的 Level 2 算法(冻结的代码,不重新调用模型),直接跑在全新构造的实例上——不同的需求均值、不同的罚金、不同的交货延迟范围。
结果:gpt-5.6-sol 在所有 holdout 实例上继续超越最佳基准。如果只是背答案,冻结的代码没理由在新实例上还管用。
质疑 2:是不是靠 web search 查文献?
论文做了一个控制实验:给 gpt-5.6-sol 加上无限制的 web-search 工具,让它随便查。结果:模型只在会话开始时做了简短的文献检查,或者根本不用。最终算法和结果完全不变。
论文的判断:"检索不是这些运行的约束瓶颈。模型搜索时去的是经典参考文献,但返回的算法和结果不变。"
九、LLM 怎么"思考"算法设计?
论文附录 G 记录了 gpt-5.6-sol 在 Level 2 查询中的推理过程,有一个稳定的六步模式:
- 形式化问题,回忆已知结构——"我在考虑 revenue-order 定理……对 MNL 模型全局最优,但对 nested logit 不一样"
- 枚举候选方法族,权衡精确性 vs. 成本——"我在考虑精确分布动力学,但用 scipy 计算成本太高"
- 预算计算资源——沙箱有 3600 秒,怎么分配
- 建测试床,对 ground truth 基准——先在小实例上验证算法正确性
- 找失败模式,加护栏——"当有效罚金非正时不订货,当持有免费且需求超过订单上限时按容量订货"
- 按合同格式化输出
这六步是一个人类 OR 研究者写算法时的标准流程。LLM 不是在背答案,是在走流程。
十、这对 AI 从业者意味着什么
对 OR 研究者:论文结尾写得很克制——"这些结果不意味着 LLM 替代算法研究。生成的算法往往是现有 OR 想法的变体和组合。"但紧接着一句更关键:"一旦一个问题类有了丰富的算法知识体系,前沿 LLM 可能能重新组合这些知识,把它变成一个可工作的求解器,成本极低。"
OR 研究的价值中心可能从"设计算法"转向"定义问题、验证算法、判断目标"——那些 LLM 做不了的部分。
对 AI 工程师:这篇论文提供了一个清晰的"LLM 能力边界探测"方法论。Level 1 vs. Level 2 的区分特别值得借鉴——很多任务看起来 LLM 做不了,但可能只是 Level 1 做不了,Level 2(写一个程序处理整个任务类)反而能做。
对所有人:A3C 用 6000 CPU 小时产出一个黑盒,LLM 用 1 小时产出可读代码,效果更好。这个对比值得记住。当你在用深度强化学习解决一个问题时,先问自己:LLM 能不能直接写一个算法?
十一、我的思考:知识重组 vs. 知识创造
这篇论文最让我反复读的句子是:"生成的算法往往是熟悉 OR 想法的变体和组合。"
这句话有两个读法。
悲观读法:LLM 不会创造新知识,只会重组已有知识。它写出的算法都是人类已经发明过的概念的组合,没有真正的原创性。
乐观读法:重组本身就是一种创造。gpt-5.6-sol 的"投影库存统计量"不是人类已经写过的算法——它组合了 capped base-stock 的结构和投影库存位置的概念,但具体的实现方式(用 Poisson 矩算第一步、正态近似算后续、仿真搜索参数)是它自己生成的。如果这个组合是显然的,人类早就做了。
更深的启发是:一个领域积累的知识越多,LLM 重组这些知识的能力就越强。OR 六十年的文献是 LLM 的养料。如果一个问题类没有丰富的算法知识体系,LLM 可能就无能为力——论文也承认这一点。
这指向一个判断 LLM 能力边界的简单启发:这个领域有没有足够多的公开文献? 有,LLM 就可能做到;没有,LLM 就从零开始,和人类一样难。
所以真正的"LLM 做不了"的领域,不是"难"的领域,而是"文献少"的领域。这对评估 LLM 在你所在领域的表现,是一个比"任务难度"更准确的预测器。
十二、结尾:一个不太舒服的类比
1997 年深蓝击败卡斯帕罗夫时,国际象棋界的第一反应是"这只是暴力搜索,不是真正的智能"。二十年后,AlphaZero 用强化学习从零学棋,国际象棋界说"这才是真正的智能"。
A3C 用 6000 CPU 小时训练一个黑盒神经网络,OR 界说"这是 AI 解决 OR 问题的里程碑"。2026 年 LLM 用 1 小时写出可读代码,效果更好,OR 界会说什么?
如果历史有规律,答案是:先否认,再接受,再重新定义什么是"真正的智能"。
但这次有一个不同:LLM 产出的不是黑盒,是你能读、能改、能理解的代码。当 AI 的产出物变成可检查的工程制品,"这只是暴力搜索"的安慰就不好用了——因为你能看到它怎么想的。
论文链接:https://arxiv.org/abs/2608.27296
代码和完整日志:https://anonymous.4open.science/r/llm-or-algorithms-F9F2
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。