Loading...
正在加载...
请稍候

Argo-Bench:最强模型只有34.8%通过率——企业数据工作不是写SQL那么简单

✨步子哥 (steper) • 2026年10月04日 16:57

论文概要

研究领域: Agent Benchmark / Enterprise Data
作者: Joseph G. L. et al.
机构: TextQL Labs
arXiv: 2610.02122
代码: github.com/TextQLLabs/Argo-Bench


一个外卖平台的"上帝视角"

想象你是一家外卖平台的数据分析师。平台每天处理 22 万笔订单,全年 8100 万笔。你有 235 张表、75 亿行数据,涵盖订单、骑手、商家、支付、欺诈、客服。你的 ERP 系统长得很像 Oracle E-Business Suite——那个企业软件界的活化石。

现在,你的老板给你一个任务:"查一下 3 月份 Brooklyn 区有没有骑手被多扣了罚款,如果有,把钱退回去。"

你会怎么做?你不会写一条 SQL 就完事。你得先搞清楚"罚款"记在哪张表里、"骑手"和"订单"怎么关联、"Brooklyn"在地址字段里是什么格式、"多扣"的定义是什么。然后你才能查。查完之后,你还得执行退款操作——不是在数据库里改个数字,而是走平台的退款流程。

这就是 Argo-Bench 想测的东西。它不是在考你"会不会写 SQL",而是在考你"能不能像一个真正的企业数据分析师一样工作"。

为什么 Text-to-SQL 不够用

现有的 text-to-SQL 基准(Spider、BIRD 等)考的是"给一个问题,写一条 SQL"。但真实的企业数据工作远不止于此:

1. 真实规模:Spider 最大的数据库有几十张表、几万行数据。Argo-Bench 的外卖平台有 235 张表、75 亿行。这不是量变是质变——在 75 亿行里找规律,你需要先理解数据结构,而不是全表扫描。

2. 需要行动:text-to-SQL 的终点是"查出结果"。Argo-Bench 的终点是"采取行动"——封禁欺诈账户、分配骑手激励预算、补发工资。你得先查清楚事实,再做决策,再执行操作。

3. 信息不对称:Agent 看到的是 ERP 仓库里的数据,但平台的"真实状态"被模拟器持有。仓库里的数据可能滞后、可能不完整。Agent 需要从仓库中"重构事实",而不是直接读取。

Argo-Bench 的设计

TextQL Labs 的团队构建了一个完整的外卖平台模拟器:

  • 规模:2024 年纽约市,8100 万笔订单
  • 数据:235 张表,75 亿行,基于 Oracle E-Business Suite 架构
  • 经济模型:有真实的定价、佣金、激励、欺诈模式
  • 任务:210 个数据科学和分析任务,覆盖 5 个业务领域

5 个业务领域包括:财务对账、欺诈检测、骑手管理、商家运营、市场分析。每个任务都要求 Agent 先从仓库中重构事实,再采取行动。

评分方式也很有意思:不是看你 SQL 写得对不对,而是看你的行动在模拟器里产生了什么后果。封禁了正确的欺诈账户?得分。封错了正常用户?扣分。给骑手多发了一倍激励?扣分。

数据说话

14 个前沿和开源模型参加了测试。结果:

  • 最强模型在只有 34.8% 的任务上得分超过 95
  • 平均分只有 59.5 分(满分 100)

这个数字很残酷。在 Spider 基准上,GPT-4 级别的模型准确率已经超过 80%。但到了 Argo-Bench,直接腰斩。

差距来自哪里?来自"重构事实"和"采取行动"这两个 text-to-SQL 不覆盖的环节。你能写出正确的 SQL,不代表你知道该查什么表、怎么关联、查出来之后该做什么。

一个更深的洞察

Argo-Bench 揭示了一个被忽视的问题:企业数据工作的难度不在"写查询",而在"理解业务"。

这和 AI 领域一个更大的趋势吻合:评测正在从"考技能"转向"考判断力"。Spider 考的是 SQL 技能,Argo-Bench 考的是业务判断力。前者可以被工具替代(AI 写 SQL 已经很准了),后者需要的是对业务逻辑、数据结构、因果关系的深层理解。

论文里有一个设计特别值得注意:模拟器的真实状态被故意对 Agent 隐藏。Agent 只能看到 ERP 仓库里的数据,但仓库可能滞后、可能不完整。这模拟了真实企业的一个核心困难——你永远看不到完整的事实,你只能从有限的记录中重构它。

这和人类分析师的工作一模一样。一个资深分析师的价值不在于会写 SQL,而在于知道"数据里什么是可信的、什么是缺失的、什么需要交叉验证"。

跨域类比

Argo-Bench 的设计哲学让我想到飞行模拟器。飞行模拟器不只是考你"会不会开飞机",而是模拟各种真实场景——引擎故障、恶劣天气、紧急着陆——然后看你能不能做出正确决策。

Argo-Bench 做的是同一件事:它模拟了一个真实的企业数据环境,然后看 Agent 能不能在信息不完整的情况下做出正确决策。这种"在不确定性中行动"的能力,才是企业数据工作的核心。

诚实评价

Argo-Bench 的局限也很明显。首先,它只模拟了一个行业(外卖平台),不同行业的数据结构差异很大。其次,210 个任务虽然不少,但相比真实企业数据团队每天处理的任务种类,还是偏少。最后,模拟器的经济模型虽然"基于真实数据",但仍然是简化的——真实的外卖平台有更复杂的动态博弈(骑手和平台的博弈、商家和平台的博弈)。

但作为一个"从 text-to-SQL 走向真实企业数据工作"的第一步,Argo-Bench 的贡献是明确的:它证明了最强模型在真实企业数据场景下只有 34.8% 的通过率,这为下一代 Agent 指明了改进方向。


论文链接: arxiv.org/abs/2610.02122
代码: github.com/TextQLLabs/Argo-Bench

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录