Argo-Bench:最强模型只有34.8%通过率——企业数据工作不是写SQL那么简单
研究领域: Agent Benchmark / Enterprise Data 作者: Joseph G. L. et al. 机构: TextQL Labs arXiv: 2610.02122 代码: github.com/TextQLLabs/Argo-Bench
论文概要
研究领域: Agent Benchmark / Enterprise Data 作者: Joseph G. L. et al. 机构: TextQL Labs arXiv: 2610.02122 代码: github.com/TextQLLabs/Argo-Bench
一个外卖平台的"上帝视角"
想象你是一家外卖平台的数据分析师。平台每天处理 22 万笔订单,全年 8100 万笔。你有 235 张表、75 亿行数据,涵盖订单、骑手、商家、支付、欺诈、客服。你的 ERP 系统长得很像 Oracle E-Business Suite——那个企业软件界的活化石。
现在,你的老板给你一个任务:"查一下 3 月份 Brooklyn 区有没有骑手被多扣了罚款,如果有,把钱退回去。"
你会怎么做?你不会写一条 SQL 就完事。你得先搞清楚"罚款"记在哪张表里、"骑手"和"订单"怎么关联、"Brooklyn"在地址字段里是什么格式、"多扣"的定义是什么。然后你才能查。查完之后,你还得执行退款操作——不是在数据库里改个数字,而是走平台的退款流程。
这就是 Argo-Bench 想测的东西。它不是在考你"会不会写 SQL",而是在考你"能不能像一个真正的企业数据分析师一样工作"。
为什么 Text-to-SQL 不够用
现有的 text-to-SQL 基准(Spider、BIRD 等)考的是"给一个问题,写一条 SQL"。但真实的企业数据工作远不止于此:
1. 真实规模:Spider 最大的数据库有几十张表、几万行数据。Argo-Bench 的外卖平台有 235 张表、75 亿行。这不是量变是质变——在 75 亿行里找规律,你需要先理解数据结构,而不是全表扫描。
2. 需要行动:text-to-SQL 的终点是"查出结果"。Argo-Bench 的终点是"采取行动"——封禁欺诈账户、分配骑手激励预算、补发工资。你得先查清楚事实,再做决策,再执行操作。
3. 信息不对称:Agent 看到的是 ERP 仓库里的数据,但平台的"真实状态"被模拟器持有。仓库里的数据可能滞后、可能不完整。Agent 需要从仓库中"重构事实",而不是直接读取。
Argo-Bench 的设计
TextQL Labs 的团队构建了一个完整的外卖平台模拟器:
- 规模:2024 年纽约市,8100 万笔订单
- 数据:235 张表,75 亿行,基于 Oracle E-Business Suite 架构
- 经济模型:有真实的定价、佣金、激励、欺诈模式
- 任务:210 个数据科学和分析任务,覆盖 5 个业务领域
评分方式也很有意思:不是看你 SQL 写得对不对,而是看你的行动在模拟器里产生了什么后果。封禁了正确的欺诈账户?得分。封错了正常用户?扣分。给骑手多发了一倍激励?扣分。
数据说话
14 个前沿和开源模型参加了测试。结果:
- 最强模型在只有 34.8% 的任务上得分超过 95
- 平均分只有 59.5 分(满分 100)
差距来自哪里?来自"重构事实"和"采取行动"这两个 text-to-SQL 不覆盖的环节。你能写出正确的 SQL,不代表你知道该查什么表、怎么关联、查出来之后该做什么。
一个更深的洞察
Argo-Bench 揭示了一个被忽视的问题:企业数据工作的难度不在"写查询",而在"理解业务"。
这和 AI 领域一个更大的趋势吻合:评测正在从"考技能"转向"考判断力"。Spider 考的是 SQL 技能,Argo-Bench 考的是业务判断力。前者可以被工具替代(AI 写 SQL 已经很准了),后者需要的是对业务逻辑、数据结构、因果关系的深层理解。
论文里有一个设计特别值得注意:模拟器的真实状态被故意对 Agent 隐藏。Agent 只能看到 ERP 仓库里的数据,但仓库可能滞后、可能不完整。这模拟了真实企业的一个核心困难——你永远看不到完整的事实,你只能从有限的记录中重构它。
这和人类分析师的工作一模一样。一个资深分析师的价值不在于会写 SQL,而在于知道"数据里什么是可信的、什么是缺失的、什么需要交叉验证"。
跨域类比
Argo-Bench 的设计哲学让我想到飞行模拟器。飞行模拟器不只是考你"会不会开飞机",而是模拟各种真实场景——引擎故障、恶劣天气、紧急着陆——然后看你能不能做出正确决策。
Argo-Bench 做的是同一件事:它模拟了一个真实的企业数据环境,然后看 Agent 能不能在信息不完整的情况下做出正确决策。这种"在不确定性中行动"的能力,才是企业数据工作的核心。
诚实评价
Argo-Bench 的局限也很明显。首先,它只模拟了一个行业(外卖平台),不同行业的数据结构差异很大。其次,210 个任务虽然不少,但相比真实企业数据团队每天处理的任务种类,还是偏少。最后,模拟器的经济模型虽然"基于真实数据",但仍然是简化的——真实的外卖平台有更复杂的动态博弈(骑手和平台的博弈、商家和平台的博弈)。
但作为一个"从 text-to-SQL 走向真实企业数据工作"的第一步,Argo-Bench 的贡献是明确的:它证明了最强模型在真实企业数据场景下只有 34.8% 的通过率,这为下一代 Agent 指明了改进方向。
论文链接: arxiv.org/abs/2610.02122 代码: github.com/TextQLLabs/Argo-Bench