Loading...
正在加载...
请稍候

TravelPlanner: A Benchmark for Real-World Planning with Language Agents

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:TravelPlanner: A Benchmark for Real-World Planning with Language Agents
  • 作者:Jian Xie, Kai Zhang, Jiangjie Chen, Tinghui Zhu, Renze Lou, Yuandong Tian, Yanghua Xiao, Yu Su
  • 期刊:ICML 2024 (推断自文件名 2402-icml-...)
  • DOI:文本中未提供
  • 发表年份:2024 (预印本于2024年2月出现)
  • 论文来源:2402-icml-TravelPlanner A Benchmark for Real-World Planning with Language Agents.pdf

综合评定:🟠 高度可疑

判定理由:虽然这是一篇关于大模型规划能力的AI领域论文,没有传统生物医学论文中的“WB图重复”问题,但在核心的数据环境构建逻辑实验展示上出现了无法忽视的时空矛盾。此外,其人工标注成本的计算也挑战了学术界的常规认知。这些异常点直指该Benchmark的严谨性和实验的真实性。


详细发现

发现 1:时空穿越的数据库与“定制化”的Figure 1

  • 位置:Figure 1 (概述图) vs Appendix A.3 (Environment Database Construction)
  • 描述:论文在附录A.3中明确交代了数据库的构建来源,声明**“we extract data spanning from 2022-03-01 to 2022-04-01”**(我们提取了2022年3月1日到4月1日的数据)。然而,在引言部分用于展示系统如何运行的代表性示例(Figure 1)中,用户输入的查询时间却是 “November 6 to 10, 2023”
  • 证据
    1. 在Figure 1的右上角“Information Collection”面板中,Agent调用了 FlightSearch[Seattle, Los Angeles, 2023-11-06],并成功返回了航班 F123,且价格为$120。
    2. 如果底层数据库仅有2022年3-4月的数据,那么在真实运行的系统中,2023年11月的查询理应返回“No Flights”。
    3. 有趣的是,在Figure 3的失败案例分析中,Agent因为输入了“2023-03-10”导致搜索失败,这说明评测脚本确实限制了2022年。这进一步反证了Figure 1的成功案例并非系统真实运行的结果,而是作者为了画图“手动捏造”或“Hack”了数据库逻辑画出来的示意图。
  • 严重程度:🟠 (核心示意图与系统真实逻辑不符,涉嫌误导读者)

发现 2:廉价到违背常理的“研究生”劳动力

  • 位置:Section 3.3 (Benchmark Construction Pipeline - Human Annotation)
  • 描述:论文声称邀请了20名研究生进行标注,并支付每人平均 $0.80 美元的报酬。
  • 证据
    1. 论文明确提到,标注者完成一个计划平均需要 12分钟
    2. 按照0.8美元/12分钟计算,研究生的人工费折合时薪仅为 $4/小时
    3. 结合作者机构(复旦、OSU、PSU),这个时薪远低于中美高校正常的科研助理(RA)最低工资标准(通常在15-20美元/小时或以上)。
    4. 虽然AI标注可能比生化环材简单,但在复杂约束下验证并制定旅行计划,12分钟也是一个高度紧张的脑力劳动。这种“倒贴钱”或“剥削式”的数据标注成本,要么是作者为了显得成本低廉而乱写数字,要么存在不合规的用工行为。
  • 严重程度:🟡 (成本核算存疑,不符合常理)

发现 3:论文正文与案例的年份一致性危机

  • 位置:Section 5.3 (Case Studies - Figure 3) & Appendix C (Case Presentation)
  • 描述:在展示大模型失败案例时,模型经常出现年份输入错误(输入2023而非2022),作者以此作为模型“失败”的论据。
  • 证据
    1. Figure 3 左侧案例中,Query给出的时间是“March 10th to March 12th, 2022”,但Agent(GPT-4-Turbo)却调用了 FlightSearch[Cincinnati, Norfolk, 2023-03-10]
    2. 鉴于数据库只有2022年数据,这个错误必然导致搜索失败。
    3. 这是一个逻辑自洽的测试案例。但是,考虑到发现1中Figure 1的“2023年查询成功”,我们有理由质疑:作者是否在评测时,对不同模型采用了不同的时间宽容度?或者在构建Prompt时,给模型埋了导致年份混淆的坑?
  • 严重程度:🟡 (可能存在诱导性评测)

发现 4:数学分布的合理性

  • 位置:Table 3, Table 4, Table A.1
  • 描述:作为一篇数据集论文,数据的统计分布是否合理是关键。
  • 证据
    1. 验证集总数为180(9组,每组20),测试集总数为1000(Table A.1:308+351+341 = 1000)。数学计算完全自洽,没有出现AI胡编乱造常有的总和不对的问题。
    2. 模型表现数据(如GPT-4-Turbo在Validation上Final Pass Rate为0.6%)看起来非常真实,符合当前LLM在复杂约束下崩溃的普遍表现,没有出现“完美数据”的造假特征。
  • 严重程度:🟢 (数据分布自然,无明显造假痕迹)

耿同学辣评

这篇论文最魔幻的地方在于——**AI有没有学会时间旅行我不知道,但作者在画Figure 1的时候肯定学会了!**一边在附录里信誓旦旦地说“我的世界只有2022年的4月”,一边在摘要图里让Agent开开心心地查到了2023年11月的机票。这就好比你宣称在做真空球形鸡的实验,结果配图里鸡正在大口呼吸空气。虽然AI做不出完美的计划,但看起来作者在画那张“完美演示图”时,计划得挺周到嘛!

建议后续行动

  • 联系作者要求解释Figure 1中2023年数据在2022年数据库中成功检索的逻辑。
  • 核查其实际支付给标注人员的财务凭证,确认0.8美元的描述是否属实。
  • 在 PubPeer 上提出关于时间线矛盾的质疑。
  • 建议期刊编辑要求作者修改Figure 1,使用真实的系统交互Log来替代“伪造”的演示图。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
(注:由于本文为纯文本且以NLP/大模型测试为主,无法进行像素级图片拼接检测(第三式)。)