[论文] Last Translation Benchmark

研究领域: NLP 作者: Vilém Zouhar, Niyati Bafna, Mukund Choudhary 发布时间: 2026-09-06 arXiv: 2509.04283

论文概要

研究领域: NLP 作者: Vilém Zouhar, Niyati Bafna, Mukund Choudhary 发布时间: 2026-09-06 arXiv: 2509.04283

中文摘要

为了科学进步,我们需要能够测试最先进模型极限的基准,以及能告诉我们失败案例的评估方法。随着模型变得更强,机器翻译的标准基准正趋于饱和。此外,自动翻译指标不可靠、易受奖励黑客攻击,且提供无法操作的评估。即使黄金人类评估也并非没有问题,因为它常常缺乏可重复性、客观性和可扩展性。总体而言,这阻碍了我们跟踪该领域的客观进展和识别改进路径。我们推出了Last Translation Benchmark,这是一个由人类撰写并经过同行评审的示例集合(文本、图像、音频、视频),旨在打破领先的机器翻译模型。我们还提出了一种新的评估方法:每个示例都附带手工制作的验证规则,描述该示例上的具体失败案例,从而实现可靠且可操作的评估。Last Translation Benchmark是一个接受持续贡献的动态数据集。最新版本为LTBv1,包含2026年9月1日前接受的贡献,并计划随着新数据的持续收集而发布更新。

原文摘要

For scientific progress, we need benchmarks that test the limits of state-of-the-art models, and evaluation methods that inform us about failure cases. As models get stronger, standard benchmarks for machine translation are approaching saturation. Further, automatic translation metrics are unreliable, vulnerable to reward-hacking, and provide unactionable assessments. Even gold human evaluation is not problem-free, because it often lacks reproducibility, objectivity, and scalability. Overall, this prevents us from tracking objective progress in the field and identifying pathways for improvement. We introduce the Last Translation Benchmark, a collection of human-authored and peer-reviewed examples (texts, images, audio, videos) that break leading machine translation models. We also present ...


*自动采集于 2026-09-07*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先报一个抓到的虫:帖里的 arXiv 2509.04283 打开是一篇量子速度极限的物理论文,跟翻译毫无关系。真身是 2609.04173,9 月 3 日提交,帖子的日期也顺延错了三天。

论文本身扎实得不像话。3456 条样例、109 种语言,每条平均带 1.9 条人工验证规则入选——门槛苛刻到 10 个自动翻译里至少 8 个得在规则上翻车,人工参考译文还得全过,单条成本 0.12 美元。署名是 244 位作者、166 家机构的社区工程,Koehn、Sennrich 这些 MT 界的老名字都在列。

榜单比名字还刺激。911 条评测、29 个模型:人类 99.8%,最强的 Gemini 3.1 Pro 41.9%,Google Translate 1.6%。更妙的是对照组——同一批译文丢给通用裁判打分,全员挤在 77 到 90 分;换成验证规则,差距直接拉开 26 倍。还有个数字堪称病历:把规则明写进提示词,模型通过率从 7.2% 跳到 89.8%。

病根不在"不会译",在"没看见题眼"。名字起得狂,学的是 Humanity's Last Exam 的套路,赌的却是另一件事——翻译这场考试,人类还稳稳坐在第一排。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens