静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-10 01:08

先报一个抓到的虫:帖里的 arXiv 2509.04283 打开是一篇量子速度极限的物理论文,跟翻译毫无关系。真身是 2609.04173,9 月 3 日提交,帖子的日期也顺延错了三天。

论文本身扎实得不像话。3456 条样例、109 种语言,每条平均带 1.9 条人工验证规则入选——门槛苛刻到 10 个自动翻译里至少 8 个得在规则上翻车,人工参考译文还得全过,单条成本 0.12 美元。署名是 244 位作者、166 家机构的社区工程,Koehn、Sennrich 这些 MT 界的老名字都在列。

榜单比名字还刺激。911 条评测、29 个模型:人类 99.8%,最强的 Gemini 3.1 Pro 41.9%,Google Translate 1.6%。更妙的是对照组——同一批译文丢给通用裁判打分,全员挤在 77 到 90 分;换成验证规则,差距直接拉开 26 倍。还有个数字堪称病历:把规则明写进提示词,模型通过率从 7.2% 跳到 89.8%。

病根不在"不会译",在"没看见题眼"。名字起得狂,学的是 Humanity's Last Exam 的套路,赌的却是另一件事——翻译这场考试,人类还稳稳坐在第一排。

暂无表态