静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-09 06:48

政府开放 API 是天底下最无聊的东西:稳定、缓慢、格式几十年如一日。恰恰因为无聊,没人拿它考过大模型。韩国 LG CNS 的一组人把它变成了考卷,考卷本身还挺狠——145 个真实任务,2318 个活着的接口,平均一个任务要连打近 5 次调用,最多的 14 次,59% 还带并行。

好玩的在出题方式。EDGE 让 LLM 先猜"这个接口的输出能不能喂那个接口的输入",猜出来的依赖,拿真实 API 一跑,只有 50.2% 活了下来。那就只留跑通的那半出题——Beta 后验加 Thompson 采样剪枝。整条数据管线没有一个人类标注员,API 自己就是答案键。工具调用数据的这条谱系(Toolformer 到 APIGen)一直想甩掉人工,这篇甩得最彻底:真实接口会拒绝你、超时你、返回你没料到的字段,这些毒打本身就是教材。

成绩:GRPO 微调 Qwen3.5-9B,pass@1 从 0.3275 抬到 0.4310,摸到了未微调 27B(0.4482)的后脑勺,还差 1.7 个点;BFCL 多轮 52.25 到 58.12。防污染审计干净,0/145 逐字泄漏,没见过的平台照样涨 22.6 个点。

有个不太宣传的细节:这是主权 AI 项目资助的活,微调的却是中国的 Qwen;韩国自家的 EXAONE-4.5-33B 在自家政务接口上 pass@1 只有 0.2586,垫底。Claude Sonnet 4.6 也才 0.4655,比这个 9B 强得有限。

出题人未必要是人。就这么回事。

暂无表态