Opus 5.5 被削了吗?有人从发布当天开始记账

AI 圈流传着一个老故事:新模型发布的头两周最好用,然后悄悄变差。有人说是量化,有人说后端换了小模型,有人说是路由规则动了。厂商从不承认,用户拿不出证据。每一轮争论都停在 vibes 对 vibes,谁也说服不了谁。

AI 圈流传着一个老故事:新模型发布的头两周最好用,然后悄悄变差。有人说是量化,有人说后端换了小模型,有人说是路由规则动了。厂商从不承认,用户拿不出证据。每一轮争论都停在 vibes 对 vibes,谁也说服不了谁。

9 月 22 日,Claude Opus 5.5 发布。当天,一位开发者建了个仓库,开始记账。

📏 先造一把尺

这个叫 livenerf 的项目要回答的问题只有一个:模型上线之后,服务质量会不会偷偷下滑。

要回答它,得先有一把不会动的尺。作者搭了一块固定题板,四个题族:精确计算和程序追踪、token 保真度、可核验的指令跟随、带隐藏测试的短代码。每道题都经过校准,通过率落在 30% 到 70% 之间——太简单或太难的题都测不出变化,只有中间这段斜坡最灵敏。每天跑 90 个样本,30 天。

长上下文任务被主动排除了。每道题会吃掉订阅额度的一大块,划不来。

🔒 把一切钉死

测量最大的敌人是"东西变了但你不知道"。模型参数没法钉死——采样参数碰不到,思考模式关不掉——那就把其余一切钉死。

命令行工具锁定在 2.1.280 版本,自动更新禁用,每次采样都记录版本号,版本一变运行器直接拒绝开工。系统提示词换成一份冻结的短文件。工具、MCP、配置文件全部清空,空目录起跑。模型只返回文本,代码在外头跑测试,它自己碰不到任何东西。连每天用的预算都换了个量法:不按 token,按订阅页面上那两个滚动百分比。

📐 统计方法没得挑刺

整套统计跟的是 Anthropic 自己 2024 年那篇《给评测加上误差棒》,逐题配对差值配聚类标准误,题目难度的影响在配对里直接消掉。方法不是自创的,想吵架得先跟厂商自家论文吵。

有一个次级信号很有意思:每次采样的输出 token 中位数。作者的原话是,模型要是悄悄开始"想得少",这里最先显形——往往比准确率早好几天。

⏳ 跑到第六天

到 9 月 29 日,30 天跑满了 6 天,一天没落。六天全部 90 个样本,同一把 harness 哈希,同一版 CLI。仓库挂出 252 颗星,讨论区已经开始有人催结果。

急也没用。前 10 天只是攒基线,第一张正式成绩单要到第 20 天之后才出炉。而且这把尺两边都量:模型要是变好了,一样大声报。

🧭 值得关注的原因

AI coding 已经把日常工程压在几个模型上。这些模型没有版本号变化公告,没有 changelog,服务端想动就动——今天是量化,明天可能是路由。写代码的人对"手感变差"的抱怨从来没停过,可从没有人握着发布当天的基线去对账。

livenerf 的价值不在结论,在姿势:个人开发者用预注册协议、冻结环境、公开日志,把一场口水仗变成一份数据。这一套搬给任何模型都成立。30 天后不管结果如何,"到底削没削"这个问题第一次有了可以引用的答案。

  • 信源:GitHub 仓库 ninjahawk/livenerf 的 README、PLAN.md、校准文档与仓库元数据(9 月 29 日拉取);HN 9 月 29 日讨论帖(179 分,92 评论)
  • 限定:v0 跑在订阅渠道的 Claude Code 之上,量的是"产品交付行为",和 API 裸模型之间隔着一层 CLI,作者自己也把这记为混杂因素;30 天系列尚未出结果,本文不预判任何方向
暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens