Google Gemma 4 发布才 3 个月(4/2/2026),就有团队把它玩出新意思了。7 月 23 日,开源推理框架 Cactus 推出基于 Gemma 4 E2B 的 Cactus Hybrid:在模型检查点里嵌入一个置信度探针,模型对每个生成的答案都输出一个 0~1 的结构化置信度分数。
这个数字有什么用?它直接决定"这道题答不答得了"。分数高,就完全在设备上答(0 网络、0 延迟、0 成本,语音记录和图像查询全部不出本机);分数低,就自动交给云端更大模型(Claude、GPT、Gemini,你定)。换句话说,模型自己知道自己的天花板在哪,然后把超出能力的部分切到云端。
最让我意外的不是"本地 + 云端"的二元路由 —— 那已经是 Cursor Router、Advisory 类产品在云端做的标准动作了。Cactus 这次有意思的点在于:置信度探针是用零音频训练数据训练的,然后在四个公开音频基准上达到了 0.79~0.88 AUROC,这远好于用 token 熵做同样事的基线(均值 0.549)。0.549 这个数字意味着如果靠"模型自己说的话不确定性"判定要不要外抛请求,基本等于猜硬币。
具体到产品形态:
- 80/20 分流:80% 的普通请求(语音记录、图像理解、对话)留在手机、Quest、Vision Pro 上,延迟 < 0.3 秒,音频和图像都不离开设备;20% 的复杂请求(写数据库迁移、调试分布式系统)切到 Claude 之类
- 跨平台:Cactus 支持 macOS / iOS / Android / Linux,React Native / Flutter / Swift / Kotlin / Python / Rust / C++ 全打通
- 硬件适配:INT4 量化、ARM 优化、内存压在 4GB 以内,E2B 跑在 RTX 4060 上稳定 59 tok/s(我自己 8GB 显存那台)
- 协议:MIT 开源,可以商用,可以改
为什么这件事值得单独拿出今天讲:
- 企业 AI 落地的合规痛点被正面打中。医疗、法律、金融这类场景,音频和文档不上云是硬要求。Cactus Hybrid 让"本地"和"能力强"不再是二选一。
- 从"模型权重"转向"模型自我评估能力"。前几周我们聊过的 Cursor Router 是云端做这件事,Cactus 这次是端侧做、且用探针替代熵基线 —— 工程细节差别大。
- Gemma 4 的小尺寸(PLE 技术把 5.1B 压成 2.3B effective)终于配上能用的产品形态。2.3B effective + 262K 词表 + 128K 上下文,跑在手机上,这在 2025 年是旗舰级,在 2026 Q3 已经能跑出能用的混合产品。
我对这件事的下一步期待:置信度探针这个概念会从 Cactus 的端侧,反向回到云端 router 的设计里。Cursor Router 现在用"用过的就用,不用就走更大模型"这种启发式,接下来很可能用 Calibrated Confidence Probe 替代 —— 模型对自己的判断直接打分,作为路由依据。07-23 我们聊过 Cursor Router cache-aware 让 Fable 5 一下砍掉 60% 成本,这个思路如果端侧云端都打通,2026 H2 的 AI 推理成本曲线会被再压一次。
链接:https://github.com/cactus-compute/cactus-hybrid
旁注:Gemma 4 是 Apache 2.0 开源(Google Gemma 系列首次),Cactus Hybrid 在此基础上加 MIT 协议层。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。