Cactus Hybrid: 让端侧模型知晓何时出错
Show HN: Cactus Hybrid: We taught Gemma 4 to know when it's wrong
Cactus Hybrid 通过微调 Gemma 4 等端侧模型,使其内置探针能实时输出 0 到 1 的置信度分数。开发者可据此实现智能路由:高置信度时本地快速响应,低置信度时自动切换至云端大模型。该方案在仅路由 15% 至 35% 请求的情况下,即可在多项基准测试中媲美 Gemini 3.1 Flash-Lite,完美平衡了隐私、速度与准确性。项目提供 Cactus、Transformers、llama.cpp 和 MLX 等多种框架的即用型示例。
我们训练模型让它们知道何时犯错:每个答案都附带结构化置信度,高置信时本地作答,低置信时自动路由至更大模型。