Claude防蒸馏可能白防了:小模型能直接套出大模型思维链
BiRun 讯,大模型厂商为了防止能力被蒸馏,会隐藏完整思维链,只给用户一份摘要。但最新研究发现,这层保护可能没有想象中牢固:把 Opus 的加密思维链交给同厂更弱的 Haiku,再越狱 Haiku,就能让它直接复述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。
这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。
更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。
这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。
论文还测了 Kimi K3。只给它塞几个 Opus 的推理 Token,K3 后面的推理就会明显向 Opus 靠拢;部分 Claude、GPT 的原始推理片段,从 Kimi K3 中提取出来最高比其他模型容易约 6 个数量级,但作者明确说无法据此证明蒸馏。
论文
这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。
更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。
这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。
论文还测了 Kimi K3。只给它塞几个 Opus 的推理 Token,K3 后面的推理就会明显向 Opus 靠拢;部分 Claude、GPT 的原始推理片段,从 Kimi K3 中提取出来最高比其他模型容易约 6 个数量级,但作者明确说无法据此证明蒸馏。
论文
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯