ARC竞赛第一团队现身:Mostik给大小模型搭桥,省掉大模型生成成本
BiRun 讯,动察 Beating AI 快讯,ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL,就是刚刚公开的 AI 创业公司 Mostik,目前成绩 7.51%。团队共 15 人,包括 12 名博士和一位菲尔兹奖得主。不过比赛还没结束,第二次 Milestone 要到 9 月 30 日截榜,最终提交 11 月 2 日截止。
Mostik 做的是让不同 AI 模型直接交换内部状态。普通多 Agent 主要靠文字传话,它则在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型能理解的表示,两边模型本身都不用微调。
他们公开的实验用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5,可以近似理解为大模型负责 prefill,小模型负责 decode。GLM-5.2 只读题,不生成 Token;内部状态直接交给 4B 小模型生成答案。Mostik 称,这样能把两者的性能差距缩小约一半;与达到相同准确率的中型单模型相比,计算量只有约 40%。不过最终效果仍然低于 753B 大模型本身。
Mostik 尚未公布 7.51% 的成绩到底用了什么模型和 Harness,上面的 753B+4B 只是另一组技术演示,不能当成夺榜配置。ARC-AGI-3 竞赛本身比的也是整套 Agent 系统,之前的阶段冠军只用了 Qwen 3.6 27B,却靠 Harness、工具和上下文管理拿到第一。
另一方面,这套技术要求读取模型 hidden states,Claude、GPT 这类云端模型目前用不了;Google DeepMind 工程师 Susan Zhang 也质疑,既然已经能控制模型内部状态,冻结两个模型再单独训练一座「桥」,是否真是最划算的工程方案。
Mostik 做的是让不同 AI 模型直接交换内部状态。普通多 Agent 主要靠文字传话,它则在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型能理解的表示,两边模型本身都不用微调。
他们公开的实验用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5,可以近似理解为大模型负责 prefill,小模型负责 decode。GLM-5.2 只读题,不生成 Token;内部状态直接交给 4B 小模型生成答案。Mostik 称,这样能把两者的性能差距缩小约一半;与达到相同准确率的中型单模型相比,计算量只有约 40%。不过最终效果仍然低于 753B 大模型本身。
Mostik 尚未公布 7.51% 的成绩到底用了什么模型和 Harness,上面的 753B+4B 只是另一组技术演示,不能当成夺榜配置。ARC-AGI-3 竞赛本身比的也是整套 Agent 系统,之前的阶段冠军只用了 Qwen 3.6 27B,却靠 Harness、工具和上下文管理拿到第一。
另一方面,这套技术要求读取模型 hidden states,Claude、GPT 这类云端模型目前用不了;Google DeepMind 工程师 Susan Zhang 也质疑,既然已经能控制模型内部状态,冻结两个模型再单独训练一座「桥」,是否真是最划算的工程方案。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯