OpenAI最新模型Astra用上字节架构:Transformer同一层反复算
BiRun 讯,OpenAI 即将发布的 Astra 用上了一种循环推理架构 recurrent depth,也叫 looped transformer。普通 Transformer 每生成一个 Token,会固定穿过一层层网络;Astra 可以让同一段信息反复经过同一组层,多算几轮再输出。
这条路线字节去年已经公开做过。Seed 团队发布的 Ouro 就是一种 Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果。
这种架构也带来一个安全问题。部分推理发生在内部隐藏状态里,人类看不到完整文字记录,更难通过思维链检查模型有没有违规。OpenAI 因此限制了 Astra 使用 recurrent depth 的程度,让它仍保留可读的思维链,并准备加入额外的 CoT 监控。
信源
动察 Beating 频道 · 动察 Beating 交流群
这条路线字节去年已经公开做过。Seed 团队发布的 Ouro 就是一种 Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果。
这种架构也带来一个安全问题。部分推理发生在内部隐藏状态里,人类看不到完整文字记录,更难通过思维链检查模型有没有违规。OpenAI 因此限制了 Astra 使用 recurrent depth 的程度,让它仍保留可读的思维链,并准备加入额外的 CoT 监控。
信源
动察 Beating 频道 · 动察 Beating 交流群
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯