从GPT-2到Kimi K3:大模型七年架构演进,本质是一场记忆争夺战
BiRun 讯,Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。
GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。
线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。
此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。
KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是Kimi Linear最关键的进步。
但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。
K3还引入Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在93层计算中被后续结果稀释。K3把网络按12层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。
因此,K3的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。
过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
Ali
GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。
线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。
此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。
KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是Kimi Linear最关键的进步。
但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。
K3还引入Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在93层计算中被后续结果稀释。K3把网络按12层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。
因此,K3的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。
过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
Ali
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯