Kimi K3凭什么追近Fable 5?月之暗面同时重写注意力、残差和MoE

BiRun 讯,月之暗面公布 Kimi K3 技术报告。K3 拥有 2.8 万亿总参数,每个 Token 激活 1040 亿参数,底座架构较 K2 全面换代。

参数变大只是其中一部分。月之暗面称,新架构、数据和训练方法让 K3 的整体扩展效率比 K2 提高约2.5倍。按其 Scaling Law 曲线,达到相同验证损失所需的训练计算量,约为 K2 的 40%。

K3 首先重写了注意力。它用 KDA 处理长序列,每三层再加入一层全局 MLA。KDA 把此前内容压进固定大小的状态,降低百万 Token 上下文的计算和缓存压力;MLA 负责保留全局信息交换。

它还加入 Attention Residuals。传统模型只能把此前所有层的信息不断叠加,K3 则允许每一层直接从更早的网络块中挑选需要的内容。模型更深以后,早期信息不容易被冲淡。

MoE 也被重新设计。K3 拥有 896 个路由专家,每个 Token 激活16个,是 K2 的两倍。路由专家会先在压缩空间中计算,再返回模型主干。新的激活函数和负载均衡算法,则用来防止超大模型训练失控。

真正拉高 Agent 能力的还有后训练。月之暗面分别训练通用、Agent 和代码模型,再为每个方向训练三种思考强度,最后把九个专家合并。训练任务最长可包含数千次工具调用,并持续保留文件、应用和虚拟机状态。

K3 已在多项代码、搜索和工具调用测试中接近或领先 Fable 5 和 GPT-5.6 Sol 等顶级闭源模型。它的跃升并非只靠堆参数,而是把更大的底座、新架构和百万 Token Agent 强化学习一起推到了极限。

K3 技术报告
利多 加密大盘SOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯