智谱创始人谈 GLM-5.3:扩展定律不止参数规模,后训练成为关键变量

深潮 TechFlow 消息,8 月 19 日,智谱创始人唐杰发文表示,大模型扩展不应只关注参数数量,还需同时考虑数据规模、计算资源分配、推理成本与实际运行条件。文章回顾了从 Kaplan 扩展定律到 Chinchilla 计算最优理论的变化,指出早期“参数增长快于数据增长”的路线曾导致部分超大模型资源错配,而后续研究表明模型参数与训练数据应更均衡增长。 文章进一步指出,随着模型被高频调用,推理成本已成为模型生命周期成本的核心,最优策略正转向更小模型与更长训练;同时,在专家混合模型中,总参数更多影响知识容量,激活参数与有效深度更影响推理能力,单一“每参数对应训练词元数”比例已不再适用。 针对 GLM-5.3,该文称其与 GLM-5.2 使用相同基础模型、架构、总参数和激活参数,通过一个月扩展长程环境与强化学习进行后训练,取得显著提升。文章认为,参数规模、预训练数据、前向计算和后训练都是可独立调节的扩展变量,本次实验表明后训练仍有较大提升空间,扩展仍未结束。
利多 AI板块 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯