xAI 用 Grok 4.6 叫板 GPT-5.6,长任务智能体会自查工作

BiRun 消息,作者:xAI 编译:深潮 TechFlow 深潮导读: Grok 4.6 把重点放在能长期运行、跨多步骤工作的智能体上,并在综合智能指数上追平 GPT-5.6 Sol,对开发者选型有实际参考价值。xAI 还给出首周翻倍用量,说明大模型竞争正从单次问答转向能实际交付项目的代理能力,值得关注 AI 与加密结合机会的从业者跟踪。 今天我们发布 Grok 4.6。Grok 4.6 基于 Grok 4.5 构建,特别专注于长运行智能体和更具雄心的交互与视觉工作。它能在多个步骤中持续处理复杂任务,无论是研究主题、分析信息、跨代码库工作,还是将想法转化为完善的应用程序或作品。 Grok 4.6 在多个智能体编码和知识工作基准上达到前沿水平。它在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,该指数是九项基准的综合评分。 图:来源:xAI;竞品数据取自各家开发者公开发布的系统卡或基准排行榜。 Grok 4.6 今日已在 Cursor 和 Grok Build 中可用。第一周内,我们在 Grok Build 和 Cursor 中提供 2 倍包含用量 ,方便你立即开始试用 4.6。 训练 Grok 4.6 Grok 4.6 比 Grok 4.5 经历了更长的补充训练,使用了经过筛选的模型生成数据,用于推理和高级技术概念,以及高质量工程数据,并改进了优化器和训练配方。这为后续的 SFT 和 RL 阶段奠定了更强基础。 随后,我们使用 Grok 4.5 重新生成 SFT 轨迹,覆盖推理工作、智能体框架以及 STEM、软件工程和知识工作等领域,并通过基于模型的检查过滤掉有问题的轨迹。由此得到的 SFT 检查点表现出强劲性能和更好的行为。 Grok 4.6 在广泛的智能体强化学习任务上训练,包括知识工作、通用编码,以及针对内核优化、网页开发、计算机辅助设计等领域的特定环境。 把宏大想法变成可用项目我们在旨在扩展其范围和长时间工作能力的项目上测试了 Grok 4.6。我们发现,该模型特别擅长将宽泛的产品想法转化为可用的初版。它能研究陌生领域、构建应用结构、实现核心交互,并通过多轮反馈持续优化结果。 在更长的任务轨迹中,我们还开始看到更多自测和验证行为,模型会在继续之前检查自己的工作。 在视觉和交互项目上,Grok 4.6 的首次产出比我们通常在 Grok 4.5 上看到的更强。给定一个具体的产品想法,它能一次性为应用建立结构和视觉语言。这使得它在那些最快获得好结果的方式是先做出实质内容再循环迭代的项目中特别有用。 安全与能力 Grok 4.6 的安全防护已根据模型能力进行了改进和校准。 我们的安全栈旨在在合法用例中最大化实用性和安全性,使 Grok 4.6 在漏洞修补、加速工程设计周期和增强 AI 研究等领域既有用又安全。 我们的安全防护评估工作反映了 Grok 4.6 扩展的能力,包括我们有史以来最广泛的能力和安全防护校准部署前测试,以及广泛的部署后和第三方测试。 基准评测图:Grok 4.6 与竞品在主要基准上的得分对比。来源:xAI;每项评测最高分加粗显示,第三方模型分数取自其自行报告或公开可获取的最佳结果。 从公开数据来看,Grok 4.6 在 CursorBench v3.2(69.9%)、GDPVal-AA v2(1753)、AA-Briefcase(1577) 与 APEX-Agents(57.5%) 上追平或超过 GPT-5.6 Sol Max,但在 Terminal-Bench v3。
利多 AI板块利多 FET利多 RENDERSOL 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯