Google 发布 Gemini 3.6 Flash 等三款模型:省 17% Token 成本,速度快一倍
BiRun 消息,作者:Google DeepMind 编译:深潮 TechFlow 深潮导读: Google 这次发布的三款模型核心都在解决 AI Agent 商业化的真实痛点——成本和速度。3.6 Flash 比上代省 17%token、价格更低但质量更好;3.5 Flash-Lite 速度达到 350 token/秒,是目前最快的 3.5 系列模型;而专门的网络安全模型 Flash Cyber 则瞄准了代码漏洞修复这个刚需市场。这不是性能跑分游戏,是在为大规模部署 AI Agent 铺路。 Google DeepMind 今日发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。这些模型专为大规模构建 AI Agent 所需的效率、延迟和可靠性而设计。 Gemini 3.6 Flash:更高效、更优质 3.6 Flash 直接基于开发者对 3.5 Flash 的反馈改进。它不仅在编码和知识工作上更进一步,还显著提升了 token 效率。根据 Artificial Analysis Index,3.6 Flash 比 3.5 Flash 减少 17%的输出 token 消耗。在某些基准测试如 Datacurve 的 DeepSWE 中,减少幅度高达 65%。完成多步骤工作流所需的推理步骤和工具调用也更少。 这种效率提升还伴随着更低的价格。定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元,3.6 Flash 降低了每个 Agent 任务的总成本,让构建和运行 Agent 更经济。 即便更高效,3.6 Flash 在各类用例中的性能也优于 3.5 Flash: 代码编辑更精准,减少了不必要的修改和执行循环,在 DeepSWE 上达到 49%(3.5 Flash 为 37%),在机器学习研究基准 MLE Bench 上显著提升至 63.9%(3.5 Flash 为 49.7%) 电脑操作能力改进,OSWorld-Verified 得分 83.0%(3.5 Flash 为 78.4%)。电脑操作现已通过 Gemini API 和 Gemini Enterprise 作为内置客户端工具提供知识工作表现更好,如 GDPval-AA v2 基准得分 1421(3.5 Flash 为 1349)。Hebbia 和 Harvey 等客户发现它在文档解析、图表和数据分析、报告起草等多模态任务上尤其出色客户反馈 3.6 Flash 在成本和质量上都是进步,在复杂工作流和知识型任务中平衡了 token 效率、准确性和速度。 安全性设计 3.6 Flash 配备了增强的前沿安全防护措施,涵盖化学、生物、放射和核(CBRN)以及网络攻击滥用领域。这些防护使模型对越狱攻击的抵抗力大幅提升。同时,模型经过训练,尽量减少对有益用途的拒绝。 Gemini 3.5 Flash-Lite:为 Agent 工作流规模化而生 3.5 Flash-Lite 专为低延迟任务和需要高吞吐量的开发场景设计,如 Agent 搜索和文档处理。 3.5 Flash-Lite 是 3.5 系列中最快的模型。据 Artificial Analysis 测量,运行速度达每秒 350 个输出 token。定价为每百万输入 token 0.3 美元、每百万输出 token 2.5 美元,且质量大幅优于 3.1 Flash-Lite,为运行大流量生产任务的开发者和客户提供了出色的性价比。 3.5 Flash-Lite 支持 Age
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯