谷歌DeepMind三连发:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber齐亮相,AI Agent进入降本增效新阶段
谷歌DeepMind三连发:一场面向生产环境的务实进化
今天,谷歌DeepMind一次性推出三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite与Gemini 3.5 Flash Cyber。这不是概念演示,也不是实验室快闪,而是直接瞄准真实业务场景的工程化升级——目标明确:让AI Agent跑得更快、更稳、更省。
Gemini 3.6 Flash:主力模型的效率革命
作为本次发布的旗舰主力,Gemini 3.6 Flash不再一味堆参数,而是从推理路径、工具调用与输出密度三方面重构效率。实测显示,在DeepSWE编程基准中,其输出Token减少最高达65%;在多步任务中,所需推理步骤与外部工具调用次数显著下降,意味着更短链路、更低延迟。
成本同步优化:输入价格降至每百万Token 1.5美元,输出为7.5美元,较前代进一步下探。更重要的是,性能未打折扣——反而全面超越:
- DeepSWE编程测试:37% → 49%
- MLE Bench机器学习研究测试:49.7% → 63.9%
- OSWorld-Verified操作系统级操作测试:78.4% → 83%
- GDPVal-AA v2知识型任务:得分提升超70分,达1421分
借助Gemini Canvas能力,3.6 Flash已可原生支持3D纹理提取、交互式UI生成等专业工作流,真正将大模型能力嵌入设计师与开发者的日常生产环节。
Gemini 3.5 Flash-Lite:轻量不妥协,快且能扛压
如果说3.6 Flash是主脑,那么3.5 Flash-Lite就是执行层的“特种兵”。它以每秒350 Token的输出速度,成为当前3.5系列中响应最快的模型;定价更是极具冲击力:输入仅0.3美元/百万Token,输出2.5美元/百万Token。
它专为高频、批量、低延迟场景而生——例如长文档解析、实时Agent搜索、多版本网页方案生成等。尤为值得注意的是,它在多项关键指标上反超更大体积的Gemini 3 Flash:
- SWE-Bench Pro编程测试:54.2% vs 49.6%
- OSWorld-Verified系统操作测试:74.0% vs 65.1%
在典型架构中,3.6 Flash负责任务拆解与决策调度,Flash-Lite则作为轻量协作者并行执行,实现高并发下的资源弹性分配。官方演示中,二者协同可在数秒内生成25套完整、可用的网页设计方案。
目前,Flash-Lite已上线Gemini App,并将逐步集成至谷歌搜索底层服务中。
Gemini 3.5 Flash Cyber:安全领域的精度特化模型
这是一款不对外公开API、仅面向特定企业安全场景部署的垂直模型。它的核心使命非常聚焦:精准识别代码漏洞,并生成可落地的修复建议。
它已深度集成进谷歌内部代码安全智能体CodeMender,通过多个Cyber智能体协同分析,在CyberGym安全评估基准中刷新SOTA成绩。与通用大模型相比,它用更小的体积、更低的推理开销,实现了更高精度的漏洞定位与修复生成能力。
该模型暂未开放公共访问权限,主要服务于谷歌云客户及深度合作的安全基础设施项目。
Gemini 4已启程:激进预训练正式开始
在发布三款新模型的同时,谷歌确认:下一代旗舰模型Gemini 4的预训练工作已正式启动。官方称这是“史上最为激进的一次预训练”,涵盖更广的数据覆盖、更强的多模态对齐机制,以及针对Agent原生交互的底层架构重构。
按谷歌过往约6个月的主流训练周期推算,Gemini 4有望在今年年底前完成初步训练并进入早期验证阶段。但现阶段,所有可用、可测、可计费的生产力提升,都来自今天发布的三款模型。
结语:降本,才是此刻最真实的进步
这场发布没有宏大叙事,没有未来主义口号。它把焦点牢牢钉在三个可衡量的维度上:Token用量下降、单位计算成本下降、单次Agent调用耗时下降。对开发者、产品团队和企业AI负责人而言,这意味着更可控的预算、更确定的SLA、更敏捷的迭代节奏。
当行业还在讨论AGI何时到来时,谷歌选择先让每一个正在运行的Agent变得更实在、更可靠、更便宜——这才是技术走向成熟的标志。
(10)
性能提升明显,成本还降低,开发者用起来更顺手,对AI发展促进挺大。
三款新模型各有亮点,分工明确,协同起来效率肯定高,能解决不少实际问题。
代码安全模型针对性强,企业安全有保障了,就看后续推广和应用效果咋样。
Gemini 4都开始预训练了,谷歌这研发速度真快,后面估计还有惊喜。
专注成本控制和性能提升,不整那些花里胡哨的,谷歌这波操作挺务实。
降本是关键,现在企业就需要这种能省钱又好用的技术。
年底前Gemini 4有望完成初步训练,期待它能带来更多新功能。
这更新挺实在,直接奔着降本增效去,对企业来说成本降了不少,是好事。
这更新是朝着实际生产去的,以后企业用AI会更广泛。
新模型在各测试中成绩提升明显,这实力没话说,值得关注。