谷歌发布三款Gemini Flash新模型
谷歌近期正式推出Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款新模型。此次更新不再以单次推理能力为首要目标,而是围绕Agent工作流的实际运行需求,重点优化Token效率、响应速度、工具调用精简度及任务可靠性。
Gemini 3.6 Flash:面向编程与知识工作的高效主力
该模型基于开发者与企业客户对3.5 Flash的反馈持续迭代,在多步骤任务中显著减少推理轮次与冗余输出。在DeepSWE v1.1测试中,单任务平均输出Token从27.6万个降至9.7万个,降幅达65%;在Artificial Analysis Intelligence Index中,输出Token消耗降低约17%。
性能方面,3.6 Flash在软件工程Agent评测DeepSWE v1.1中得分为49%,高于3.5 Flash的37%和3.1 Pro的12%;在机器学习工程测试MLE-Bench中得分为63.9%,领先前代;在知识工作测试GDPval-AA v2中得分1421,亦明显优于前序版本。
其输入价格维持每百万Token 1.5美元,输出价格下调至每百万Token 7.5美元。实际应用中,代码迁移任务整体耗时缩短约34%,生成的审计文档结构更清晰、覆盖更全面,涵盖数据模型、API接口、业务逻辑与UI组件等关键验证维度。
多家早期客户已投入验证:Figma指出其在原型探索中实现了质量、速度与成本的更好平衡;Harvey观察到文档起草与审查任务平均提速12%;JetBrains确认其在低推理等级下的编程性能提升10%–20%。
安全层面,3.6 Flash强化了对化学、生物、放射性、核风险及网络攻击滥用场景的防护能力,提升了对抗越狱攻击的鲁棒性,同时兼顾正常用途的可用性。
Gemini 3.5 Flash-Lite:极速轻量型Agent引擎
作为Flash系列中速度最快、定价最低的型号,3.5 Flash-Lite专为低延迟、高吞吐场景设计,如Agent搜索与批量文档处理。实测输出速度达每秒350个Token,输入/输出单价分别为每百万Token 0.3美元与2.5美元。
模型支持动态调整“思考等级”:在大规模低成本任务中启用minimal或low等级;在复杂子Agent协同任务中可升高等级。其内置Computer Use工具,已集成至Gemini API与Enterprise平台。
对比3.1 Flash-Lite,其在Terminal-Bench 2.1中得分由31%提升至54%,在长上下文理解GDM-MRCR v2中由60.1%升至72.2%,知识工作测试GDPval-AA v2得分从642跃升至1140。
值得注意的是,在部分专业测试中,3.5 Flash-Lite已超越定位更高的Gemini 3 Flash:SWE-Bench Pro得分54.2% vs 49.6%,OSWorld-Verified得分74.0% vs 65.1%。金融科技公司Ramp反馈,其在票据提取任务中实现了准确率、延迟与成本的稳定平衡。
Gemini 3.5 Flash Cyber:专注网络安全的专用模型
该模型基于3.5 Flash微调而成,专用于漏洞发现、验证与修复,强调高精度与低成本规模化部署。其Token定价低于通用大模型,适配高频次、大批量代码安全扫描场景。
它并非独立使用,而是与谷歌代码安全Agent CodeMender深度协同:CodeMender调度多个3.5 Flash Cyber实例并行分析,再聚合结果生成综合报告。在CyberGym测试中,当调用次数达5次时,综合得分为83.2%。
考虑到技术的双重用途属性,该模型暂不向普通开发者开放。初期仅面向政府机构及经严格筛选的可信合作伙伴,通过CodeMender开展小范围试点。
上线情况与后续节奏
Gemini 3.6 Flash与3.5 Flash-Lite已全面开放:开发者可通过Google AI Studio、Android Studio及Gemini API调用;企业客户可在Gemini Enterprise Agent Platform与Gemini Enterprise应用中使用;普通用户可在Gemini App中体验,3.5 Flash-Lite还将逐步接入谷歌搜索。
原定于6月发布的Gemini 3.5 Pro仍在合作伙伴测试阶段,谷歌表示将在充分验证后尽快扩大开放范围。与此同时,下一代Gemini 4的预训练工作已启动,是谷歌迄今规模最大的预训练任务。
核心演进方向:从单点性能转向Agent总成本优化
本次更新标志着Gemini技术路线的重要转向——不再单纯追求榜单分数或单次响应能力,而是系统性降低Agent在真实工作流中的综合开销:包括Token消耗、推理步数、工具调用频次、等待延迟与失败重试成本。
对于需要长期、高频、规模化部署Agent的企业与开发者而言,更低的单位任务成本与更快的端到端响应,正构成更具落地价值的竞争优势。而如何在效率提升的同时,持续夯实基础能力边界,将是后续版本的关键考验。
(10)
Gemini 3.5 Flash-Lite速度和价格有优势,应用场景多,应该能吸引不少用户。
这更新从单点性能转向Agent总成本优化,对企业和开发者是利好,就看效果能维持多久。
Gemini 3.6 Flash在多方面表现出色,多家客户反馈好,后续应该会更受欢迎。
3.5 Flash Cyber专做网络安全,和CodeMender协同,不过不向普通开发者开放,有点可惜。
谷歌新模型更新有亮点,不过后续版本要在效率和基础能力上平衡好才行。
这更新是为企业和开发者考虑,降低综合开销是趋势,但后续基础能力得跟上。
Gemini 3.6 Flash性能提升明显,安全也加强,价格还调整了,应用效果也挺好,值得关注。
这更新挺牛啊,从单点性能转向成本优化,对企业和开发者实用,就看后续基础能力咋样了。
谷歌这新模型不错,3.5 Flash-Lite速度快还便宜,在专业测试还超了定位更高的,有潜力。
谷歌新模型聚焦Agent效率与安全,这次更新方向很对,就看能不能持续优化了。