7月21日,谷歌低调上线两款新模型
没有预告,没有发布会,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite悄然出现在Google AI Studio与Gemini模型选择器中。它们不是万众期待的旗舰,却承载着更现实的使命:让AI真正跑进每天的生产流程。
Gemini 3.6 Flash:为Agent而生的高效执行者
它不追求单次回答的惊艳,而专注在长周期、多轮次、高频率的真实任务中持续可靠地工作。官方定位明确——面向Agent场景优化的生产级模型。
关键升级体现在三方面:更低的输出成本(输出定价从9美元/百万token降至7.5美元)、更少的token消耗(内部测试显示同一任务token用量减少55.8%)、更强的工具调用与代码执行能力。其支持100万token长上下文,可完成跨文件检索、代码执行、外部API调用等复合操作。
在专项评测中,它展现出清晰的能力边界:DeepSWE代码评测得分49%(+12pt),OSWorld-Verified操作系统任务达成率83%(+4.6pt),MLE Bench机器学习任务得分63.9%(+14.2pt)。这些提升集中在工程化落地环节——减少无效重试、缩短执行路径、提升任务闭环成功率。
值得注意的是,其综合智力指标(Intelligence Index)与上一代持平,但任务平均耗时从2.7分钟压缩至1.3分钟。速度与经济性的双重优化,正是它区别于旗舰模型的核心价值。
Gemini 3.5 Flash-Lite:轻量级中的速度冠军
作为Flash系列最精简版本,它进一步压低延迟——任务完成时间从1.6分钟降至0.6分钟,生成速度达约350 token/秒。定价维持在输入0.30美元/百万token、输出2.50美元/百万token,虽未降价,但单位算力产出效率显著提升。
新引入的Computer Use能力,使模型能更稳定地模拟真实桌面操作,支撑跨应用自动化任务。在Terminal-Bench 2.1编程Agent测试中,得分从31%跃升至54%;在GDM-MRCR v2长文本理解任务中,准确率由60.1%提升至72.2%;在贴近实际办公场景的GDPval-AA v2任务执行测试中,分数翻近一倍(642→1140)。
更有意味的是,它在部分任务上反超了更高定位的前代模型:SWE-Bench Pro软件工程测试达54.2%,高于Gemini 3 Flash的49.6%;OSWorld-Verified操作系统操作得分74.0%,也超过Gemini 3 Flash的65.1%。这标志着AI能力正加速下沉——过去需大模型承担的任务,如今可在轻量模型上稳定运行。
Gemini 3.5 Pro:仍未交卷的旗舰答卷
按原计划,它本应在6月发布。如今7月下旬,上线时间仍未公布。官方仅表示模型正与合作伙伴联合测试,将‘很快’推出——这一表述已被市场普遍理解为尚未达到内部质量阈值。
延期焦点集中于代码能力。随着Agent深度融入开发流程,模型对复杂项目结构的理解力、真实代码修改的准确性、多步骤工程任务的连贯执行能力,已成为衡量旗舰成色的关键标尺。当前进展表明,谷歌仍在攻坚这一环节。
与此同时,另一条路线正加速铺开:Gemini 3.6 Flash与3.5 Flash-Lite共同构成‘规模化AI基础设施’的双轨——前者支撑中等复杂度Agent长期运行,后者承担高频轻量任务。这种分层策略,本质是将AI从‘能力展示’转向‘成本可控的系统性嵌入’。
转向背后的战略逻辑
当行业竞争从‘谁的模型分数更高’,逐步转向‘谁能以更低代价让AI每天稳定运转千次以上’,谷歌的选择变得清晰:先夯实底座,再突破上限。
Flash系列不是对Pro延期的妥协,而是主动构建的生产力护城河。它回应的是企业客户最迫切的需求——不是实验室里的峰值性能,而是产线上的可用性、稳定性与经济性。
至于Gemini 3.5 Pro,它的缺席固然引发关注,但真正的考验不在发布时间表,而在最终交付时能否证明:谷歌仍具备定义下一代AI能力边界的实力。那张‘答卷’终将到来,而此刻铺就的每一条效率通路,都在为它争取更扎实的落地土壤。
(10)
Flash系列把AI从能力展示转向成本可控嵌入,这战略挺明智,适应市场竞争。
谷歌这次务实转向挺好,先把基础做好,再追求上限,稳扎稳打。
Gemini 3.5 Flash - Lite速度提升显著,还在部分任务上反超前代,表现不错。
Gemini 3.5 Pro还不上线,估计代码能力问题挺难搞,谷歌得加把劲了。
Pro延期,谷歌得快点解决代码能力问题,不然市场机会可能就没了。
这俩新模型挺务实,不搞花架子,注重生产流程,成本和效率优化得不错,能满足企业实际需求。
AI能力下沉是趋势,轻量模型能承担过去大模型的任务,挺厉害。
Flash系列构建生产力护城河,满足企业产线需求,这步棋走得对。
新模型在任务表现上提升明显,尤其是速度和经济性,对企业来说很实用。
Gemini 3.6 Flash输出成本降了,token消耗也少,工具调用能力还强,很有竞争力。