Gemini 3.6 Flash发布实录:省Token不等于强AI

0 次阅读 2026年07月22日
一场被期待已久的发布,却成了信任的临界点 如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症——这个网友调侃,意外成了最贴切的注脚。Google 刚刚一口气推出三款新模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。没有旗舰升级,没有能力跃迁,只有更薄的账单、更快的响应、更窄的推理路径。这不是技术突破的宣言,而是一次务实到近乎保守的工程迭代。 3.6 Flash:主力模型,主打“少说废话” 官方称其为 workhorse(干活模型),核心价值不是更聪明,而是更克制。在 DeepSWE 基准上,输出 token 减少最多达 65%;多步任务中工具调用次数下降,推理步数缩短。这意味着:同样完成一个 Agent 流程,它生成的中间文本更短、调用动作更精准、API 账单更轻。 价格同步下调:输出成本从 9 美元/百万 token 降至 7.5 美元。代码能力提升明显——DeepSWE 从 37% 到 49%,MLE Bench 从 49.7% 升至 63.9%。计算机操作(computer use)能力纳入 API 内置工具,OSWorld-Verified 达 83%。知识截止日期延至 2026 年 3 月,是少数真正“翻篇”的更新。 安全层面启用升级版 Frontier Safety 防护,聚焦 CBRN 与网络攻击类滥用,强调抗越狱与低误拒率平衡。 3.5 Flash-Lite:小身材,高弹性 定位更低,但设计更灵活。它是当前 3.5 系列中吞吐最快的模型,实测达 350 token/s。输入仅 0.3 美元/百万 token,输出 2.5 美元,价格压到极致。 关键创新在于支持动态调整“推理档位”:简单任务用轻量档提速降耗,复杂子任务可升档增强思考深度。同样集成 computer use 工具,且在多项基准中反超前代 3 Flash:SWE-Bench Pro 达 54.2%(vs 49.6%),OSWorld-Verified 74.0%(vs 65.1%)。真实任务 GDPval-AA v2 从 642 飙至 1140。 它不追求全能,而专注高并发场景——电商特征抽取、批量收据处理、网页方案生成辅助等,已进入 Ramp、Ashler 等团队的实际工作流。 3.5 Flash Cyber:专攻漏洞,锁死交付 这是唯一跳脱通用路线的特化模型,在 3.5 Flash 基础上微调,专用于静态代码安全分析。配合 CodeMender 工具链,多个 Flash Cyber Agent 协同运行,输出结构化修复建议。 它不面向公众开放,仅限 Google 认证的“可信合作伙伴”内测。逻辑很清晰:漏洞发现速度已跑赢人工修复节奏,与其让大模型泛化参与,不如用轻量高效模型定向补漏——前提是,必须把能力关进合规笼子里。 缺席的旗舰:3.5 Pro 仍在路上 所有 Flash 模型的热闹,都衬得 3.5 Pro 的沉默格外刺眼。官方回应是“正与合作伙伴测试”,但行业共识是:其代码生成能力未达预期,6 月下旬曾紧急更新训练数据,效果有限,甚至有消息指已推倒重训。 与此同时,宣传口径悄然转向 Gemini 4——Logan Kilpatrick 公开表示预训练已启动,进展“令人兴奋”。这并非技术预告,而是一种叙事转移:当旗舰延期成为事实,就用下一代愿景稳住军心。 用户反馈:账本漂亮,体感打折 第三方实测指出:3.6 Flash 在多数智能指标上与 3.5 Flash 持平,token 效率提升未能转化为认知质量跃升。有用户对比发现,其综合表现低于 Meta Spark 1.1、GLM-5.2、Sonnet 5 等竞品;另一些人测算出,同等任务下成本高于 GPT-5.6 Sol medium,而能力反而更弱。 实测者反馈集中于三类问题:基础解码不稳定、中文选词偏差明显、多模态生成(尤其图像/视频)质量严重下滑、工具调用错乱频发、上下文记忆易丢失。有人直言:“三个模型全比 3.5 Flash 差。” 不是退步,而是选择 这场发布没有失败,但它暴露了一个战略转向:Google 正将 Gemini 的重心,从“通用智能高度”转向“工程落地密度”。Flash 系列不是更强的模型,而是更可控、更可计量、更易嵌入企业工作流的 AI 组件。 它不回答“什么是 AGI”,只解决“怎么让 Agent 每天少花两美元”。当行业还在争论谁更像人类时,Google 已悄悄把标尺换成了每百万 token 的 ROI。至于那句阿尔茨海默的玩笑——或许不该嘲笑健忘,而该警惕:当一家公司开始习惯性压缩思考,遗忘的可能不只是旧知识,还有对“智能”本身的要求。

(5)

流星昊帝

这次发布没技术突破,就是工程迭代,想省钱,核心能力还不行,这方向有点偏了。

0
Wings
Wings 1周前

Flash 系列适合企业工作流,可智能指标上比不过竞品,这战略调整有点冒险。

0
潘潘
潘潘 1周前

3.5 Pro 没消息,都在推下一代,旗舰指望不上,宣传先转移,有点不靠谱。

0
中年玩茄

新模型价格降了,代码能力升了,可用户体验问题一堆,不知道谷歌咋想的。

0
930(BG5HHH)

谷歌把重心放工程落地了,不追求通用智能高度,这可能会让它在智能领域掉队。

0

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

韩国三家造船厂第二季度营业利润突破2.7万亿韩元 得益于高附加值LNG运输船

今年二季度,韩国三大国内造船厂业绩强劲,综合营业利润超过2.7万亿韩元,主要得益于液化天然气(LNG)运输船等高附加值船舶比例的增加。据业内消息,29日,HD韩国造船海上工程[009540]、韩华海洋[042660]和三星重工业[010140]在第二季度实现了2.7062万亿韩元的合计营业利润。总销售额为17.609万亿韩元。造船热潮期间订购的高价船舶现已反映在销售中,生产力提升和选择性订单策略被认为提升了盈利能力。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

美光科技、闪迪、SK海力士等存储股盘前全线转涨

7月29日,美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。希捷科技、西部数据分别上涨4.6%、2.2%。

贝莱德盘前续涨约2% 联手Meta,加码AI基建

7月29日,全球资产管理巨头贝莱德(BLK.US)美股盘前续涨约2%。消息面上,据彭博消息,科技巨头Meta近日与贝莱德联合宣布,双方达成合作设立合资企业,共同开发运营坐落于美国得克萨斯州埃尔帕索的大型AI数据中心园区,项目整体开发投入规模达140亿美元,将为人工智能算力基础设施建设提供强力支撑。此次合作让贝莱德深度参与AI基础设施投资,契合当前市场热点,直接提振了投资者情绪。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。