风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Gemini 3.6 Flash发布实录:省Token不等于强AI

摘要

一场被期待已久的发布,却成了信任的临界点 如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症——这个网友调侃,意外成了最贴切的注脚。Google 刚刚一口气推出三款新模型:3.6 Flash、3.5 Fl...

Gemini 3.6 Flash发布实录:省Token不等于强AI
一场被期待已久的发布,却成了信任的临界点 如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症——这个网友调侃,意外成了最贴切的注脚。Google 刚刚一口气推出三款新模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。没有旗舰升级,没有能力跃迁,只有更薄的账单、更快的响应、更窄的推理路径。这不是技术突破的宣言,而是一次务实到近乎保守的工程迭代。 3.6 Flash:主力模型,主打“少说废话” 官方称其为 workhorse(干活模型),核心价值不是更聪明,而是更克制。在 DeepSWE 基准上,输出 token 减少最多达 65%;多步任务中工具调用次数下降,推理步数缩短。这意味着:同样完成一个 Agent 流程,它生成的中间文本更短、调用动作更精准、API 账单更轻。 价格同步下调:输出成本从 9 美元/百万 token 降至 7.5 美元。代码能力提升明显——DeepSWE 从 37% 到 49%,MLE Bench 从 49.7% 升至 63.9%。计算机操作(computer use)能力纳入 API 内置工具,OSWorld-Verified 达 83%。知识截止日期延至 2026 年 3 月,是少数真正“翻篇”的更新。 安全层面启用升级版 Frontier Safety 防护,聚焦 CBRN 与网络攻击类滥用,强调抗越狱与低误拒率平衡。 3.5 Flash-Lite:小身材,高弹性 定位更低,但设计更灵活。它是当前 3.5 系列中吞吐最快的模型,实测达 350 token/s。输入仅 0.3 美元/百万 token,输出 2.5 美元,价格压到极致。 关键创新在于支持动态调整“推理档位”:简单任务用轻量档提速降耗,复杂子任务可升档增强思考深度。同样集成 computer use 工具,且在多项基准中反超前代 3 Flash:SWE-Bench Pro 达 54.2%(vs 49.6%),OSWorld-Verified 74.0%(vs 65.1%)。真实任务 GDPval-AA v2 从 642 飙至 1140。 它不追求全能,而专注高并发场景——电商特征抽取、批量收据处理、网页方案生成辅助等,已进入 Ramp、Ashler 等团队的实际工作流。 3.5 Flash Cyber:专攻漏洞,锁死交付 这是唯一跳脱通用路线的特化模型,在 3.5 Flash 基础上微调,专用于静态代码安全分析。配合 CodeMender 工具链,多个 Flash Cyber Agent 协同运行,输出结构化修复建议。 它不面向公众开放,仅限 Google 认证的“可信合作伙伴”内测。逻辑很清晰:漏洞发现速度已跑赢人工修复节奏,与其让大模型泛化参与,不如用轻量高效模型定向补漏——前提是,必须把能力关进合规笼子里。 缺席的旗舰:3.5 Pro 仍在路上 所有 Flash 模型的热闹,都衬得 3.5 Pro 的沉默格外刺眼。官方回应是“正与合作伙伴测试”,但行业共识是:其代码生成能力未达预期,6 月下旬曾紧急更新训练数据,效果有限,甚至有消息指已推倒重训。 与此同时,宣传口径悄然转向 Gemini 4——Logan Kilpatrick 公开表示预训练已启动,进展“令人兴奋”。这并非技术预告,而是一种叙事转移:当旗舰延期成为事实,就用下一代愿景稳住军心。 用户反馈:账本漂亮,体感打折 第三方实测指出:3.6 Flash 在多数智能指标上与 3.5 Flash 持平,token 效率提升未能转化为认知质量跃升。有用户对比发现,其综合表现低于 Meta Spark 1.1、GLM-5.2、Sonnet 5 等竞品;另一些人测算出,同等任务下成本高于 GPT-5.6 Sol medium,而能力反而更弱。 实测者反馈集中于三类问题:基础解码不稳定、中文选词偏差明显、多模态生成(尤其图像/视频)质量严重下滑、工具调用错乱频发、上下文记忆易丢失。有人直言:“三个模型全比 3.5 Flash 差。” 不是退步,而是选择 这场发布没有失败,但它暴露了一个战略转向:Google 正将 Gemini 的重心,从“通用智能高度”转向“工程落地密度”。Flash 系列不是更强的模型,而是更可控、更可计量、更易嵌入企业工作流的 AI 组件。 它不回答“什么是 AGI”,只解决“怎么让 Agent 每天少花两美元”。当行业还在争论谁更像人类时,Google 已悄悄把标尺换成了每百万 token 的 ROI。至于那句阿尔茨海默的玩笑——或许不该嘲笑健忘,而该警惕:当一家公司开始习惯性压缩思考,遗忘的可能不只是旧知识,还有对“智能”本身的要求。

评论 (5)

登录 后即可发表评论
流星昊帝

这次发布没技术突破,就是工程迭代,想省钱,核心能力还不行,这方向有点偏了。

0 回复
Wings
Wings 1周前

Flash 系列适合企业工作流,可智能指标上比不过竞品,这战略调整有点冒险。

0 回复
潘潘
潘潘 1周前

3.5 Pro 没消息,都在推下一代,旗舰指望不上,宣传先转移,有点不靠谱。

0 回复
中年玩茄

新模型价格降了,代码能力升了,可用户体验问题一堆,不知道谷歌咋想的。

0 回复
930(BG5HHH)

谷歌把重心放工程落地了,不追求通用智能高度,这可能会让它在智能领域掉队。

0 回复
更多