谷歌推出三款新模型,但焦点全在3.6 Flash的失格表现上
谷歌DeepMind近期宣布上线Gemini 3.6 Flash、Gemini 3.5 Flash-Lite与Gemini 3.5 Flash Cyber三款模型。其中,3.6 Flash作为主打轻量高效的新旗舰,却在实际使用中遭遇广泛质疑。它未延续前代优势,反而在多个关键能力维度出现明显退化。
前端生成能力全面崩塌
在界面代码生成测试中,开发者采用标准2-shot提示方式验证其能力。结果输出的HTML/CSS/JS代码存在严重逻辑错误:组件嵌套层级混乱、事件绑定缺失、响应式结构失效,甚至基础布局都无法正确渲染。多位一线工程师反馈,该输出无法通过基础校验,更谈不上投入开发流程。有用户直言:“这是我见过最不可用的界面生成结果。”
空间推理能力不进反退
针对空间关系理解任务(如物体相对位置、朝向判断、遮挡识别等),3.6 Flash在多组可控测试中准确率低于3.5 Flash。视频逐帧分析显示,模型频繁混淆“左/右”“上/下”“前/后”等基本方位,对简单几何构型的理解也出现系统性偏差。即便启用高推理强度模式,错误率未见收敛,部分案例中连静态图示中的基本空间关系都未能识别。
代码与综合能力持续落后
在CursorBench等开发者实测基准中,3.6 Flash表现弱于Cursor Composer 2.5;在第三方横向评测中,其综合得分与3.5 Flash持平,但显著低于Meta Muse Spark 1.1、智谱GLM-5.2、月之暗面Kimi系列及Anthropic Sonnet等同期竞品。谷歌官方公布的视觉与长上下文指标虽具优势,但无法掩盖其在编程、推理、交互等核心场景的短板。
知识更新存疑,宣称与实际严重脱节
模型标称知识截止时间为2026年3月,但实测发现其对2025年中后期发生的重大技术事件、开源项目迭代及行业标准变更均无响应或给出错误信息。大量查询指向2025年1月前的数据状态,证实其训练数据并未如期更新。这一偏差已超出合理延迟范围,被部分用户视为未完成交付的信号。
Flash-Lite与Cyber模型定位清晰,但难掩主线乏力
3.5 Flash-Lite强调吞吐效率,峰值达350 token/s,但高速输出常伴随事实错误与逻辑断裂;3.5 Flash Cyber聚焦网络安全任务,在特定指令集下表现稳定,但通用能力受限。二者均为垂直优化路径,无法替代主干模型应有的基础可靠性。
3.5 Pro延期背后,是技术节奏的失衡
谷歌在公告中明确表示,Gemini 3.5 Pro尚未达到发布标准,而Gemini 4已进入预训练阶段。这一安排暗示当前主力迭代陷入瓶颈——不是单纯调优滞后,而是架构或数据层面需重新锚定方向。当团队将资源倾斜至下一代预训练时,本应夯实的3.x序列却以降级形态仓促推向市场,暴露出目标管理与工程落地之间的断层。
版本数字跃进,不代表能力演进
从3.5到3.6的命名升级,并未对应实质突破。用户真正期待的是更准的推理、更稳的输出、更广的知识覆盖,而非更快的错误生成速度或更高的参数编号。当AI产品的价值锚点滑向发布会话术与内部KPI指标,技术信誉的损耗便难以逆转。这一次,争议不在模型是否“够好”,而在它是否“够格”。
(5)
谷歌这几款模型,3.6 Flash不行,3.5的两款定位虽清晰但难掩主线问题,技术管理有大问题
Gemini 3.6 Flash就是失格,代码和综合能力落后,知识还不更新,根本没法用
3.6 Flash号称新旗舰,结果这么多问题,版本升级也没实质突破,谷歌这是在糊弄人
谷歌推出的新模型不行,3.6 Flash性能还倒退,3.5 Pro还延期,技术节奏全乱套了
这Gemini 3.6 Flash问题太多了,前端生成和空间推理能力都不行,知识更新也有问题,谷歌这次搞砸了