三周三代的Flash节奏
Google DeepMind于9月2日正式发布Gemini 3.8系列模型,距上一代3.7 Flash仅三周,这也是公司在短短六周内推出的第三款Flash模型。产品管理高级总监Tulsee Doshi与Google DeepMind Gemini安全负责人Raluca Ada Popa在官方博客联袂署名,将本次发布定位为面向智能体工作流与网络安全的下一代智能。Gemini 3.8提供两个变体:面向通用场景的3.8 Flash与面向网络安全的3.8 Flash Cyber,两者共享同一套基础智能,并通过长期运行的智能体循环递归评估与打磨底层模型。
同价不提速,但更努力
3.8 Flash沿用3.7 Flash的介绍价:每百万输入token 0.75美元、每百万输出token 3.75美元,速度与成本不变,但推理与编程能力被官方称为迄今最佳。值得注意的是,3.8 Flash的核心设计选择是更加努力——在复杂任务上执行额外的推理步骤、迭代调用工具,有时会消耗更多token以换取更高性能,尤其在effort高档位时表现明显。对算力敏感的开发者可以调低effort档位来压缩token开销,或继续使用仍受完整支持的3.7 Flash,后者将继续服务效率优先的工作负载。
基准成绩:小模型逼近前沿
在长时程软件工程基准DeepSWE v1.1上,3.8 Flash端到端自主解决复杂工程问题的表现超过大多数更大参数量的前沿模型,而成本只是零头。在金融与法律两个专业领域,模型在Vals Finance Agent V2与Harvey法律智能体基准上同时超过3.7 Flash与其他前沿模型,展现出企业级自主任务所需的跨专业可靠性。多步推理方面,3.8 Flash在HLE-Verified上取得54.9%的成绩,覆盖STEM、人文与专业领域的多步推理。
官方博客同时展示了三个由3.8 Flash独立完成的演示:在Google Antigravity中用一段简单提示词构建出包含谜题与环境叙事的3D城堡法师游戏,材质由Nano Banana生成;单条提示词生成可完整游玩的DOS版Google地图,包含地点查询、路线导航与街景浏览;以及在Google AI Studio中构建的Hardware Anatomy交互式3D可视化器,能按物理比例渲染设备拆解视图,用户拖动滑块即可逐层分解硬件结构。
Flash Cyber:为防御者打造的特化模型
3.8 Flash Cyber是Google迄今最强的网络安全模型,在漏洞发现与自动修复两项任务上达到前沿水平,通过全新的Fairwind计划向经过审核的可信防御者开放。在业界标准漏洞挖掘基准CyberGym上,Flash Cyber的自主漏洞发现表现超越前代3.5 Flash Cyber,也明显优于参数量大得多的前沿模型,让防御方第一次在速度与成本上获得可以对攻防两端快速迭代的优势。
考虑到CyberGym主要覆盖C/C++代码库、与真实防御场景不完全吻合,Google还构建了一个内部基准,要求模型在横跨20种编程语言的复杂代码库中发现各类漏洞。在这一更贴近实战的测试中,Flash Cyber相对前代实现显著跃升,成功率超过70%。官方强调模型从一开始就优先投入漏洞修复能力,而非漏洞利用类攻击能力,CWE-Bench等修复类基准被置于发布的核心位置,意图把技术优势明确交给防守一方。
一个耐人寻味的细节是:3.8通用版本在编程与推理上的大幅提升,部分正来自网络安全这一高难度领域的严苛训练。安全攻防要求模型理解底层内存布局、协议细节与大规模代码库的结构,这种训练反馈回流到基础模型,让通用版本在长时程智能体任务上同样受益。这也是Google首次把安全特化模型与通用模型放在同一发布节奏中同步迭代。
对开发者而言,Flash系列的快速迭代意味着性价比前沿的整体下移:三周前3.7 Flash的定价如今能买到更强的推理与编程能力,而企业级智能体工作流所需的可靠性开始逼近更贵的前沿模型。在竞争对手密集发布的当口,Google选择把安全作为差异化主线:Cyber版本仅向审核通过的防御者开放,模型厂商之间的竞赛正在从聊天与编程基准,扩展到谁能为防御者提供更好的武器这一更具公共意义的赛道。