2026 年 9 月 2 日——Google DeepMind 于当日低调上线 Gemini 3.8 Flash 模型,官方模型卡显示其基于 Gemini 3.7 Flash,支持最高 1M token 上下文窗口与 64K token 文本输出,面向软件工程、智能体任务与复杂知识工作流。这是 Google 在六周内发布的第三款 Flash 模型,距离 3.7 Flash 发布仅三周,截至发稿官方尚未通过新闻稿或社交媒体正式官宣。

据官方模型卡,模型输入支持文本、图像、音频与视频文件,输出为文本;知识截止日期为 2026 年 3 月,部分领域与 Gemini 3 模型家族一致,知识停留在 2025 年 1 月。

1. 性能与基准测试

据 Google DeepMind 官方模型卡及官方博客数据,Gemini 3.8 Flash 在多项基准测试中接近或超过部分旗舰模型,官方表示这是迄今最聪明的 Flash 模型,主要面向长程软件工程、自主 Agent 与复杂企业工作流:

基准测试 Gemini 3.8 Flash 对比数据
DeepSWE v1.1(长程软件工程) 71.0% 3.7 Flash 为 65.3%,Claude Opus 5 为 74.0%
HLE-Verified(跨学科知识) 54.9% 略高于 Claude Opus 5 的 54.4%
CharXiv Reasoning(复杂图表理解) 86.2% 高于 Claude Opus 5 的 83.7%
LVBench(Agent 模式长视频) 87.8% 高于 GPT-5.6 Sol、Claude Opus 5 等模型

据媒体报道,Gemini 3.8 Flash 在金融与法律方向的 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 上均超过 3.7 Flash 及其他更昂贵的前沿模型;而一个半月前发布的 3.6 Flash 在 DeepSWE v1.1 上得分为 49%。

2. 数据与价格

Google 将 Gemini 3.8 Flash 与 3.7 Flash 定价保持一致,以下为官方公布的价格,以百万 tokens 为单位:

计费项 限时优惠价 恢复后价格(自 2027 年 1 月 1 日起)
输入 0.75 美元 1.5 美元
输出 3.75 美元 7.5 美元

3. 推理机制与已知局限

官方模型卡显示,Gemini 3.8 Flash 支持可定制的努力水平(effort levels),以控制质量、成本与延迟的组合。官方表示,模型面对复杂问题时会执行更多推理步骤、反复调用工具并检查自身工作,因此在高推理强度下可能消耗更多 token;若任务更重视计算效率,可降低推理档位或继续使用 3.7 Flash。

官方同时披露了已知局限:模型可能产生幻觉,偶尔出现响应较慢或超时;Google 正持续提升模型抵御越狱攻击的能力,并加强了前沿安全领域的防护措施。

4. 同期发布的 3.8 Flash Cyber

据媒体报道,与 Gemini 3.8 Flash 一同发布的还有网络安全专用版 Gemini 3.8 Flash Cyber。官方表示,在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%。该模型仅通过 Fairwind Program 提供给可信的网络安全机构,普通用户无法使用。

5. 安全评估与社区反馈

官方模型卡中的安全评估显示,Gemini 3.8 Flash 相对 3.7 Flash 未出现具有意义的新能力或实质性性能提升,基于 3.7 Flash 的评估结果,判断其未达到前沿安全框架中的 Tracked/Critical Capability Levels;多语言安全表现相对 3.7 Flash 略有回退(自动化评估 +5.4 个百分点,数值越低越好)。

据媒体报道与部分用户反馈,Gemini 3.8 Flash 的响应速度普遍获得认可,但在真实编程与生成任务中仍存在草率理解需求、输出形式完整而细节粗糙的情况。官方演示案例(如 3D 魔法城堡、DOS 界面版 Google Maps)由模型在 Antigravity 中通过循环指令持续工作并调用 Nano Banana 生成纹理完成,有媒体分析认为官方演示代表模型被完整技术栈托举后的上限,与用户单次指令下的表现存在差异。