2026 年 9 月 2 日——Google DeepMind 于当日低调上线 Gemini 3.8 Flash 模型,官方模型卡显示其基于 Gemini 3.7 Flash,支持最高 1M token 上下文窗口与 64K token 文本输出,面向软件工程、智能体任务与复杂知识工作流。这是 Google 在六周内发布的第三款 Flash 模型,距离 3.7 Flash 发布仅三周,截至发稿官方尚未通过新闻稿或社交媒体正式官宣。
据官方模型卡,模型输入支持文本、图像、音频与视频文件,输出为文本;知识截止日期为 2026 年 3 月,部分领域与 Gemini 3 模型家族一致,知识停留在 2025 年 1 月。
1. 性能与基准测试
据 Google DeepMind 官方模型卡及官方博客数据,Gemini 3.8 Flash 在多项基准测试中接近或超过部分旗舰模型,官方表示这是迄今最聪明的 Flash 模型,主要面向长程软件工程、自主 Agent 与复杂企业工作流:
| 基准测试 | Gemini 3.8 Flash | 对比数据 |
|---|---|---|
| DeepSWE v1.1(长程软件工程) | 71.0% | 3.7 Flash 为 65.3%,Claude Opus 5 为 74.0% |
| HLE-Verified(跨学科知识) | 54.9% | 略高于 Claude Opus 5 的 54.4% |
| CharXiv Reasoning(复杂图表理解) | 86.2% | 高于 Claude Opus 5 的 83.7% |
| LVBench(Agent 模式长视频) | 87.8% | 高于 GPT-5.6 Sol、Claude Opus 5 等模型 |
据媒体报道,Gemini 3.8 Flash 在金融与法律方向的 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 上均超过 3.7 Flash 及其他更昂贵的前沿模型;而一个半月前发布的 3.6 Flash 在 DeepSWE v1.1 上得分为 49%。
2. 数据与价格
Google 将 Gemini 3.8 Flash 与 3.7 Flash 定价保持一致,以下为官方公布的价格,以百万 tokens 为单位:
| 计费项 | 限时优惠价 | 恢复后价格(自 2027 年 1 月 1 日起) |
|---|---|---|
| 输入 | 0.75 美元 | 1.5 美元 |
| 输出 | 3.75 美元 | 7.5 美元 |
3. 推理机制与已知局限
官方模型卡显示,Gemini 3.8 Flash 支持可定制的努力水平(effort levels),以控制质量、成本与延迟的组合。官方表示,模型面对复杂问题时会执行更多推理步骤、反复调用工具并检查自身工作,因此在高推理强度下可能消耗更多 token;若任务更重视计算效率,可降低推理档位或继续使用 3.7 Flash。
官方同时披露了已知局限:模型可能产生幻觉,偶尔出现响应较慢或超时;Google 正持续提升模型抵御越狱攻击的能力,并加强了前沿安全领域的防护措施。
4. 同期发布的 3.8 Flash Cyber
据媒体报道,与 Gemini 3.8 Flash 一同发布的还有网络安全专用版 Gemini 3.8 Flash Cyber。官方表示,在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%。该模型仅通过 Fairwind Program 提供给可信的网络安全机构,普通用户无法使用。
5. 安全评估与社区反馈
官方模型卡中的安全评估显示,Gemini 3.8 Flash 相对 3.7 Flash 未出现具有意义的新能力或实质性性能提升,基于 3.7 Flash 的评估结果,判断其未达到前沿安全框架中的 Tracked/Critical Capability Levels;多语言安全表现相对 3.7 Flash 略有回退(自动化评估 +5.4 个百分点,数值越低越好)。
据媒体报道与部分用户反馈,Gemini 3.8 Flash 的响应速度普遍获得认可,但在真实编程与生成任务中仍存在草率理解需求、输出形式完整而细节粗糙的情况。官方演示案例(如 3D 魔法城堡、DOS 界面版 Google Maps)由模型在 Antigravity 中通过循环指令持续工作并调用 Nano Banana 生成纹理完成,有媒体分析认为官方演示代表模型被完整技术栈托举后的上限,与用户单次指令下的表现存在差异。
举手提问