Google 发布 Gemini 3.7 Flash:三周迭代,代码和 Agent 能力大幅跃升
Google 今天发布了 Gemini 3.7 Flash,距离上一代 3.6 Flash 仅仅三周。这个迭代速度在 Google 的模型发布史上相当少见,但新模型交出的成绩单说明这不是一次小修小补——代码调试、Web 开发和知识推理三大方向全面超越前代,9 项基准测试领先 Anthropic 和 OpenAI 的同级模型。
代码能力:从"能跑"到"能交付"
Gemini 3.7 Flash 最亮眼的提升在代码领域。
在 DeepSWE v1.1 基准测试中,3.7 Flash 的得分从 3.6 的 49.0% 跳到 65.3%,提升了超过 16 个百分点。这个测试衡量的是模型在真实软件工程场景中的表现——不是写个 Hello World,而是要调试、修复、提交代码,还要遵守项目的风格规范。
FrontierCode 1.1 Main 测试也体现了类似趋势:34.4% 提升到 43.6%。这个基准包含 100 道跨语言编程题,要求代码不仅要能运行,还要通过测试并符合项目要求。
Web 开发方面,3.7 Flash 在 Arena.ai 的 WebDev Arena 上从 Elo 1538 提升到 1588。Google 表示,新模型能用更少的提示词生成更完整、更可用的 Web 应用,UI 生成也更贴近用户上传的设计稿参考。
知识推理与 Agent 能力
代码之外,3.7 Flash 在处理复杂文档和自动化工作流上也有显著进步。
GDP.pdf 是一个专门测试模型处理复杂商业文档能力的基准,3.7 Flash 拿到了 34.0%,比 3.6 的 22.0% 高出 12 个百分点,也超过了 Claude Sonnet 5(28%)和 GPT-5.6 Terra(24.7%)。对于金融、法律、生物科学等知识密集型领域,这意味着模型能更准确地从长文档中提取和推理信息。
AutomationBench 测试的是模型完成真实业务工作流的能力,3.7 Flash 从 17.0% 提升到 30.4%,几乎翻倍。
Google 特别强调了 Agent 方面的改进:3.7 Flash 在遇到障碍时会主动调整策略,在意图不明确时主动澄清,多步规划和工具调用更加可靠。简单说,它不再是一个"你说什么我做什么"的执行器,而更像一个会思考、会纠偏的协作伙伴。
技术规格
- 上下文窗口:1M token(支持图像、视频、文本混合输入)
- 最大输出:64K token
- 安全方面:更新了 CBRN(化学、生物、放射、核)和网络攻击的防护措施,同时保留有益用例
谁能用、怎么用
Gemini 3.7 Flash 已经在 Google 的 Gemini App 和 Spark 平台上线。开发者可以通过 API 调用,企业用户可以直接用它处理文档和自动化工作流。
三周的迭代周期说明 Google 正在加速 Flash 系列的更新节奏。对于开发者和企业来说,这意味着你不需要等半年才能用上更好的模型——但也要做好准备,模型切换和适配的频率可能会加快。
---
*基于多家媒体转述整理,主要来源:9to5Google、SiliconANGLE、Axios。*