Gemini 3.6 Flash

Gemini 3.6 Flash – 谷歌推出的新一代 AI 模型

Google DeepMind 隆重推出其最新旗舰模型 Gemini 3.6 Flash,这款模型旨在赋能大规模人工智能代理(AI Agent)场景,标志着 AI 领域的一次重要飞跃。Gemini 3.6 Flash 隶属于全新推出的 Gemini 3.6 系列,该系列还包括 Gemini 3.5 Flash-Lite 和 3.5 Flash Cyber。

Gemini 3.6 Flash 亮点概览

Gemini 3.6 Flash 作为 Google DeepMind 的主力干活模型,专为处理海量 AI Agent 任务而设计。与前代 Gemini 3.5 Flash 相比,Gemini 3.6 Flash 在多个维度上实现了显著提升。首先,其输出 token 数量减少了 17%,这意味着更精简的响应,从而降低了使用成本。价格方面,每百万 token 的输出费用降至 7.5 美元。在性能上,代码能力得到了大幅增强,DeepSWE 基准测试得分从 37% 跃升至 49%,MLE-Bench 得分更是从 49.7% 飙升至 63.9%。此外,Gemini 3.6 Flash 在代码编写、知识性工作以及计算机操作方面都展现出更强的实力。值得一提的是,“Computer Use”工具已集成到模型中,为开发者、企业及普通用户提供了更便捷的使用体验。

Gemini 3.6 Flash 的核心功能

  • 卓越的“干活”能力:定位为性能强劲的“workhorse”,Gemini 3.6 Flash 针对大规模 AI Agent 场景进行了深度优化。相较于 3.5 Flash,其输出 token 减少 17%,为用户带来更经济实惠的账单。
  • 代码生成实力飞跃:在代码能力方面,DeepSWE 分数从 37% 提升至 49%,MLE-Bench 分数从 49.7% 提升至 63.9%,生成的代码更符合实际生产环境的需求。
  • 强大的计算机操作集成:OSWorld-Verified 准确率从 78.4% 提升至 83%,内置的“Computer Use”工具已成为 API 和企业版用户开箱即用的利器。
  • 知识工作效能提升:GDPval-AA v2 分数从 1349 增至 1421,在文档解析、图表分析和报告撰写等复杂的多模态任务中表现尤为出色。
  • 安全防护升级:通过强化 Frontier Safety 防护机制,Gemini 3.6 Flash 在应对 CBRN(化学、生物、放射性、核)和网络攻击等滥用场景时更为 robust,抗越狱能力显著增强。

Gemini 3.6 Flash 的技术洞察

  • Token 效率的精细打磨:通过优化推理策略,模型在执行复杂的多步任务时,能够有效减少不必要的中间输出。在 DeepSWE 场景下,输出 token 可节省高达 65%,这意味着在同等成本下,能够完成更多有价值的工作。
  • Agent 架构的精简设计:对工具调用链路进行了优化,缩短了推理步数和执行循环的长度。这使得代码生成过程更贴近生产环境的要求,并减少了不必要的修改。
  • 安全对齐的深度加强:部署了升级版的 Frontier Safety 防护系统,重点针对 CBRN 和网络攻击这两种高风险的滥用场景进行了专项优化。这不仅增强了模型的抗越狱能力,同时也降低了在处理正常需求时出现误拒的概率。

如何解锁 Gemini 3.6 Flash 的强大功能

  • Gemini 应用:打开 Gemini 应用,在模型选择菜单中轻轻一点,即可切换至“3.6 Flash”版本,即刻体验。
  • Google AI Studio:登录 Google AI Studio,在模型选择器中轻松切换至 3.6 Flash,开启您的开发与测试之旅。
  • API 调用:通过 Gemini API,指定模型名称为 gemini-3.6-flash。输入价格为 1.5 美元/百万 token,输出价格为 7.5 美元/百万 token。
  • 企业版解决方案:Workspace 和 Cloud 的企业用户,可通过控制台直接启用 Gemini 3.6 Flash,并立即享用集成的 Computer Use 工具。

Gemini 3.6 Flash 的核心竞争优势

  • 成本效益显著:输出 token 减少 17%,在 DeepSWE 场景下甚至可节省 65%,大幅降低了单任务的处理成本。
  • 响应速度提升:通过精简推理步数和工具调用流程,模型的响应速度得到了显著提升。
  • 综合能力卓越:在代码编写、机器学习工程、计算机操作及知识性工作等多个 AI Agent 基准测试中,全面超越了前代模型。
  • 价格优势明显:输出价格从 9 美元降至 7.5 美元/百万 token,性价比进一步提升,为用户带来更具吸引力的选择。
  • 安全保障升级:升级后的 Frontier Safety 防护,不仅增强了抗越狱能力,还有效降低了误拒绝率,提供了更可靠的安全保障。

Gemini 3.6 Flash 与竞品的深度对比

维度Gemini 3.6 FlashGPT-5.6 Luna
输入价格1.5 美元/百万 token1.0 美元/百万 token
输出价格7.5 美元/百万 token6.0 美元/百万 token
SWE-Bench Pro58.7%62.7%
DeepSWE v1.149%67%
Terminal-Bench 2.178.0%84.7%
MLE-Bench63.9%47.6%
OSWorld-Verified83.0%72.6%
GDPval-AA v214211584

Gemini 3.6 Flash 的应用场景拓展

  • 软件开发领域:开发者可以利用其强大的代码能力,高效完成长期软件工程任务、自动化代码审查以及生成测试脚本。
  • 机器学习研究前沿:研究人员可借助 Gemini 3.6 Flash 在 MLE-Bench 等任务中,获得在模型训练、实验设计及数据分析方面的有力支持。
  • 文档智能处理革新:企业用户能够处理海量合同、财务报告和研究报告,实现多模态解析、图表提取及报告的自动化起草。
  • 计算机操作自动化升级:通过内置的 Computer Use 工具,模型能够自动操控浏览器、填写表单,并执行重复性的系统级任务。
  • 企业知识工作赋能:Gemini 3.6 Flash 可以无缝集成到 Figma、JetBrains 等工具链中,协助设计迭代、代码补全以及电商数据特征的抽取。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...