直接回答:截至 2026 年 7 月 16 日,Gemini 2 不是一个可直接调用的单一模型 ID。Gemini Developer API 中,gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 与 gemini-2.0-flash-lite-001 已于 2026 年 6 月 1 日停止服务;稳定版 gemini-2.5-pro、gemini-2.5-flash 与 gemini-2.5-flash-lite 目前仍可用,但官方列出的最早停用日都是 2026 年 10 月 16 日。生产系统不应继续新接入 Gemini 2.0,也不应等 2.5 返回错误才迁移。
怎么选替代:官方退役表分别推荐 2.5 Pro 转向 gemini-3.1-pro-preview、2.5 Flash 转向稳定版 gemini-3.5-flash、2.5 Flash-Lite 转向稳定版 gemini-3.1-flash-lite。这只是候选映射,不是无条件替换。模型 ID、API、SDK、thinking、媒体分辨率、工具调用、结构化输出、费用和限额都要用同一批保留样本重新验收。

旧版页面把“Gemini 2”写成一个“最新 AI 模型”,还出现了“Gemini 2.0 Ultra”“综合性能提升 40%”“10M 或十亿级上下文”“2026 年发布会”等无法由 Google 官方资料支持的说法。它们不是可复核测试,本次全部撤回。Gemini 2.0 首个公开模型 Gemini 2.0 Flash 在 2024 年 12 月发布,Gemini 2.5 稳定版在 2025 年 6 月发布;本文只引用 Google AI for Developers、Google Cloud 与 Google DeepMind 的一手资料,复核日期为 2026 年 7 月 16 日。
Gemini 2 到底指什么?先把产品、家族和模型 ID 分开
“Gemini 2”可以指模型家族、Gemini 应用中某个用户可见档位,也可能只是文章作者对 2.0 与 2.5 的统称。API 实际接收的是精确模型字符串。排查或迁移时,只说“我们用了 Gemini 2”没有执行价值:必须同时记录平台、端点、模型 ID、版本别名、区域和 SDK。
| 名称 | 是什么 | 能否直接当 API ID | 迁移时要记录 |
|---|---|---|---|
| Gemini | Google 的模型与消费产品品牌 | 不能 | 具体使用的是应用、AI Studio、Developer API 还是 Vertex AI |
| Gemini 2 | 对 2.0/2.5 家族的非精确称呼 | 不能 | 完整 ID 和生命周期 |
gemini-2.5-flash |
Gemini Developer API 稳定模型 ID | 可以 | 调用日期、SDK、参数、工具和限额 |
gemini-flash-latest |
会切换所指版本的 latest 别名 | 可以,但有漂移 | 每次评测时实际解析到的版本 |
| Gemini 应用中的模型标签 | 面向消费者的产品选择 | 不能照抄 | 套餐、地区、功能和产品条款 |
Google 的当前模型目录明确区分 stable、preview、latest 与 experimental。稳定 ID 通常不会在原地变化,适合生产;Preview 至少提前两周通知退役,但限制可能更严;latest 会热切换所指版本;experimental 随时可能变化。生产系统应优先钉住精确稳定 ID,而不是为了“自动最新”牺牲可复现性。
Gemini 2.0 和 2.5 现在还能用吗?
以下状态来自Gemini API 官方退役表与发布说明。退役表中的日期是“最早可能停用日”;Google 会在最终停用前另行通知。已标记 shutdown 的端点则已经关闭,不应继续通过重试或更换密钥解决。
| Developer API 模型 ID | 2026-07-16 状态 | 停用日/最早停用日 | 官方推荐替代 |
|---|---|---|---|
gemini-2.0-flash |
已停止 | 2026-06-01 | gemini-3.5-flash |
gemini-2.0-flash-001 |
已停止 | 2026-06-01 | gemini-3.5-flash |
gemini-2.0-flash-lite |
已停止 | 2026-06-01 | gemini-3.1-flash-lite |
gemini-2.0-flash-lite-001 |
已停止 | 2026-06-01 | gemini-3.1-flash-lite |
gemini-2.5-pro |
仍可用,已公布退役计划 | 最早 2026-10-16 | gemini-3.1-pro-preview |
gemini-2.5-flash |
仍可用,已公布退役计划 | 最早 2026-10-16 | gemini-3.5-flash |
gemini-2.5-flash-lite |
仍可用,已公布退役计划 | 最早 2026-10-16 | gemini-3.1-flash-lite |
2.5 的 TTS、Live、图像与 preview ID 有各自时间表,不能套用上表。项目中只要出现 gemini-2.,都应先通过模型列表和退役表逐项确认。官方模型目录已经把 Gemini 2.0 Flash 与 Flash-Lite 放入 Previous models,并标记 Shut down;继续把它写成“当前最新模型”会直接误导读者。
为什么不能只把 2.0 改成 2.5,或把 2.5 改成 3?
模型迁移同时改变行为合同与运行合同。即使请求能成功返回,答案结构、思考行为、token 消耗、媒体解析、工具选择、拒答边界和延迟也可能改变。Google 的Gemini 3 开发者指南专门提醒从 2.5 迁移时重新处理 thinking、temperature 与媒体分辨率;这说明“HTTP 200”远远不是迁移完成。
| 变化层 | 只改模型 ID 的风险 | 最小验收证据 |
|---|---|---|
| 输出行为 | 格式、详略、拒答与指令遵循变化 | 同一保留集的新旧原始输出和盲评 |
| thinking | 参数不兼容、token 与延迟变化 | 参数清单、usage、首 token 与总耗时 |
| 媒体 | PDF/图片/视频采样或分辨率改变 | 含页码、时间戳和小字的边界样本 |
| 工具调用 | 工具选择或参数结构发生变化 | 工具轨迹、Schema 校验、幂等与权限日志 |
| 成本和配额 | 单价、思考 token、RPM/TPM 与重试改变 | 实际 usage、账单估算和 429 压测 |
| SDK/API | 旧库弃用或响应对象不同 | 锁定依赖、契约测试与回滚构建 |
先做库存:在代码、配置和平台中找到所有 Gemini 2
不要只搜索主仓库。模型 ID 可能藏在环境变量、数据库、可视化工作流、函数配置、Notebook、IaC、告警规则、离线批任务或客户级覆盖项中。Vertex AI 与 Developer API 还可能使用不同认证、资源名和区域设置。
| 位置 | 搜索对象 | 必须保存的字段 |
|---|---|---|
| 代码仓库 | gemini-2.、gemini-*-latest、旧 SDK 包名 |
仓库、文件、行号、负责人 |
| 配置/密钥系统 | MODEL、ENDPOINT、LOCATION、PROJECT | 环境、覆盖优先级、最后修改人 |
| 任务平台 | 定时任务、队列、云函数、容器参数 | 触发器、并发、重试、截止时间 |
| 数据与日志 | 过去 30 天实际 model 字段 | 调用量、错误率、token、延迟、费用 |
| 第三方集成 | 代理框架、插件、低代码平台 | 供应商映射、能否固定版本、回滚入口 |
| 客户端 | 移动端、浏览器扩展、桌面应用 | 最低版本、发布节奏、旧客户端存量 |
Gemini API 提供Models API,可以列出账号当下可见模型及支持的方法;它能回答“这个项目现在看得到什么”,但不能替代退役公告,也不能证明业务功能兼容。库存表应同时保存检查日期和平台,因为账号、地区与时间都会影响结果。
2.5 Pro、Flash、Flash-Lite 应该迁到哪里?
先按官方替代映射建立候选,再按任务选型。2.5 Pro 的推荐目标仍是 Preview,意味着生命周期更短、变更更快;如果业务更重稳定性,应把“是否接受 Preview”作为独立决策,而不是默认通过。2.5 Flash 和 Flash-Lite 的推荐目标是稳定版,但稳定不代表输出行为与旧模型相同。
| 现有用途 | 首个候选 | 必须比较 | 不要预设 |
|---|---|---|---|
| 2.5 Pro 复杂推理/代码 | 3.1 Pro Preview | 质量、thinking、延迟、Preview 风险 | 版本更高就对全部任务更强 |
| 2.5 Flash 在线问答/抽取 | 3.5 Flash | 结构化输出、吞吐、单位成功成本 | 同为 Flash 就可无损替换 |
| 2.5 Flash-Lite 高并发分类 | 3.1 Flash-Lite | 边界样本、语言、拒答、429 | 便宜就一定总成本更低 |
| 2.0 Flash 已停止端点 | 3.5 Flash | 先恢复可用,再完成全量回归 | 无限重试能恢复 |
| 2.0 Flash-Lite 已停止端点 | 3.1 Flash-Lite | 降级路径和数据积压 | 换 API key 能解决 404 |
| 图像/Live/TTS | 查各自模型表 | 模态、端点、实时性、独立退役日 | 文本模型替代映射适用于媒体模型 |
需要了解新目标的身份与能力边界,可继续阅读本站的 Gemini 3.1 Pro 模型与 API 指南。跨模型对比应采用本站的 AI 平台同任务评测方法,不要拿不同时间、不同提示和不同工具条件的厂商 benchmark 直接排总榜。
API 与 SDK 迁移:模型版本和客户端版本分开改
Google 推荐使用 Google Gen AI SDK。旧 Python google-generativeai、旧 JavaScript @google/generative-ai 等库与新 SDK 的客户端、类型、配置和响应访问方式并不完全相同。官方Gen AI SDK 迁移指南提供语言级对照;官方库页面列出受支持 SDK。模型迁移和 SDK 迁移最好拆成两个可回滚变更,否则失败时难以定位。
| 变更批次 | 内容 | 通过条件 | 回滚 |
|---|---|---|---|
| A:观测补齐 | 记录模型 ID、usage、延迟、错误、工具轨迹 | 新旧请求可逐条关联 | 仅新增日志,无行为变化 |
| B:SDK | 迁移到受支持 Gen AI SDK,仍用现有模型 | 契约测试与输出解析通过 | 锁回旧依赖和构建 |
| C:模型 | 只改变目标模型与必要参数 | 保留集、成本、安全门通过 | 切回旧模型;已停用 2.0 需回到备用新模型 |
| D:功能优化 | 调整 thinking、媒体、工具与提示 | 每项有独立实验记录 | 按功能开关关闭 |
最小 Python 例子只用于确认客户端、密钥与目标 ID 能连通,不代表生产迁移完成:
from google import genai
client = genai.Client() # 从 GEMINI_API_KEY 读取密钥
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="只返回 JSON:{\"status\":\"ok\"}",
)
print(response.text)
不要把密钥写进仓库、网页或日志。上线代码还需要超时、有限重试、抖动、幂等、usage 记录、内容验证和降级。若准备采用新 Interactions API,应另读Interactions API 文档;API 迁移与模型迁移也应拆开验收。
Thinking 和 temperature 为什么会让迁移结果变样?
Gemini 2.5 与 3 系列的推理控制不应按名字机械映射。官方 Gemini 3 指南建议:如果过去用复杂链式提示强迫 2.5 推理,迁移后先简化提示并使用 thinking_level;如果旧代码显式设置了低 temperature,迁移到 Gemini 3 时建议移除并先使用默认 1.0,以避免复杂任务出现循环或性能下降。具体支持仍应查目标模型页与Thinking 文档。
| 旧配置 | 迁移风险 | 验证动作 |
|---|---|---|
| 长篇“逐步思考”提示 | 重复约束、延迟和 token 增加 | 简化版与原版做同任务盲测 |
| 固定低 temperature | 复杂任务可能循环或退化 | 先测默认值,再逐项调整 |
| 依赖隐藏思考文本 | 不可作为稳定接口合同 | 只验最终答案、证据和可观察 usage |
| 按输出 token 估价 | thinking token 也可能计入输出费用 | 使用实际 usage 与定价页复算 |
| 全任务统一高 thinking | 简单任务成本与延迟浪费 | 按任务路由,设升级触发条件 |
结构化输出与函数调用要重新做契约测试
Structured Outputs约束返回 JSON 的形状,Function Calling让模型建议工具名与参数;两者都不保证事实正确,也不授权模型执行操作。迁移后必须用真实 Schema 和工具集合重跑,而不是只看文本回答。
| 测试 | 样本 | 硬门 |
|---|---|---|
| Schema 合法 | 正常、空值、长文本、枚举外输入 | 解析成功且业务二次校验通过 |
| 工具选择 | 应调用、不应调用、多个候选 | 危险工具零误调用 |
| 参数边界 | 负数、超长、路径、URL、用户 ID | 应用侧拒绝越界参数 |
| 重复调用 | 超时重试、网络断开、重复响应 | 幂等键阻止重复付款/发送/删除 |
| 提示注入 | 工具结果或文件中的恶意指令 | 不提升权限、不泄露密钥 |
| 人工审批 | 付款、删除、外发、权限变更 | 模型只能预览,审批后才执行 |
更完整的权限设计可参考本站 Function Calling 生产控制指南和 Prompt Engineering 任务契约指南。
PDF、图片、音频和视频迁移要测什么?
“支持多模态”只说明接口接受某些输入,不等于 OCR、小字、图表、音轨或时间定位在所有样本上可靠。Gemini 3 迁移指南提醒,PDF 与文档理解可能需要测试 media_resolution_high;更高分辨率也可能增加 token。文件上传、保留时间和项目限额则应查Files API与文件输入方法。
| 模态 | 边界样本 | 保存证据 |
|---|---|---|
| 扫描件、小字、跨页表、脚注、冲突版本 | 文件哈希、页码、引用框、答案 | |
| 图片 | 旋转、低对比、密集图表、遮挡 | 原图、分辨率、目标字段、人工真值 |
| 视频 | 画面变化快、长静帧、字幕与画面冲突 | 时间戳、关键帧、音轨、问题答案 |
| 音频 | 多人重叠、口音、噪声、专有名词 | 时间段、说话人、转写真值 |
| 长上下文 | 开头/中间/结尾事实、近似干扰、无答案 | 位置、source_id、引用和拒答 |
百万 token 是输入容量,不是“百万 token 内零遗漏”。长文档仍需要检索、分块、引用、冲突处理和无答案测试。相关工程方法可继续看本站 AI 知识管理与 RAG 验收指南。
价格、限额和吞吐怎样公平比较?
不要把旧模型某次账单或网上单价复制到新模型。官方Gemini API 定价页会更新,不同模型、上下文长度、缓存、Batch、工具和 thinking 的收费方式不同;限额页说明 RPM、TPM、RPD 以及基于消费层级的限制按项目计算,实际额度要在 AI Studio 查看。
| 指标 | 错误比较 | 正确比较 |
|---|---|---|
| 价格 | 只比每百万输入 token | 输入+输出+thinking+工具+缓存+失败重试 |
| 质量 | 只看一项官方榜单 | 真实保留集的任务成功率和人工复核 |
| 延迟 | 只看一次总耗时 | 首 token、总耗时、P50/P95/P99 |
| 吞吐 | 把文档示例当账号保证 | 自己项目实际 RPM/TPM 与 429 |
| 总成本 | 每次请求成本 | 单位成功任务成本 |
| 稳定性 | 只统计 200 | 超时、5xx、429、解析失败、降级成功率 |
单位成功任务成本可以定义为:(模型、工具、存储、网络、重试与人工复核总成本)÷(通过全部质量门的任务数)。如果新模型单次便宜但返工更多,总成本可能更高。可用Batch API处理非实时任务,用Context Caching优化重复长上下文,但两者都要重新核对适用模型、价格和时效。
404、400、429 与结果异常怎样排查?
| 症状 | 最可能原因 | 先做什么 | 不要做什么 |
|---|---|---|---|
| 404 / model not found | 2.0 已停用、ID 拼错、区域或账号不可见 | 列模型、查退役表、核对平台与项目 | 无限重试或轮换密钥 |
| 400 | 参数、Schema、thinking 或媒体配置不兼容 | 保存完整错误和最小请求 | 删掉全部校验强行返回文本 |
| 401/403 | 密钥、IAM、项目或地区问题 | 核对身份、项目、API 与区域 | 把密钥贴进工单/日志 |
| 429 | RPM/TPM/RPD/消费上限 | 读 Retry-After,限流并指数退避加抖动 | 并发重试放大流量 |
| 5xx/超时 | 服务、网络、请求过大或工具依赖 | 有限重试、熔断、降级、查状态 | 把非幂等动作自动重放 |
| JSON 合法但内容错 | Schema 只约束形状 | 事实、枚举、范围与业务规则二次校验 | 把可解析当正确 |
| 质量突然变化 | latest 漂移、提示/工具/数据或 SDK 变化 | 比对完整运行指纹 | 只凭主观印象归因模型 |
Google 的API 故障排查指南列出常见状态码;服务级异常再查看Google AI Studio 状态页。每个错误报告至少包含时间、项目匿名标识、平台、地区、模型 ID、SDK 版本、请求 ID、状态码和脱敏最小复现。
一套可复现的迁移评测流程
- 冻结基线:保存旧模型实际 ID、平台、SDK、提示、工具、Schema、数据版本与 30 天运行指标。
- 建立保留集:覆盖常见、边界、无答案、冲突、多语言、长上下文、工具失败与提示注入。
- 选候选:从官方替代映射开始,再根据稳定/Preview、能力、地区与预算筛选。
- 同条件运行:先只换模型,不同时改提示和 SDK;保存原始请求、响应、usage 与耗时。
- 机械评分:校验 JSON、引用、枚举、数值、代码测试和工具参数。
- 人工盲评:隐藏模型名,检查正确、完整、可执行、风险与拒答。
- 安全评测:检查越权、密钥、隐私、危险动作、提示注入与日志脱敏。
- 容量评测:按目标并发测试 RPM/TPM、429、超时、队列和降级。
- 小流量灰度:先影子,再 1%/5%/25%,每档都有停止阈值。
- 保留回滚:至少跨过一个完整业务周期后再删除旧路径;2.0 已停用时回滚目标必须是另一个可用新模型。
| 硬门 | 示例规则 | 失败动作 |
|---|---|---|
| 功能 | 必需能力和关键 Schema 100% 通过 | 停止迁移,换候选或补应用逻辑 |
| 事实 | 关键事实与引用一致率 100% | 拒答、检索或人工复核 |
| 质量 | 保留集不低于既定基线 | 保持旧模型/备用模型 |
| 安全 | 越权和危险动作误执行零容忍 | 立即停止灰度 |
| 成本 | 单位成功任务成本不超预算 | 降 thinking、路由或 Batch |
| 容量 | P95、429 与超时在 SLO 内 | 限流、排队、配额或降级 |
| 回滚 | 开关、负责人、演练和数据兼容齐全 | 不得扩大流量 |
本文附带标准库脚本 gemini-model-migration-gate.py,它不会调用 Gemini,也不会替你宣称新模型质量更高;它只检查迁移记录是否包含模型身份、平台、能力、保留集、实际结果、费用/延迟证据、负责人和回滚条件。这样能阻止“凭感觉改 ID”被误记为已验收。
灰度、截止日期与回滚怎样安排?
| 时间点 | 动作 | 交付物 |
|---|---|---|
| 现在 | 清点全部 2.x,2.0 立即切换可用备用 | 库存、影响面、负责人 |
| 一周内 | 补日志、保留集、候选与预算 | 基线报告和迁移设计 |
| 两周内 | 离线评测与影子流量 | 逐样本证据和差异清单 |
| 随后 | 1%→5%→25%→100% 灰度 | 每档 SLO 与审批记录 |
| 2026-10-16 前 | 完成 2.5 生产切换并演练回滚 | 无 2.5 关键依赖、备用路径 |
| 切换后 | 持续监控完整业务周期 | 质量、成本、容量和事件复盘 |
官方日期是最晚风险边界,不是内部项目截止日。还要留出应用商店审核、客户升级、合同变更、配额申请和节假日冻结时间。Preview 替代模型若再次公布退役,迁移路线也必须可重复执行。
隐私、安全与数据处理不能在迁移中顺手省略
从 Developer API 切到 Vertex AI,或从免费项目切到付费项目,数据处理、身份、区域、日志与合同可能改变。迁移记录应注明是否含个人信息、商业机密、受监管数据和客户内容,并检查最小化、脱敏、保留、访问控制与删除流程。安全设置只能降低部分内容风险,不能替代权限、事实校验和人工审批;参考Safety settings与安全指南。
| 检查项 | 问题 | 证据 |
|---|---|---|
| 数据最小化 | 是否发送了完成任务不需要的字段 | 字段清单与脱敏测试 |
| 身份权限 | 服务账号是否拥有过宽权限 | IAM/密钥轮换与最小权限评审 |
| 日志 | 提示、文件、工具参数是否泄密 | 采样日志与删除/保留策略 |
| 危险动作 | 模型能否直接付款、删除或外发 | 审批、幂等、限额和审计日志 |
| 第三方 | 框架和插件是否额外保存数据 | 数据流图和供应商条款 |
| 区域/合同 | 平台切换是否改变数据位置与承诺 | Cloud 项目、区域和合同复核 |
如果输出用于重要决策,还应采用本站 AI 幻觉识别与证据核验方法。联网、长上下文或结构化 JSON 都不会自动消除幻觉。
常见误区
| 误区 | 事实 |
|---|---|
| Gemini 2 是一个模型 | 它是模糊家族称呼,API 必须使用精确 ID |
| 2.0 还能再等等 | 四个稳定 2.0 Flash/Flash-Lite ID 已于 2026-06-01 停止 |
| 2.5 仍可用就不用迁 | 三个稳定文本模型最早 2026-10-16 停用,应提前完成灰度 |
| 官方推荐替代就是无损兼容 | 推荐只给候选,行为、参数、价格和限额仍需回归 |
| latest 最省维护 | latest 会热切换,不利于可复现和变更控制 |
| 1M 上下文等于全部记住 | 容量不等于召回、事实和引用准确率 |
| JSON 能解析就可靠 | 结构合法不保证字段事实和业务规则正确 |
| 429 多重试即可 | 无节制重试会放大拥塞,应限流、退避、抖动和降级 |
FAQ
Gemini 2.0 Flash 现在还能通过 API 调用吗?
不能把它当作仍受支持端点。官方退役表显示 gemini-2.0-flash 与 -001 已在 2026 年 6 月 1 日停止,推荐迁往 gemini-3.5-flash。若仍偶然看到旧名称,应以当前项目的 Models API 和官方退役表为准,不要依赖缓存界面。
Gemini 2.5 什么时候停用?
Developer API 的稳定版 2.5 Pro、Flash、Flash-Lite 当前表格均列出 2026 年 10 月 16 日为最早停用日。确切日期可能另行通知;项目内部截止日应更早。
2.5 Pro 为什么推荐到 Preview?
官方当前推荐的是 gemini-3.1-pro-preview。Preview 可用于生产但生命周期和限额风险更高。组织若不能接受 Preview,应重新评估任务、稳定性要求和其他稳定候选,而不是隐瞒这一差异。
只替换 model 字符串可以吗?
只能作为连通性实验,不能作为生产验收。至少要回归 thinking、temperature、结构化输出、工具、媒体、成本、限额、安全与回滚。
Developer API 和 Vertex AI 的停用日期完全一样吗?
不能默认一样。两套平台有各自模型页、区域、版本和生命周期说明。Vertex AI 项目应另查Google Cloud 模型版本与生命周期及Vertex AI 发布说明。
怎么证明迁移后的模型更好?
不能靠版本号证明。用固定保留集、同条件输入、原始输出、机械评分、人工盲评、实际 usage、P95 延迟、安全测试和单位成功任务成本形成证据链。
结论:把模型退役当成可重复的工程流程
Gemini 2.0 已经停止,Gemini 2.5 也进入明确倒计时。正确动作不是寻找一句“哪个模型最好”,而是建立可重复迁移能力:精确库存、官方生命周期、候选映射、同任务评测、容量与安全门、分档灰度和可演练回滚。这样下一次模型别名、Preview 或 SDK 再变化时,团队不必从头救火。
资料复核:2026 年 7 月 16 日。模型状态、价格、限额、地区和替代项都可能变化;执行迁移当天请重新打开官方模型目录、退役表与项目控制台。本文没有使用用户密钥调用模型,也没有把厂商 benchmark 或未留存日志的体验包装成本站实测。
