Gemma 4 是 Google DeepMind 的开源模型系列,于 2026-06-15 在 Amazon Bedrock 上线,许可为 Apache 2.0(来源:AWS 官方公告)。系列包含三款指令微调变体:Gemma 4 31B(dense,该系列中推理和代码能力最强)、Gemma 4 26B-A4B(MoE,约 4B 级成本但保有 25B 级知识)、Gemma 4 E2B(最小,适合低延迟和多模态分类)。通过 Bedrock 的 bedrock-mantle 端点访问,兼容 OpenAI SDK。如果你主要做推理/编码且需要该系列单模型最强能力,选 31B;如果对成本敏感且需要高吞吐,选 26B-A4B;如果对延迟敏感或做多模态分类,选 E2B。
截至发布日,三款模型在四个 AWS 区域可用:美东(弗吉尼亚、俄亥俄)、美西(俄勒冈)和欧洲(法兰克福),最新区域列表以 Bedrock 模型目录为准(来源:AWS 官方公告,2026-06-15)。
三款模型差异速览
| 模型 | google.gemma-4-31b | google.gemma-4-26b-a4b | google.gemma-4-e2b |
|---|---|---|---|
| 架构 | Dense | Mixture-of-Experts | Dense (PLE) |
| 总/活跃参数 | 30.7B | 25.2B / 3.8B active | 5.1B / 2.3B effective |
| 上下文窗口 | 256K tokens | 256K tokens | 128K tokens |
| 输入模态 | 文本、图像 | 文本、图像 | 文本、图像 |
| 推理模式 | 支持 | 支持 | 支持(建议 high effort) |
| 函数调用 | 原生 | 原生 | 原生 |
| 服务层级 | Standard, Priority, Flex | Standard, Priority, Flex | Standard, Priority, Flex |
选择依据:31B 适合推理或编码密集型任务;26B-A4B 适合成本敏感的高吞吐场景;E2B 适合对延迟敏感或仅需轻量多模态判断的场景(来源:AWS 官方公告,2026-06-15)。
快速接入
前提
需要 AWS 账号,IAM 主体要加上 AmazonBedrockMantleInferenceAccess 策略,这个策略允许你调用 bedrock-mantle 端点的推理操作(来源:AWS 官方公告)。接入使用 bedrock-mantle 端点,URL 格式为:
https://bedrock-mantle.{region}.api.aws/openai/v1
使用 OpenAI SDK 调用
通过 OpenAI SDK 调用 Gemma 4 31B。API key 推荐使用短期 key,自动过期(最长 12 小时),权限继承自生成它的 IAM 角色。生产环境应通过 AWS Secrets Manager 或 Parameter Store 管理凭证(来源:AWS 官方公告,2026-06-15)。
from openai import OpenAI
client = OpenAI(
api_key="<your-short-term-bedrock-api-key>",
base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1",
)
response = client.chat.completions.create(
model="google.gemma-4-31b",
messages=[
{"role": "user", "content": "Explain the benefits of mixture-of-experts architectures for production inference."}
],
max_tokens=512,
)
print(response.choices[0].message.content)
迁移现有应用只需更新 base URL 和 model ID,不需要改 SDK 或消息结构。
Console Playground
不想写代码的话,在 Bedrock 控制台也能测:测试 Playground → Chat/Text → 选择 Google → 挑一款 Gemma 4 模型。
关键特性
推理模式(Reasoning Mode)
Gemma 4 在回答前输出思考过程。通过 Responses API 的 reasoning 参数启用,effort 支持 low、medium、high。思考内容以独立的 reasoning 类型返回,不会混入最终回答(来源:AWS 官方公告,2026-06-15):
response = client.responses.create(
model="google.gemma-4-31b",
input="If a train leaves at 3pm at 60 km/h and another leaves an hour later at 90 km/h from the same station, when does the second catch up?",
reasoning={"effort": "high"},
)
print(response.output_text)
for item in response.output:
if item.type == "reasoning":
for block in item.content:
print(block.text)
多轮对话时,只能把上一轮的最终回答(output_text)放进历史,不要把 reasoning items 传回给模型。AWS 官方说明指出,回传推理过程会降低模型回复质量(来源:AWS 官方公告,2026-06-15)。
E2B 变体建议把 reasoning_effort 设为 high。这个模型默认会做大量推理,高 effort 让推理留在独立通道里,不会漏到最终回答里。
函数调用
Gemma 4 支持原生函数调用(function calling)。完整流程:定义 tools → 发送请求 → 接收 tool_call → 执行函数 → 返回结果。bedrock-mantle 端点兼容 OpenAI 的 tool calling 接口,示例见 AWS 官方文章。
多模态(图像输入)
所有变体支持文本+图像输入。API 接受 base64 data URL 或 S3 URI(不支持任意 HTTPS URL)。官方建议图像内容放在文本之前以获得最佳效果(来源:AWS 官方公告,2026-06-15):
import base64
with open("chart.png", "rb") as image_file:
image_b64 = base64.b64encode(image_file.read()).decode("utf-8")
data_url = f"data:image/png;base64,{image_b64}"
response = client.chat.completions.create(
model="google.gemma-4-31b",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": data_url}},
{"type": "text", "text": "Describe the trend shown in this chart."}
]
}],
)
Streaming
设 stream=True 就能开启 SSE 流式响应,chat 和 agent 场景都适用:
stream = client.chat.completions.create(
model="google.gemma-4-31b",
messages=[{"role": "user", "content": "Write a short poem."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
推荐采样参数
在 bedrock-mantle 端点上,用 temperature 和 top_p 控制采样。AWS 官方推荐 temperature=1.0、top_p=0.95,推理和非推理模式都适用(来源:AWS 官方公告,2026-06-15)。
选型建议
| 负载特征 | 推荐变体 | 理由 |
|---|---|---|
| 复杂推理、代码生成、单模型强推理 | Gemma 4 31B | 最大的 dense 变体,256K 上下文,推理和编码能力突出 |
| 高吞吐、对成本敏感,但仍需要知识宽度 | Gemma 4 26B-A4B | MoE 设计使推理成本和延迟接近 4B 模型,同时保留 25B 级知识 |
| 低延迟、on-device 风格、轻量多模态分类 | Gemma 4 E2B | 最小最快变体,适用于成本敏感或速度优先的场景 |
如果同一个应用内不同请求有不同需求,可以按请求切换变体——三个模型共享相同的 API 接口(system prompt、tool calling、image input、reasoning mode)。
生产注意事项
服务层级
Bedrock 提供三个 on-demand 层级,按请求指定 service_tier 参数切换(来源:AWS 官方公告,2026-06-15):
| 层级 | 适用场景 |
|---|---|
| Standard | 日常 AI 任务,标准按量计费 |
| Priority | 客户面向、实时 agent 等对延迟敏感的任务(OTPS 延迟比 Standard 提升最高 25%,来源:AWS 官方公告,2026-06-15) |
| Flex | 模型评估、内容摘要、agent 类后台任务(折扣定价,延迟较高) |
限流处理
bedrock-mantle 端点的限流按 token 配额算(输入 token/分钟、输出 token/分钟),不是 RPM。Gemma 这类开放模型目前没有公开的 per-account token quota,流量由内部服务容量控制。遇到 HTTP 429(token 配额超限)或 503(区域容量不足)时,建议用指数退避加抖动的重试策略(来源:AWS 官方公告,2026-06-15)。
OpenAI SDK 的 max_retries 参数可自动重试:
client = OpenAI(
api_key="<your-short-term-bedrock-api-key>",
base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1",
max_retries=6,
)
流量增长
不要大幅突增请求率。AWS 推荐渐进式扩容:从目标请求率开始,遇到 503 就降 50%,稳定 15 分钟后再加 50%,重复到目标量(来源:AWS 官方公告,2026-06-15)。详细步骤见 AWS 官方文档的 Scaling on-demand inference 部分。
隐式 Prompt 缓存
Gemma 4 在 Bedrock 上自动启用隐式 prompt 缓存,不用改代码也不用加标记。缓存命中不保证每次都有,但在 prompt 前缀稳定的任务里更容易触发——多轮 agent、RAG 应用和长上下文分析都是典型场景(系统 prompt、工具定义、源文档在请求间复用)。建议把静态内容放在 prompt 前面、动态内容放后面,这样缓存命中概率最大。缓存命中的输入 token 不计入输入 token 配额(来源:AWS 官方公告,2026-06-15)。
清理
按需推理只在你调用时计费,没有基础设施需要销毁。短期 API key 到期自动失效(最长 12 小时),想提前撤销的话在 Bedrock 控制台删掉就行。测试完 Priority 层级后,去掉 service_tier 参数就能切回 Standard。详细定价见 Amazon Bedrock 定价页(来源:AWS 官方公告,2026-06-15)。
FAQ
Gemma 4 模型在 Bedrock 上和在 Google AI Studio 上有什么区别?
Gemma 4 是 Apache 2.0 开源模型,可以在多个平台上跑。在 Bedrock 上运行时,推理完全在 AWS 基础设施上完成,AWS 是数据处理方。你的提示和完成内容不会被拿来训练模型,也不会和第三方共享(来源:AWS 官方公告,2026-06-15)。
一定要用 Amazon Bedrock 才能运行 Gemma 4 吗?
不是。Gemma 4 是 Apache 2.0 开源模型,可以从 Hugging Face 下载权重自行部署。在 Bedrock 上运行的意义在于:无需管理推理基础设施,按 token 付费,自动获得 Standard/Priority/Flex 层级和 AWS 安全边界。
定价如何?
按 token 计费,具体价格因模型和 tier 而异。以 AWS Bedrock 定价页面为准。
函数调用支持哪些格式?
Gemma 4 的函数调用格式和 OpenAI SDK 的 tool calling 接口兼容。定义 tools 数组→模型返回 tool_call→执行函数→返回 tool 结果,完整流程见上文代码示例。
支持 GPTQ/AWQ 等量化格式吗?
AWS 官方公告未提及 Bedrock 上的量化部署选项。自行部署时社区有对应的量化工具支持。
有 fine-tuning 支持吗?
AWS 公告未宣布 Bedrock 上对 Gemma 4 的 fine-tuning 支持。如果需要在专用数据上微调,可以在 Bedrock 之外自行完成,再将微调后权重在自有基础设施上部署。