AI Tools
教程7 分钟2026年6月16日作者:AIGCDev

Gemma 4 on Bedrock 上手:三款开源模型怎么选、怎么用

Gemma 4 是 Google DeepMind 的开源模型系列,于 2026-06-15 在 Amazon Bedrock 上线,许可为 Apache 2.0(来源:AWS 官方公告)。系列包含三款指令微调变体:Gemma 4 31B(dense,该系列中推理和代码能力最强)、Gemma 4 26B-A4B(MoE,约 4B 级成本但保有 25B 级知识)、Gemma 4 E2B(最小,适合低延迟和多模态分类)。通过 Bedrock 的 bedrock-mantle 端点访问,兼容 OpenAI SDK。如果你主要做推理/编码且需要该系列单模型最强能力,选 31B;如果对成本敏感且需要高吞吐,选 26B-A4B;如果对延迟敏感或做多模态分类,选 E2B。

截至发布日,三款模型在四个 AWS 区域可用:美东(弗吉尼亚、俄亥俄)、美西(俄勒冈)和欧洲(法兰克福),最新区域列表以 Bedrock 模型目录为准(来源:AWS 官方公告,2026-06-15)。

三款模型差异速览

模型 google.gemma-4-31b google.gemma-4-26b-a4b google.gemma-4-e2b
架构 Dense Mixture-of-Experts Dense (PLE)
总/活跃参数 30.7B 25.2B / 3.8B active 5.1B / 2.3B effective
上下文窗口 256K tokens 256K tokens 128K tokens
输入模态 文本、图像 文本、图像 文本、图像
推理模式 支持 支持 支持(建议 high effort)
函数调用 原生 原生 原生
服务层级 Standard, Priority, Flex Standard, Priority, Flex Standard, Priority, Flex

选择依据:31B 适合推理或编码密集型任务;26B-A4B 适合成本敏感的高吞吐场景;E2B 适合对延迟敏感或仅需轻量多模态判断的场景(来源:AWS 官方公告,2026-06-15)。

快速接入

前提

需要 AWS 账号,IAM 主体要加上 AmazonBedrockMantleInferenceAccess 策略,这个策略允许你调用 bedrock-mantle 端点的推理操作(来源:AWS 官方公告)。接入使用 bedrock-mantle 端点,URL 格式为:

https://bedrock-mantle.{region}.api.aws/openai/v1

使用 OpenAI SDK 调用

通过 OpenAI SDK 调用 Gemma 4 31B。API key 推荐使用短期 key,自动过期(最长 12 小时),权限继承自生成它的 IAM 角色。生产环境应通过 AWS Secrets Manager 或 Parameter Store 管理凭证(来源:AWS 官方公告,2026-06-15)。

from openai import OpenAI

client = OpenAI(
    api_key="<your-short-term-bedrock-api-key>",
    base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1",
)

response = client.chat.completions.create(
    model="google.gemma-4-31b",
    messages=[
        {"role": "user", "content": "Explain the benefits of mixture-of-experts architectures for production inference."}
    ],
    max_tokens=512,
)
print(response.choices[0].message.content)

迁移现有应用只需更新 base URL 和 model ID,不需要改 SDK 或消息结构。

Console Playground

不想写代码的话,在 Bedrock 控制台也能测:测试 Playground → Chat/Text → 选择 Google → 挑一款 Gemma 4 模型。

关键特性

推理模式(Reasoning Mode)

Gemma 4 在回答前输出思考过程。通过 Responses API 的 reasoning 参数启用,effort 支持 lowmediumhigh。思考内容以独立的 reasoning 类型返回,不会混入最终回答(来源:AWS 官方公告,2026-06-15):

response = client.responses.create(
    model="google.gemma-4-31b",
    input="If a train leaves at 3pm at 60 km/h and another leaves an hour later at 90 km/h from the same station, when does the second catch up?",
    reasoning={"effort": "high"},
)
print(response.output_text)
for item in response.output:
    if item.type == "reasoning":
        for block in item.content:
            print(block.text)

多轮对话时,只能把上一轮的最终回答(output_text)放进历史,不要把 reasoning items 传回给模型。AWS 官方说明指出,回传推理过程会降低模型回复质量(来源:AWS 官方公告,2026-06-15)。

E2B 变体建议把 reasoning_effort 设为 high。这个模型默认会做大量推理,高 effort 让推理留在独立通道里,不会漏到最终回答里。

函数调用

Gemma 4 支持原生函数调用(function calling)。完整流程:定义 tools → 发送请求 → 接收 tool_call → 执行函数 → 返回结果。bedrock-mantle 端点兼容 OpenAI 的 tool calling 接口,示例见 AWS 官方文章。

多模态(图像输入)

所有变体支持文本+图像输入。API 接受 base64 data URL 或 S3 URI(不支持任意 HTTPS URL)。官方建议图像内容放在文本之前以获得最佳效果(来源:AWS 官方公告,2026-06-15):

import base64
with open("chart.png", "rb") as image_file:
    image_b64 = base64.b64encode(image_file.read()).decode("utf-8")
data_url = f"data:image/png;base64,{image_b64}"

response = client.chat.completions.create(
    model="google.gemma-4-31b",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": data_url}},
            {"type": "text", "text": "Describe the trend shown in this chart."}
        ]
    }],
)

Streaming

stream=True 就能开启 SSE 流式响应,chat 和 agent 场景都适用:

stream = client.chat.completions.create(
    model="google.gemma-4-31b",
    messages=[{"role": "user", "content": "Write a short poem."}],
    stream=True,
)
for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)

推荐采样参数

在 bedrock-mantle 端点上,用 temperaturetop_p 控制采样。AWS 官方推荐 temperature=1.0top_p=0.95,推理和非推理模式都适用(来源:AWS 官方公告,2026-06-15)。

选型建议

负载特征 推荐变体 理由
复杂推理、代码生成、单模型强推理 Gemma 4 31B 最大的 dense 变体,256K 上下文,推理和编码能力突出
高吞吐、对成本敏感,但仍需要知识宽度 Gemma 4 26B-A4B MoE 设计使推理成本和延迟接近 4B 模型,同时保留 25B 级知识
低延迟、on-device 风格、轻量多模态分类 Gemma 4 E2B 最小最快变体,适用于成本敏感或速度优先的场景

如果同一个应用内不同请求有不同需求,可以按请求切换变体——三个模型共享相同的 API 接口(system prompt、tool calling、image input、reasoning mode)。

生产注意事项

服务层级

Bedrock 提供三个 on-demand 层级,按请求指定 service_tier 参数切换(来源:AWS 官方公告,2026-06-15):

层级 适用场景
Standard 日常 AI 任务,标准按量计费
Priority 客户面向、实时 agent 等对延迟敏感的任务(OTPS 延迟比 Standard 提升最高 25%,来源:AWS 官方公告,2026-06-15)
Flex 模型评估、内容摘要、agent 类后台任务(折扣定价,延迟较高)

限流处理

bedrock-mantle 端点的限流按 token 配额算(输入 token/分钟、输出 token/分钟),不是 RPM。Gemma 这类开放模型目前没有公开的 per-account token quota,流量由内部服务容量控制。遇到 HTTP 429(token 配额超限)或 503(区域容量不足)时,建议用指数退避加抖动的重试策略(来源:AWS 官方公告,2026-06-15)。

OpenAI SDK 的 max_retries 参数可自动重试:

client = OpenAI(
    api_key="<your-short-term-bedrock-api-key>",
    base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1",
    max_retries=6,
)

流量增长

不要大幅突增请求率。AWS 推荐渐进式扩容:从目标请求率开始,遇到 503 就降 50%,稳定 15 分钟后再加 50%,重复到目标量(来源:AWS 官方公告,2026-06-15)。详细步骤见 AWS 官方文档的 Scaling on-demand inference 部分。

隐式 Prompt 缓存

Gemma 4 在 Bedrock 上自动启用隐式 prompt 缓存,不用改代码也不用加标记。缓存命中不保证每次都有,但在 prompt 前缀稳定的任务里更容易触发——多轮 agent、RAG 应用和长上下文分析都是典型场景(系统 prompt、工具定义、源文档在请求间复用)。建议把静态内容放在 prompt 前面、动态内容放后面,这样缓存命中概率最大。缓存命中的输入 token 不计入输入 token 配额(来源:AWS 官方公告,2026-06-15)。

清理

按需推理只在你调用时计费,没有基础设施需要销毁。短期 API key 到期自动失效(最长 12 小时),想提前撤销的话在 Bedrock 控制台删掉就行。测试完 Priority 层级后,去掉 service_tier 参数就能切回 Standard。详细定价见 Amazon Bedrock 定价页(来源:AWS 官方公告,2026-06-15)。

FAQ

Gemma 4 模型在 Bedrock 上和在 Google AI Studio 上有什么区别?

Gemma 4 是 Apache 2.0 开源模型,可以在多个平台上跑。在 Bedrock 上运行时,推理完全在 AWS 基础设施上完成,AWS 是数据处理方。你的提示和完成内容不会被拿来训练模型,也不会和第三方共享(来源:AWS 官方公告,2026-06-15)。

一定要用 Amazon Bedrock 才能运行 Gemma 4 吗?

不是。Gemma 4 是 Apache 2.0 开源模型,可以从 Hugging Face 下载权重自行部署。在 Bedrock 上运行的意义在于:无需管理推理基础设施,按 token 付费,自动获得 Standard/Priority/Flex 层级和 AWS 安全边界。

定价如何?

按 token 计费,具体价格因模型和 tier 而异。以 AWS Bedrock 定价页面为准。

函数调用支持哪些格式?

Gemma 4 的函数调用格式和 OpenAI SDK 的 tool calling 接口兼容。定义 tools 数组→模型返回 tool_call→执行函数→返回 tool 结果,完整流程见上文代码示例。

支持 GPTQ/AWQ 等量化格式吗?

AWS 官方公告未提及 Bedrock 上的量化部署选项。自行部署时社区有对应的量化工具支持。

有 fine-tuning 支持吗?

AWS 公告未宣布 Bedrock 上对 Gemma 4 的 fine-tuning 支持。如果需要在专用数据上微调,可以在 Bedrock 之外自行完成,再将微调后权重在自有基础设施上部署。

amazon-bedrockgoogle-deepmindgemma-4open-weight-modelbedrock-mantle