详细内容或原文请订阅后点击阅览
通过全球跨区域推理访问澳大利亚 Amazon Bedrock 上的 OpenAI 模型
澳大利亚团队现在可以访问 Amazon Bedrock 上的 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型,并通过亚太地区(悉尼)和亚太地区(墨尔本)进行全球跨区域推理。本文展示了如何调用模型、使用提示缓存、使用 OpenID Connect 身份验证设置 Codex 以及使用 Amazon CloudWatch 监控使用情况。
来源:亚马逊云科技 _机器学习使用 OpenAI 模型的澳大利亚团队现在可以通过 Amazon Bedrock 访问最新的 OpenAI 模型。 Amazon Bedrock 为 OpenAI GPT-5.6 Sol、Terra 和 Luna 提供来自澳大利亚亚太地区(悉尼)和亚太地区(墨尔本)AWS 区域的全球跨区域推理。您的应用程序调用亚太地区(悉尼)或亚太地区(墨尔本)的 Amazon Bedrock Runtime 终端节点,Amazon Bedrock 将请求路由到受支持的商业 AWS 区域进行处理。这提供了对更广泛容量池的访问,而不需要应用程序管理目标区域路由。 GPT-5.6 Sol 适合要求苛刻的推理、编码和代理工作负载。 Terra 平衡了日常生产使用的性能和成本。 Luna 为大容量和延迟敏感的应用程序提供快速、经济实惠的推理。所有三个模型都接受文本和图像输入、生成文本并支持最多 100 万个标记的上下文窗口。借助 Amazon Bedrock Runtime 终端节点,您可以通过亚太地区(悉尼)和亚太地区(墨尔本)的响应 API、聊天完成 API 以及 Converse API 调用这些模型。
在本文中,我们将向您展示如何使用提示缓存来优化推理成本、使用基于 OpenID Connect (OIDC) 的身份验证设置 Codex,以及如何使用 Amazon CloudWatch 和 Coding Agent Insights 监控使用情况。
GPT-5.6 全局推理配置文件
下表列出了本文涵盖的三个全球配置文件 ID 和澳大利亚源区域。
个人资料会员资格和型号可用性可能会发生变化。部署前检查跨区域推理支持。
开始使用
在继续本部分之前,您可以按照 GPT-5.6 博客文章设置以下先决条件:
在以下部分中,我们将向您展示如何使用 AWS 命令行界面 (AWS CLI) 和 Amazon Bedrock 控制台验证活动的全局推理配置文件。
使用 AWS CLI。以下命令列出活动的 GPT-5.6 配置文件并检查悉尼区域的 Terra 配置文件。您还可以通过更改推理配置文件 ID 将命令与 Sol 或 Luna 一起使用。要从墨尔本地区运行相同的检查,请将 ap-southeast-2 替换为 ap-southeast-4。
aws bedrock list-inference-profiles \
--region ap-southeast-2 \
--type-等于 SYSTEM_DEFINED \
--query "inferenceProfileSummaries[?contains(inferenceProfileId, 'openai.gpt-5.6')].[inferenceProfileId,status]" \
--输出表aws bedrock 获取推理配置文件 \--region ap-southeast-2 \--inference-profile-identifier global.openai.gpt-5.6-terra使用 Amazon Bedrock 控制台。打开 Amazon Bedrock 控制台,选择悉尼或墨尔本作为您的区域,然后选择 Infer 下的推理配置文件,然后筛选 Global OpenAI GPT-5.6 Terra。以下屏幕截图显示了悉尼源区域的活动配置文件。图 1:悉尼活跃的 GPT-5.6 Terra 全球推理剖面通过 Amazon Bedrock Runtime 调用 GPT-5.6对于流输出,设置stream=True 并迭代响应事件。以下示例在文本到达时打印文本:
GPT-5.6 支持 Amazon Bedrock Runtime 终端节点上的三种访问路径:OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。在此终端节点的/openai/v1 路径上调用与 OpenAI 兼容的 API,而不是通过 AWS 开发工具包。该终端节点接受 AWS 签名版本 4 (SigV4) 或 Amazon Bedrock 模型推理 API 密钥。以下示例使用适用于 Python 的 AWS Bedrock 令牌生成器根据当前 AWS 凭证创建短期 Amazon Bedrock 模型推理 API 密钥,因此应用程序不需要存储静态密钥。然后,您可以使用此短期 API 密钥创建 OpenAI 客户端,以使用支持的 API。
OpenAI 响应 API。对于已将 OpenAI SDK 与响应 API 结合使用的应用程序,您可以将客户端指向区域 Amazon Bedrock 运行时终端节点。
from aws_bedrock_token_generator import Provide_token
从 openai 导入 OpenAI
region = "ap-southeast-2" # 对于墨尔本使用 "ap-southeast-4"。
model_id =“global.openai.gpt-5.6-terra”
提示=(
“用三个简短的要点解释可用区的作用”
“帮助提高 AWS 应用程序的可用性。”
)openai_client = OpenAI(base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",api_key=provide_token(区域=区域),)响应结果 = openai_client.responses.create(型号=型号_id,输入=提示,最大输出令牌=300,)打印(responses_result.output_text)response_stream = openai_client.responses.create(型号=型号_id,输入=提示,最大输出令牌=300,流=真,)对于response_stream中的事件:如果 event.type == "response.output_text.delta":打印(event.delta,end =“”,flush = True)OpenAI 聊天完成 API。如果您的应用程序已使用聊天完成 API,您也可以使用该 API。from aws_bedrock_token_generator import Provide_token从 openai 导入 OpenAIregion = "ap-southeast-2" # 对于墨尔本使用 "ap-southeast-4"。model_id =“global.openai.gpt-5.6-terra”提示=(“用三个简短的要点解释可用区的作用”“帮助提高 AWS 应用程序的可用性。”)openai_client = OpenAI(base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",api_key=provide_token(区域=区域),)chat_result = openai_client.chat.completions.create(型号=型号_id,messages=[{"角色":"用户","内容":提示}],max_completion_tokens=300,Reasoning_effort=“低”,)打印(chat_result.choices[0].message.content)Amazon Bedrock Converse API。当您的应用程序通过 AWS 开发工具包调用 Amazon Bedrock 时,请使用 Converse API。 Boto3 通过标准 AWS 凭证链解析凭证。导入 boto3region = "ap-southeast-2" # 对于墨尔本使用 "ap-southeast-4"。model_id =“global.openai.gpt-5.6-terra”提示=(“用三个简短的要点解释可用区的作用”“帮助提高 AWS 应用程序的可用性。”)消息 = [{“角色”:“用户”,"内容": [{"文本": 提示}],}]bedrock_client = boto3.client("bedrock-runtime",region_name=region)converse_result = bedrock_client.converse(modelId=model_id,消息=消息,inferenceConfig={"maxTokens": 300},)print(converse_result["输出"]["消息"]["内容"][0]["文本"])对于流输出,请使用具有相同区域和配置文件 ID 的 converse_stream,然后迭代返回的事件流。前面的示例调用亚太地区(悉尼)的 Amazon Bedrock。要针对亚太地区(墨尔本)运行相同的示例,请将区域设置为 ap-southeast-4 并运行代码。配额管理
Stream_result = bedrock_client.converse_stream(
modelId=model_id,
消息=消息,
inferenceConfig={"maxTokens": 300},
)
对于stream_result[“stream”]中的事件:
如果事件中有“contentBlockDelta”:
增量 = 事件["contentBlockDelta"]["增量"]
如果“文本”在增量中:
打印(增量[“文本”],结束=“”,刷新= True)
打印()
使用提示缓存
GPT-5.6 提示缓存可通过支持的 API 获得。 GPT-5.6 在 Amazon Bedrock 上支持两种缓存模式。默认情况下启用隐式缓存,无需更改代码,而使用显式缓存,您可以定义可重用的前缀、缓存边界和缓存键。GPT-5.6 博客文章提供了说明提示缓存功能的示例。在 Amazon Bedrock 上使用 GPT-5.6 设置 CodexCodex 可以通过 Amazon Bedrock Runtime 使用相同的全局推理配置文件。安装最新的 Codex CLI 以使用本机 Amazon Bedrock 运行时模型提供程序。在这里,我们使用来自亚太地区(悉尼)的 GPT-5.6 Sol 通过 codex-cli 0.149.1 验证了以下配置。npm install -g @openai/codex@alpha法典--版本对于身份提供商为 Okta、Auth0、Microsoft Entra ID、Amazon Cognito 或 AWS IAM Identity Center 的组织,AWS OIDC Auth Helper 存储库提供了示例凭证帮助程序。首先,按照指南配置您的身份提供商、相应的 AWS 联合资源以及带有前面所示的 Amazon Bedrock 权限的 IAM 角色。然后将命名配置文件添加到~/.aws/config,以便帮助程序不会替换默认配置文件解析的凭证。将占位符替换为已安装帮助程序的路径以及~/.aws/config 文件中定义的配置文件名称。[配置文件 ]credential_process = --profile区域 = ap-东南-2输出=json此联合帮助程序将 OIDC 令牌交换为临时 AWS 凭证,Codex 会读取标准 AWS 凭证链,无需进一步配置。接下来,创建或更新 ~/.codex/config.toml 并引用 AWS 配置文件,有关其他支持的设置,请参阅 Codex 配置参考:模型 = "global.openai.gpt-5.6-sol"model_provider =“亚马逊基岩运行时”model_reasoning_effort = "高"[model_providers.amazon-bedrock-runtime.aws]配置文件=“”区域 =“ap-southeast-2”如果帮助程序没有有效的缓存会话,它将在浏览器中打开配置的登录页面。进行身份验证后,帮助程序会通过 credential_process 返回临时 AWS 凭证。请求使用 AWS SigV4 进行签名,因此推理路径中不涉及 API 密钥。当配置文件由 AWS IAM Identity Center 支持时,凭证已经是短期的,并随着单点登录会话轮换。要将此功能用于亚太地区(墨尔本)区域,请在 AWS 配置文件和 Codex 配置中将该区域设置为 ap-southeast-4。监控和日志记录由于 GPT-5.6 请求使用 Amazon Bedrock Runtime API,因此通过全局推理配置文件发出的请求会像其他按需请求一样出现在模型调用日志记录中。启用日志记录后,记录包括用于调用和调用元数据的模型或推理配置文件 ID。 Codex 使用 OpenTelemetry (OTel) 并通过 OTLP/HTTP 导出指标,有关更多详细信息,请参阅为 OpenAI Codex 设置 OpenTelemetry。以下示例显示如何使用承载方法配置 Coding Agent Insights for Codex。首先,获取 CloudWatch 指标 API 密钥,然后将以下部分添加到 ~/.codex/config.toml。
GPT-5.6 按需配额以每分钟请求数 (RPM) 和每分钟令牌数 (TPM) 来衡量。令牌燃尽确定每个请求如何消耗 TPM。令牌消耗是根据输入令牌、缓存写入输入令牌和输出令牌乘以模型的燃尽率来计算的。例如,对于 GPT-5.6,输入令牌和缓存写入输入令牌按 1:1 计数,而每个输出令牌消耗配额中的 10 个令牌。从应用程序使用的源区域的服务配额控制台中查看 GPT-5.6 配额:亚太地区(悉尼)区域 (ap-southeast-2) 或亚太地区(墨尔本)区域 (ap-southeast-4)。在生产部署之前,请尽早增加请求,监视配额利用率,并测试代表提示、输出长度、流行为、并发性和峰值流量。请参阅 Amazon Bedrock 配额以了解当前值和代币燃尽率。
CloudWatch Coding Agent Insights 提供用于 Codex 遥测的仪表板,包括令牌使用情况、API 请求、活跃用户、对话活动和可选的组织维度。在 CloudWatch for Codex 中配置 Coding Agent Insights 有两种途径,即使用 Bearer 令牌或 Enterprise rollout。
[酒店]
环境=“生产”
[otel.metrics_exporter]
otlp-http = { 端点 = "https://monitoring.ap-southeast-2.amazonaws.com/v1/metrics", 协议 = "二进制", headers = { "授权" = "承载 YOUR_CLOUDWATCH_METRICS_API_KEY" } }
将 YOUR_CLOUDWATCH_METRICS_API_KEY 替换为在 CloudWatch 中创建的密钥,然后启动 Codex。然后,此 CloudWatch 指标 API 密钥可以授权导出到区域 CloudWatch 终端节点。遥测数据到达后,打开亚太地区(悉尼)区域的 CloudWatch 控制台,选择 GenAI Observability、Coding Agent Insights 和 Codex 选项卡。您将看到 Coding Agent Insights 仪表板显示 Codex 令牌使用情况、请求活动、缓存命中率等。
图 2:亚太地区(悉尼)CloudWatch Coding Agent Insights 中的 Codex 令牌和请求活动
要填充组织、环境、部门、成本中心、位置、团队和用户过滤器,请通过 OTEL_RESOURCE_ATTRIBUTES 提供相应的值。 AWS 将该 CloudWatch 指标 API 密钥归类为长期凭证,并仅在短期 AWS 凭证不可行时才建议使用它。将 config.toml 视为机密并限制其文件权限。
对于通过企业单点登录联合开发人员身份的组织,我们建议使用企业部署,其中本地收集器使用开发人员的联合凭证通过 SigV4 签署导出,并且不分发任何令牌。
结论
在这篇文章中,我们展示了如何发现和调用来自亚太地区(悉尼)和亚太地区(墨尔本)的 GPT-5.6 Sol、Terra 和 Luna 全局推理配置文件。我们还介绍了如何配置 Codex 以使用 Amazon Bedrock Runtime 并将 Codex 遥测数据导出到 CloudWatch Coding Agent Insights。
首先,请按照本文中的示例操作并在您的帐户中测试 GPT-5.6 模型。如果您使用 Codex,您可以配置 Amazon Bedrock Runtime 提供商并在 AWS 控制台中启用 CloudWatch Coding Agent Insights 以监控您的 Codex 消耗。有关定价详细信息,请参阅 Amazon Bedrock 定价。
关于作者
弗兰克·黄张三李梅兰妮佐赫雷·诺鲁兹索拉布·特里坎德
Frank Huang 博士是位于新西兰奥克兰的 AWS 的高级 AI/ML 专家解决方案架构师。他专注于帮助客户提供 AI/ML 解决方案。在他的整个职业生涯中,Frank 曾在金融服务、Web3、酒店、媒体和娱乐以及电信等多个行业工作过。 Frank 渴望利用他在云架构、AIOps 和端到端解决方案交付方面的深厚专业知识,帮助客户借助数据和人工智能的力量实现切实的业务成果。
Sam Zhang 是位于澳大利亚悉尼的 AWS 安全专家技术客户经理。他与企业合作开展基础设施安全、身份和访问管理以及威胁检测,帮助他们构建安全的云基础设施和工作负载。他最近的重点是生成人工智能工作负载的安全性。
Melanie Li 博士是位于澳大利亚悉尼的 AWS 的高级生成式 AI 专家解决方案架构师,她的重点是与客户合作,使用最先进的 AI/ML 工具构建解决方案。她利用法学硕士的力量,积极参与亚太及日本地区的多项生成式人工智能计划。在加入 AWS 之前,李博士曾在金融和零售行业担任数据科学职务。
Zohreh 是 Amazon Web Services (AWS) 的高级安全解决方案架构师。她帮助客户做出良好的安全选择并加速他们的 AWS 云之旅。她一直积极参与人工智能安全计划,利用自己的专业知识帮助客户大规模构建安全的人工智能解决方案。
Saurabh Trikande 是 Amazon Bedrock 和 Amazon SageMaker Inference 的高级产品经理。在人工智能民主化目标的推动下,他热衷于与客户和合作伙伴合作。他重点关注与部署复杂人工智能应用程序、多租户模型推理、成本优化以及使生成式人工智能模型的部署更容易相关的核心挑战。在业余时间,Saurabh 喜欢徒步旅行、学习创新技术、关注 TechCrunch 以及与家人共度时光。
