
Amazon Bedrock の GPT-6.1 Sol が サポートした Ultrafast mode を試してみた
はじめに
2026年10月8日、Amazon Bedrock の GPT-6.1 Sol が Ultrafast mode をサポートしました。
本記事では、OpenAI SDK から ultrafast を指定して GPT-6.1 Sol を呼び出し、結果と証跡を確認します。
Ultrafast mode とは
GPT-6 Astra では 2026年9月30日に先行して提供されていた、低レイテンシ向けのサービスティアです。
モデルカードには、単価が Standard の 6 倍と記載されています。
Ultrafast costs six times as much as Standard.
Global CRIS(bedrock-runtime)で、入力が 272K トークン以下の場合の単価です。単位は USD / 100 万トークンです。
| Standard | Ultrafast | |
|---|---|---|
| 入力 | 2.00 | 12.00 |
| 出力 | 10.00 | 60.00 |
利用方法
Ultrafast は、Bedrock の Responses API(/openai/v1/responses)で service_tier に ultrafast を指定して利用します。呼び出し手段は、OpenAI SDK を使うか、自前で SigV4 署名した HTTP リクエストを送るかのどちらかです。本記事では OpenAI SDK で利用します。
OpenAI SDK で呼び出す
OpenAI SDK(Python)で、Global CRIS の Responses API を呼び出します。認証は aws-bedrock-token-generator で一時クレデンシャルから短期トークンを作り、API キーとして渡します。Ultrafast の指定は responses.create の引数に service_tier="ultrafast" を加えるだけです。
実行環境は Python 3.12.15、openai 3.26.1、aws-bedrock-token-generator 1.1.0 です。
"""GPT-6.1 Sol を Bedrock (bedrock-runtime, Global CRIS) の Responses API で 1 回呼ぶ。
使い方: python call_sol.py <default|ultrafast>
"""
import sys
import time
from datetime import timedelta
from aws_bedrock_token_generator import provide_token
from openai import OpenAI
REGION = "us-east-1"
MODEL = "global.openai.gpt-6.1-sol"
PROMPT = "Amazon Bedrock を 20 文字以内で説明してください。"
MAX_OUTPUT_TOKENS = 300
tier = sys.argv[1]
assert tier in ("default", "ultrafast")
token = provide_token(region=REGION, expiry=timedelta(minutes=15))
client = OpenAI(
api_key=token,
base_url=f"https://bedrock-runtime.{REGION}.amazonaws.com/openai/v1",
)
kwargs = dict(model=MODEL, input=PROMPT, max_output_tokens=MAX_OUTPUT_TOKENS)
if tier == "ultrafast":
kwargs["service_tier"] = "ultrafast"
t0 = time.perf_counter()
resp = client.responses.create(**kwargs)
print(f"elapsed_s={time.perf_counter() - t0:.3f}")
print(resp.model_dump_json(indent=2))
python call_sol.py ultrafast
結果
同じプロンプトを、service_tier なしと ultrafast で 1 回ずつ実行しました。reasoning effort は未指定(応答では medium)です。
| 指定 | 応答の service_tier | 所要時間 | 入力トークン | 出力トークン(うち reasoning) | 出力テキスト |
|---|---|---|---|---|---|
| なし | default | 3.018 秒 | 19 | 117(104) | AWSの生成AI基盤サービス |
| ultrafast | ultrafast | 1.710 秒 | 19 | 197(183) | 生成AIモデルを使えるAWSサービス |
所要時間は非ストリーミングで応答全文が返るまでの時間を time.perf_counter() で測ったもので、各 1 回の値です。
応答 JSON の抜粋です。service_tier に ultrafast が返っています。
{
"model": "global.openai.gpt-6.1-sol",
"service_tier": "ultrafast",
"status": "completed",
"reasoning": {
"effort": "medium"
},
"usage": {
"input_tokens": 19,
"output_tokens": 197,
"output_tokens_details": {
"reasoning_tokens": 183
},
"total_tokens": 216
}
}
CloudTrail での記録
Responses API の呼び出しは、CloudTrail の管理イベント(eventName: Responses)として記録されます。ultrafast を指定した呼び出しは、additionalEventData の serviceTier に ultrafast が入ります。指定しなかった呼び出しには serviceTier 自体がありません。
{
"eventTime": "2026-10-09T06:05:27Z",
"eventSource": "bedrock.amazonaws.com",
"eventName": "Responses",
"awsRegion": "us-east-1",
"userAgent": "OpenAI/Python 3.26.1",
"requestParameters": {
"modelId": "global.openai.gpt-6.1-sol"
},
"additionalEventData": {
"callWithBearerToken": true,
"stream": false,
"inferenceRegion": "us-east-1",
"serviceTier": "ultrafast",
"inputTokens": 19,
"outputTokens": 197
}
}
まとめ
Amazon Bedrock の GPT-6.1 Sol は、10月1日の前記事の時点では ultrafast のサービスティアを利用できませんでしたが、今回、OpenAI SDK から Responses API で利用できることを確認できました。
計測は 1 回ずつで、Sol を必要としないような単純な質問ですが、所要時間は default の 3.0 秒に対して ultrafast は 1.7 秒となり、短縮を確認できました。
処理時間が長くなりやすいタスクで、Bedrock の Sol から少しでも早く応答を得る必要があり、Standard の 6 倍となるトークン単価を許容できる場合には、今回サポートされた ultrafast を試してみてください。










