Amazon Bedrock の GPT-6.1 Sol が サポートした Ultrafast mode を試してみた

Amazon Bedrock の GPT-6.1 Sol が サポートした Ultrafast mode を試してみた

Standard の 6 倍の単価で GPT モデルを低レイテンシで利用できる Ultrafast mode が、Amazon Bedrock の GPT-6.1 Sol でも利用可能になりました。OpenAI SDK から Responses API の service_tier に ultrafast を指定して呼び出し、応答が得られることを確認しました。
2026.10.09

はじめに

2026年10月8日、Amazon Bedrock の GPT-6.1 Sol が Ultrafast mode をサポートしました。

https://aws.amazon.com/about-aws/whats-new/2026/10/openai-gpt-sol-ultrafast-amazon/

本記事では、OpenAI SDK から ultrafast を指定して GPT-6.1 Sol を呼び出し、結果と証跡を確認します。

Ultrafast mode とは

GPT-6 Astra では 2026年9月30日に先行して提供されていた、低レイテンシ向けのサービスティアです。

https://aws.amazon.com/about-aws/whats-new/2026/09/openai-gpt-6-astra-ultrafast-on-amazon-bedrock/

モデルカードには、単価が Standard の 6 倍と記載されています。

https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-openai-gpt-6-1-sol.html

Ultrafast costs six times as much as Standard.

Global CRIS(bedrock-runtime)で、入力が 272K トークン以下の場合の単価です。単位は USD / 100 万トークンです。

Standard Ultrafast
入力 2.00 12.00
出力 10.00 60.00

利用方法

Ultrafast は、Bedrock の Responses API(/openai/v1/responses)で service_tier に ultrafast を指定して利用します。呼び出し手段は、OpenAI SDK を使うか、自前で SigV4 署名した HTTP リクエストを送るかのどちらかです。本記事では OpenAI SDK で利用します。

OpenAI SDK で呼び出す

OpenAI SDK(Python)で、Global CRIS の Responses API を呼び出します。認証は aws-bedrock-token-generator で一時クレデンシャルから短期トークンを作り、API キーとして渡します。Ultrafast の指定は responses.create の引数に service_tier="ultrafast" を加えるだけです。

実行環境は Python 3.12.15、openai 3.26.1、aws-bedrock-token-generator 1.1.0 です。

"""GPT-6.1 Sol を Bedrock (bedrock-runtime, Global CRIS) の Responses API で 1 回呼ぶ。

使い方: python call_sol.py <default|ultrafast>
"""
import sys
import time
from datetime import timedelta

from aws_bedrock_token_generator import provide_token
from openai import OpenAI

REGION = "us-east-1"
MODEL = "global.openai.gpt-6.1-sol"
PROMPT = "Amazon Bedrock を 20 文字以内で説明してください。"
MAX_OUTPUT_TOKENS = 300

tier = sys.argv[1]
assert tier in ("default", "ultrafast")

token = provide_token(region=REGION, expiry=timedelta(minutes=15))
client = OpenAI(
    api_key=token,
    base_url=f"https://bedrock-runtime.{REGION}.amazonaws.com/openai/v1",
)

kwargs = dict(model=MODEL, input=PROMPT, max_output_tokens=MAX_OUTPUT_TOKENS)
if tier == "ultrafast":
    kwargs["service_tier"] = "ultrafast"

t0 = time.perf_counter()
resp = client.responses.create(**kwargs)
print(f"elapsed_s={time.perf_counter() - t0:.3f}")
print(resp.model_dump_json(indent=2))
python call_sol.py ultrafast

結果

同じプロンプトを、service_tier なしと ultrafast で 1 回ずつ実行しました。reasoning effort は未指定(応答では medium)です。

指定 応答の service_tier 所要時間 入力トークン 出力トークン(うち reasoning) 出力テキスト
なし default 3.018 秒 19 117(104) AWSの生成AI基盤サービス
ultrafast ultrafast 1.710 秒 19 197(183) 生成AIモデルを使えるAWSサービス

所要時間は非ストリーミングで応答全文が返るまでの時間を time.perf_counter() で測ったもので、各 1 回の値です。
応答 JSON の抜粋です。service_tier に ultrafast が返っています。

{
  "model": "global.openai.gpt-6.1-sol",
  "service_tier": "ultrafast",
  "status": "completed",
  "reasoning": {
    "effort": "medium"
  },
  "usage": {
    "input_tokens": 19,
    "output_tokens": 197,
    "output_tokens_details": {
      "reasoning_tokens": 183
    },
    "total_tokens": 216
  }
}

CloudTrail での記録

Responses API の呼び出しは、CloudTrail の管理イベント(eventName: Responses)として記録されます。ultrafast を指定した呼び出しは、additionalEventData の serviceTier に ultrafast が入ります。指定しなかった呼び出しには serviceTier 自体がありません。

{
  "eventTime": "2026-10-09T06:05:27Z",
  "eventSource": "bedrock.amazonaws.com",
  "eventName": "Responses",
  "awsRegion": "us-east-1",
  "userAgent": "OpenAI/Python 3.26.1",
  "requestParameters": {
    "modelId": "global.openai.gpt-6.1-sol"
  },
  "additionalEventData": {
    "callWithBearerToken": true,
    "stream": false,
    "inferenceRegion": "us-east-1",
    "serviceTier": "ultrafast",
    "inputTokens": 19,
    "outputTokens": 197
  }
}

まとめ

Amazon Bedrock の GPT-6.1 Sol は、10月1日の前記事の時点では ultrafast のサービスティアを利用できませんでしたが、今回、OpenAI SDK から Responses API で利用できることを確認できました。

https://dev.classmethod.jp/articles/bedrock-openai-gpt61-sol/

計測は 1 回ずつで、Sol を必要としないような単純な質問ですが、所要時間は default の 3.0 秒に対して ultrafast は 1.7 秒となり、短縮を確認できました。

処理時間が長くなりやすいタスクで、Bedrock の Sol から少しでも早く応答を得る必要があり、Standard の 6 倍となるトークン単価を許容できる場合には、今回サポートされた ultrafast を試してみてください。


AI白書2026 配布中

クラスメソッドが独自に行なったAI診断調査をもとに、企業のAI活用の現在地を調査レポートとしてまとめました。企業規模別の活用度傾向に加え、規模を超えてAI活用を進める企業に共通する取り組みまで、自社の現在地を捉えるためのヒントにぜひ。

AI白書2026

無料でダウンロードする

この記事をシェアする

AWSのお困り事はクラスメソッドへ

関連記事