{"duration_api_ms":2142,"stop_reason":"end_turn","session_id":"cb5bd98a-ef61-429a-92ff-94d414f9baab","total_cost_usd":0.0020774,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2647,"output_tokens":38,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":38,"cache_read_input_tokens":2647,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1074,"outputTokens":18,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001164,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":38,"cacheReadInputTokens":2647,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0009134000000000001,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWS、Bedrock上のOpenAIモデルを比較するオープンソースベンチマークを公開","ttft_ms":1607,"type":"result","duration_ms":1639,"uuid":"3df90be3-9290-4b39-a22b-e9812c0f651f","ttft_stream_ms":1035,"time_to_request_ms":402,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
AWSは、Amazon Bedrock上のOpenAIモデルをOpenAI API単体の場合と比較し、コスト、エージェントのやり取り回数、成果物の品質を評価するオープンソースのベンチマークハーネスとブログ記事を公開した。
ひとことで言うと
{"duration_api_ms":1988,"stop_reason":"end_turn","session_id":"3bcd9102-f397-431c-9947-f4c57d5d910a","total_cost_usd":0.007965400000000001,"usage":{"input_tokens":2,"cache_creation_input_tokens":1543,"cache_read_input_tokens":1097,"output_tokens":41,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":1543,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":41,"cache_read_input_tokens":1097,"cache_creation_input_tokens":1543,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":1543},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1070,"outputTokens":18,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.00116,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":41,"cacheReadInputTokens":1097,"cacheCreationInputTokens":1543,"webSearchRequests":0,"costUSD":0.0068054000000000005,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWSは、Amazon Bedrock上でOpenAIのモデルを比較することについて何を発表したのか。","ttft_ms":1599,"type":"result","duration_ms":1631,"uuid":"63dd1e52-c9cc-4be0-9ab5-d30b7566564c","ttft_stream_ms":1008,"time_to_request_ms":410,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
AWSはブログ記事を公開し、ベンチマーク用ハーネス「openai-on-aws/benchmarks-openai」をオープンソースとして公開した。これはAmazon Bedrock上で提供される3種類のOpenAIモデルを、OpenAI API版の2種類のベースラインモデルと比較するもので、トークン単価だけでなく、正答あたりのコスト、マルチターンエージェントの運用コスト、ルーブリックによって採点された実務レベルの成果物の質を評価軸としている。
要点
- {"duration_api_ms":3058,"stop_reason":"end_turn","session_id":"492ae17e-28ee-4810-9706-057579e6f764","total_cost_usd":0.0086974,"usage":{"input_tokens":2,"cache_creation_input_tokens":1586,"cache_read_input_tokens":1097,"output_tokens":97,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":1586,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":97,"cache_read_input_tokens":1097,"cache_creation_input_tokens":1586,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":1586},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1105,"outputTokens":11,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.00116,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":97,"cacheReadInputTokens":1097,"cacheCreationInputTokens":1586,"webSearchRequests":0,"costUSD":0.0075374,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWSは、Amazon Bedrock上のモデルとOpenAI APIのモデルに対して、同一のOpenAI Responses APIコードパスを実行するベンチマーク用ハーネス「openai-on-aws/benchmarks-openai」をオープンソース化した。","ttft_ms":2224,"type":"result","duration_ms":2256,"uuid":"ebc49822-3218-4832-bafd-0f34cad981ad","ttft_stream_ms":1327,"time_to_request_ms":130,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- このテストハーネスは、Amazon Bedrock上で提供される3種のOpenAIモデル(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)を、コスト効率に優れた2種のOpenAI API向けモデル(gpt-5.4-mini、gpt-5.4-nano)と比較評価している。AWSはこれらを、同世代の直接的な対抗モデルではなく、一般的なコスト最適化のベースラインと位置づけている。
- AWSによると、この評価では単価トークン当たりの価格比較だけに頼るのではなく、正答1件当たりのコスト、複数ターンにわたるエージェントの処理過程にかかるコスト、そして採点基準に基づいて評価される専門的な成果物への対応力を重視しているという。
- AWSによると、Amazon Bedrock上のモデルは推論機能を無効にした状態で実行された一方、OpenAIのAPIモデルはデフォルト設定のまま実行されたという。同社はこの結果について、モデル本来の能力を測る統制された指標ではなく、実際の運用時の設定を反映したものだと説明している。
- このハーネスでの採点は、決定論的なチェックと、固定プロンプトを用いたLLM審査モデルgpt-5.5を組み合わせたものであり、AWSの報告によれば、各ベンチマークのサンプルサイズは48件から198件の範囲に及ぶという。
AWSは公式AI関連ブログで、Amazon Bedrock上で利用できるOpenAIモデルと、OpenAI APIを直接経由して利用するOpenAIモデルとを比較するためのオープンソース製ベンチマークハーネスについて解説する記事を公開した。この記事はAWSのNick McCarthy氏、Sharadha Kandasubramanian氏、Sudeesh Sasidharan氏、Saurabh Trikande氏の連名によるものである。
AWSによれば、組織が一般的にモデルを比較する際に用いるのは「100万トークンあたりのドル単価」であり、これはどの料金ページにも必ず載っている数字だという。しかし同記事は、この数字だけでは実際のコストを左右する要因を見落とすと指摘する。モデルがどれだけの頻度で正解を出すか、そこに至るまでに何トークンを消費するか、さらにエージェント型ワークロードにおいては、対話の履歴がターンを重ねるごとに膨らみ、毎回送り直されることを踏まえた上で、何ターンを要するかといった要因である。
ハーネスと検証対象モデル
AWSは、openai-on-aws/benchmarks-openaiとして公開したハーネスを構築・オープンソース化したとしている。これはOpenAI Responses APIという単一の共通コードパスを用い、バックエンドとモデルIDを切り替えるだけで評価ロジックは変えずに、Amazon BedrockとOpenAI APIの双方に対して実行できるものだ。
同記事によれば、このハーネスは以下の5モデルを評価対象としている。
- Amazon Bedrock上のOpenAIモデル3種:gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol
- OpenAI APIのモデル2種:gpt-5.4-mini、gpt-5.4-nano
AWSは、OpenAI API側の2モデルを、多くのチームがすでに利用しているコスト最適化型のベースラインと位置づけており、Bedrock側のモデルと世代的に対応する存在としては扱っていない。この比較の狙いは、miniやnanoから、より新しいBedrock上のモデルへ移行する価値があるかどうかを検証することにあるという。
評価が対象とする範囲
AWSによれば、このハーネスは3つの問いに答えるよう設計されている。トークン単価ではなく正解1件あたりのコストはいくらか、ターン数が請求額を左右しかねないマルチターン型エージェントの一連のやり取りにはどれだけのコストがかかるか、そして、クイズ形式の設問ではなく実際の職務成果物を用いた検証において、プロフェッショナルが受け入れる水準の成果物をモデルが生成できるか、という3点である。
AWSによれば、この評価ではAIME数学コンペティション、大学院レベルの科学知識を問うGPQA Diamond、MMLU-Proにおける単発呼び出しの精度とコストを測定するとともに、実際のウェブリサーチタスクにおけるマルチターン型エージェントの挙動や、ルーブリックで採点される職務成果物についても評価する。採点は決定論的なチェックと、LLM審査役であるgpt-5.5との組み合わせによって行われる。なお、AWSはgpt-5.5自体は評価対象モデルには含まれないと注記している。使用されるプロンプトは固定されており、そのハッシュ値は各結果ファイルに記録される。
AWSによれば、ハーネスを実行するたびにタイムスタンプ付きのJSON形式の結果ファイルが出力され、記事中のすべての数値とグラフはビルド時点でこれらのファイルから生成されたものだという。提供された元資料には、ハーネスが算出した具体的な精度、コスト、ベンチマーク結果の数値は含まれていない。
出典:AWS Machine Learning Blog、「Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload」、2026年9月11日公開。
よくある質問
- {"duration_api_ms":2517,"stop_reason":"end_turn","session_id":"242e0515-3e01-426a-868d-572a46df740f","total_cost_usd":0.0018942,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2631,"output_tokens":24,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":24,"cache_read_input_tokens":2631,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1069,"outputTokens":11,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001124,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":24,"cacheReadInputTokens":2631,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0007702,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"openai-on-aws/benchmarks-openaiとは何か。","ttft_ms":1853,"type":"result","duration_ms":1882,"uuid":"dae04b4e-6aaa-4d91-b441-21b3f01243e1","ttft_stream_ms":1483,"time_to_request_ms":123,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- これは、AWSによれば、Amazon Bedrock上でホストされるOpenAIモデルとOpenAI APIに対して同一のOpenAI Responses APIコードパスを実行するオープンソースのベンチマーク用ハーネスであり、ユーザーは自身のワークロードでこの比較を再現できる。
- {"duration_api_ms":2220,"stop_reason":"end_turn","session_id":"f4f336cb-7943-4741-b02b-a2911554d396","total_cost_usd":0.0019513999999999998,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2627,"output_tokens":30,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":30,"cache_read_input_tokens":2627,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1062,"outputTokens":12,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001122,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":30,"cacheReadInputTokens":2627,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0008294,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWSのベンチマークでは、どのモデルが比較対象となっていますか?","ttft_ms":1724,"type":"result","duration_ms":1756,"uuid":"701333dc-4614-4cc5-8a91-76b82e380d85","ttft_stream_ms":1155,"time_to_request_ms":486,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- AWSは、Amazon Bedrock上の3種類のOpenAIモデル——gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol——を、広く使われているコスト効率重視の基準モデルと位置付ける2種類のOpenAI APIモデル、gpt-5.4-miniおよびgpt-5.4-nanoと比較している。
- {"duration_api_ms":2692,"stop_reason":"end_turn","session_id":"7e1ad821-db3a-43ab-ba95-0284d4bbe56a","total_cost_usd":0.0019144,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2627,"output_tokens":26,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":26,"cache_read_input_tokens":2627,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1065,"outputTokens":12,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001125,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":26,"cacheReadInputTokens":2627,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0007894,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWSはトークン単価以外に何を測定していると述べているのか。","ttft_ms":2099,"type":"result","duration_ms":2128,"uuid":"b803d712-5323-4b49-be8a-307a40819a4f","ttft_stream_ms":1511,"time_to_request_ms":395,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- AWSによると、AIME、GPQA Diamond、MMLU-Proなどのベンチマークにおける正答1件あたりのコスト、実際のウェブ調査タスクにおける複数ターンのエージェント動作履歴にかかるコスト、そしてルーブリックで採点される専門的な成果物における性能を測定しているという。
- {"duration_api_ms":2153,"stop_reason":"end_turn","session_id":"918d4ab3-2ffc-481c-8bf8-811424721eae","total_cost_usd":0.0077964,"usage":{"input_tokens":2,"cache_creation_input_tokens":1531,"cache_read_input_tokens":1097,"output_tokens":30,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":1531,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":30,"cache_read_input_tokens":1097,"cache_creation_input_tokens":1531,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":1531},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1064,"outputTokens":17,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001149,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":30,"cacheReadInputTokens":1097,"cacheCreationInputTokens":1531,"webSearchRequests":0,"costUSD":0.0066474,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWSは比較対象のモデルを同一条件下で実行したのだろうか。","ttft_ms":1367,"type":"result","duration_ms":1397,"uuid":"646d6ddf-70ef-4d12-944d-687c04cfc880","ttft_stream_ms":752,"time_to_request_ms":154,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- いいえ。AWSによれば、Amazon Bedrockのモデルは推論機能を無効にした状態で稼働したのに対し、OpenAI APIの比較対象モデルはデフォルト設定のまま稼働したという。同社はこの比較について、モデル本来の性能を測る管理された試験ではなく、実際の運用構成を反映したものだと説明している。