{"duration_api_ms":2196,"stop_reason":"end_turn","session_id":"6d540061-5560-4f33-9302-f6c365e26755","total_cost_usd":0.0021018,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2644,"output_tokens":40,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":40,"cache_read_input_tokens":2644,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1074,"outputTokens":19,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0011690000000000001,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":40,"cacheReadInputTokens":2644,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0009328000000000001,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"AWS publica un banco de pruebas de código abierto para comparar los modelos de OpenAI en Bedrock","ttft_ms":1618,"type":"result","duration_ms":1670,"uuid":"3dda4bee-6844-48bc-8607-3afc31c6b61d","ttft_stream_ms":990,"time_to_request_ms":382,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
AWS publicó un marco de pruebas comparativas de código abierto y una entrada de blog que evalúa modelos de OpenAI en Amazon Bedrock frente a modelos base de la API de OpenAI en cuanto a costo, turnos de agente y calidad de los entregables.
Respuesta rápida
{"duration_api_ms":2220,"stop_reason":"end_turn","session_id":"5d39ccf7-080a-488e-a843-a9e81df4ef02","total_cost_usd":0.0021014,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2637,"output_tokens":41,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":41,"cache_read_input_tokens":2637,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1070,"outputTokens":18,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.00116,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":41,"cacheReadInputTokens":2637,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0009414,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"¿Qué anunció AWS sobre la comparación de modelos de OpenAI en Amazon Bedrock?","ttft_ms":2005,"type":"result","duration_ms":2044,"uuid":"c718a4ee-7ff5-4b10-9481-4aa962d0388d","ttft_stream_ms":1485,"time_to_request_ms":815,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
AWS publicó una entrada de blog y liberó como código abierto un marco de pruebas comparativas, openai-on-aws/benchmarks-openai, que compara tres modelos de OpenAI en Amazon Bedrock con dos modelos base de la API de OpenAI en cuanto a costo por respuesta correcta, costos de agentes en interacciones de varios turnos y entregables profesionales evaluados mediante rúbricas, en lugar de basarse únicamente en el precio por token.
Claves
- AWS liberó como código abierto un marco de pruebas comparativas llamado openai-on-aws/benchmarks-openai que ejecuta la misma ruta de código de la API Responses de OpenAI tanto en modelos alojados en Amazon Bedrock como en la API de OpenAI.
- El conjunto de pruebas evalúa tres modelos de OpenAI en Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) frente a dos modelos de la API de OpenAI orientados a la eficiencia de costos (gpt-5.4-mini, gpt-5.4-nano), que AWS describe como referencias habituales optimizadas por costo y no como equivalentes directos de la misma generación.
- AWS afirma que la evaluación analiza el costo por respuesta correcta, el costo de las trayectorias de agentes en interacciones de varios turnos y el desempeño en entregables profesionales evaluados mediante rúbricas, en lugar de basarse únicamente en comparaciones de precio por token.
- AWS afirma que los modelos de Amazon Bedrock se ejecutaron con el razonamiento desactivado, mientras que los modelos de la API de OpenAI funcionaron con la configuración predeterminada, y describe los resultados como un reflejo de configuraciones de implementación prácticas, y no como una medida controlada de la capacidad intrínseca del modelo.
- La calificación dentro del marco combina verificaciones deterministas con un modelo juez basado en LLM, gpt-5.5, utilizando indicaciones fijas, y AWS reporta tamaños de muestra de entre 48 y 198 elementos por prueba.
AWS publicó un artículo en su blog de Inteligencia Artificial en el que describe un marco de referencia de código abierto para comparar modelos de OpenAI disponibles en Amazon Bedrock con modelos de OpenAI a los que se accede directamente a través de la API de OpenAI. El artículo está firmado por los autores de AWS Nick McCarthy, Sharadha Kandasubramanian, Sudeesh Sasidharan y Saurabh Trikande.
AWS señala que las organizaciones suelen comparar modelos usando dólares por millón de tokens, una cifra que la empresa describe como el dato que aparece en todas las páginas de precios. Según el artículo, esa cifra pasa por alto factores que inciden en el costo real: con qué frecuencia un modelo produce una respuesta correcta, cuántos tokens consume para llegar a ella y, en el caso de las cargas de trabajo agénticas, cuántos turnos de conversación requiere, dado que en cada turno se reenvía el historial de la conversación, cada vez más extenso.
El marco de referencia y los modelos evaluados
AWS afirma haber creado y publicado como código abierto un marco de referencia, disponible en openai-on-aws/benchmarks-openai, que ejecuta una única ruta de código idéntica, la Responses API de OpenAI, tanto en Amazon Bedrock como en la API de OpenAI, alternando el backend y el identificador del modelo mientras se mantiene constante la lógica de evaluación.
El artículo indica que el marco de referencia evalúa cinco modelos:
- Tres modelos de OpenAI en Amazon Bedrock: gpt-5.6-luna, gpt-5.6-terra y gpt-5.6-sol
- Dos modelos de la API de OpenAI: gpt-5.4-mini y gpt-5.4-nano
AWS describe los dos modelos de la API de OpenAI como referencias optimizadas en costo que muchos equipos ya utilizan, y no como equivalentes generacionales directos de los modelos de Bedrock, planteando la comparación en torno a si vale la pena migrar de mini o nano a un modelo más reciente de Bedrock.
Qué abarca la evaluación
Según AWS, el marco de referencia responde a tres preguntas: cuánto cuesta una respuesta correcta, y no un token; cuánto cuestan las trayectorias de agentes de múltiples turnos, dado que el número de turnos puede terminar dominando la factura; y si un modelo puede producir un trabajo que un profesional aceptaría, algo que se pone a prueba con entregables ocupacionales reales y no con preguntas tipo cuestionario.
AWS indica que la evaluación mide la precisión y el costo en llamadas individuales sobre matemáticas de nivel competitivo (AIME), ciencias de nivel de posgrado (GPQA Diamond) y MMLU-Pro, además de trayectorias de agentes de múltiples turnos en tareas de investigación web en vivo y entregables profesionales calificados mediante rúbricas. La calificación combina verificaciones deterministas con un juez basado en un LLM, gpt-5.5, que AWS aclara que no es uno de los modelos evaluados, utilizando instrucciones fijas cuyos hashes quedan registrados en cada archivo de resultados.
AWS afirma que cada ejecución del marco de referencia genera un archivo de resultados con marca de tiempo en formato JSON, y que todas las cifras y gráficos del artículo se generaron a partir de esos archivos en el momento de su elaboración. El material de origen proporcionado no incluye los resultados específicos de precisión, costo o desempeño obtenidos por el marco de referencia.
Fuente: AWS Machine Learning Blog, "Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload", publicado el 11 de septiembre de 2026.
Preguntas frecuentes
- ¿Qué es openai-on-aws/benchmarks-openai?
- Es un marco de pruebas comparativas de código abierto que, según AWS, ejecuta una ruta de código idéntica de la API Responses de OpenAI tanto en modelos de OpenAI alojados en Amazon Bedrock como en la API de OpenAI, de modo que los usuarios puedan reproducir la comparación con sus propias cargas de trabajo.
- {"duration_api_ms":1974,"stop_reason":"end_turn","session_id":"1067634c-0ed0-45cc-8d2e-96f855212f67","total_cost_usd":0.0018708,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2624,"output_tokens":22,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":22,"cache_read_input_tokens":2624,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1062,"outputTokens":12,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001122,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":22,"cacheReadInputTokens":2624,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0007488,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"¿Qué modelos compara el benchmark de AWS?","ttft_ms":1599,"type":"result","duration_ms":1639,"uuid":"ddb3bf1a-f45c-4c5e-9e76-cdf785d05113","ttft_stream_ms":1199,"time_to_request_ms":422,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- AWS compara tres modelos de OpenAI en Amazon Bedrock —gpt-5.6-luna, gpt-5.6-terra y gpt-5.6-sol— con dos modelos de la API de OpenAI, gpt-5.4-mini y gpt-5.4-nano, a los que denomina modelos base ampliamente utilizados por su eficiencia de costo.
- {"duration_api_ms":2062,"stop_reason":"end_turn","session_id":"154ef477-475b-4b05-898d-47c4793bdbd1","total_cost_usd":0.0018838,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2624,"output_tokens":23,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":23,"cache_read_input_tokens":2624,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1065,"outputTokens":12,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001125,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":23,"cacheReadInputTokens":2624,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.0007588,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"¿Qué dice AWS que mide, además del precio por token?","ttft_ms":1616,"type":"result","duration_ms":1673,"uuid":"f289d963-263d-496e-918f-7ea47baa98ea","ttft_stream_ms":1087,"time_to_request_ms":411,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- AWS afirma que mide el costo de una respuesta correcta en pruebas que incluyen AIME, GPQA Diamond y MMLU-Pro, el costo de las trayectorias de agentes en interacciones de varios turnos en tareas de investigación web en vivo, y el desempeño en entregables profesionales evaluados mediante rúbricas.
- {"duration_api_ms":2680,"stop_reason":"end_turn","session_id":"34f9323c-b680-4bb5-b468-0f075d4e4576","total_cost_usd":0.001973,"usage":{"input_tokens":2,"cache_creation_input_tokens":0,"cache_read_input_tokens":2625,"output_tokens":32,"output_tokens_details":{"thinking_tokens":0},"server_tool_use":{"web_search_requests":0,"web_fetch_requests":0},"service_tier":"standard","cache_creation":{"ephemeral_1h_input_tokens":0,"ephemeral_5m_input_tokens":0},"inference_geo":"not_available","iterations":[{"input_tokens":2,"output_tokens":32,"cache_read_input_tokens":2625,"cache_creation_input_tokens":0,"cache_creation":{"ephemeral_5m_input_tokens":0,"ephemeral_1h_input_tokens":0},"type":"message"}],"speed":"standard"},"modelUsage":{"claude-haiku-4-5-20251001":{"inputTokens":1064,"outputTokens":12,"cacheReadInputTokens":0,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.001124,"contextWindow":200000,"maxOutputTokens":32000,"thinkingTokens":0,"canonicalModel":"claude-haiku-4-5","provider":"firstParty","costBasis":"list"},"claude-sonnet-5":{"inputTokens":2,"outputTokens":32,"cacheReadInputTokens":2625,"cacheCreationInputTokens":0,"webSearchRequests":0,"costUSD":0.000849,"contextWindow":1000000,"maxOutputTokens":64000,"thinkingTokens":0,"canonicalModel":"claude-sonnet-5","provider":"firstParty","costBasis":"list"}},"permission_denials":[],"terminal_reason":"completed","fast_mode_state":"off","fast_mode_disabled_reason":"sdk_opt_in_required","subagent_stats":{"spawned":0,"requested":{"background":0,"foreground":0,"unset":0},"started_in_background":0,"max_depth":0,"spawned_by_subagents":0,"completed":0,"failed":0,"killed":{"parent":0,"user":0,"system":0},"refused":{"depth_limit":0,"concurrency_limit":0,"budget":0},"by_type":{}},"is_error":false,"num_turns":1,"subtype":"success","api_error_status":null,"result":"¿Ejecutó AWS los modelos comparados bajo las mismas condiciones?","ttft_ms":1877,"type":"result","duration_ms":1907,"uuid":"19aa1849-7796-4261-bf82-7cdd2731717c","ttft_stream_ms":1874,"time_to_request_ms":424,"queued_turn_count":0} Client.listTools() called but server does not advertise tools capability - returning empty list
- No. AWS indica que los modelos de Amazon Bedrock se ejecutaron con el razonamiento desactivado, mientras que los modelos base de la API de OpenAI se ejecutaron con su configuración predeterminada, y describe la comparación como un reflejo de configuraciones de implementación prácticas y no como una prueba controlada de la capacidad intrínseca del modelo.