Skip to content
DigitalNeuron
Agentes y automatización

AWS explica cómo AgentCore Evaluations y DevOps Agent supervisan a los agentes de IA en producción

AWS publicó una entrada de blog que explica cómo AgentCore Evaluations y AWS DevOps Agent trabajan juntos para supervisar la calidad y la infraestructura de los agentes de IA en producción.

Por DigitalNeuron Desk3 min de lectura

Respuesta rápida

¿Qué anunció AWS sobre la supervisión de agentes de IA en producción con AgentCore Evaluations y DevOps Agent?

AWS publicó una entrada de blog que describe cómo AgentCore Evaluations y AWS DevOps Agent trabajan juntos para supervisar agentes de IA en producción. Según AWS, AgentCore Evaluations puntúa las interacciones en vivo de los agentes para detectar problemas de calidad, mientras que DevOps Agent rastrea fallos de infraestructura entre los distintos servicios. AWS demostró el enfoque con un sistema de reservas de aerolínea compuesto por cuatro agentes.

Claves

  • AWS afirma que las herramientas de supervisión de infraestructura, como Amazon CloudWatch, pueden mostrar que un sistema se ejecutó correctamente sin revelar si un agente de IA realmente ayudó a un usuario a lograr su objetivo.
  • AWS construyó un sistema de reservas de aerolínea en producción con cuatro agentes especializados para demostrar la combinación de Amazon Bedrock AgentCore Evaluations con AWS DevOps Agent.
  • Según AWS, AgentCore Evaluations puntúa de forma continua las interacciones en vivo de los agentes para detectar selecciones erróneas de herramientas, fallos de tareas y regresiones de calidad que las métricas de infraestructura no captan.
  • AWS describe a DevOps Agent como una herramienta que rastrea de forma autónoma los fallos entre servicios, correlacionando políticas de IAM, registros de invocación y trazas de orquestación sin investigación manual.
  • AWS señala que Amazon Bedrock ofrece acceso mediante API a modelos fundacionales de Anthropic, Meta, Mistral y Amazon, y que el runtime de AgentCore incluye observabilidad integrada mediante instrumentación de OpenTelemetry.

AWS publicó una entrada de blog en la que explica cómo dos de sus herramientas, Amazon Bedrock AgentCore Evaluations y AWS DevOps Agent, pueden combinarse para supervisar agentes de IA que se ejecutan en producción.

El problema que describe AWS

Según AWS, los sistemas multiagente en producción sufren fallos que la supervisión tradicional no detecta. La compañía ofrece dos ejemplos: un agente que no puede invocar su modelo fundacional y devuelve una respuesta vacía debido a un permiso faltante de AWS Identity and Access Management (IAM) que no genera un error 500, y un agente supervisor con un prompt mal delimitado que empieza a enrutar el 20 % de las solicitudes al especialista equivocado mientras las métricas de infraestructura permanecen inalteradas.

AWS afirma que las herramientas de supervisión de infraestructura, como Amazon CloudWatch, pueden confirmar que un sistema se ejecutó correctamente, pero no pueden mostrar si un agente realmente ayudó a un usuario a lograr su objetivo. La compañía escribe que un agente puede invocar con éxito Amazon Bedrock, llamar a todas las herramientas sin errores y aun así devolver una respuesta que malinterpreta lo que el usuario necesita. AWS también describe un caso en el que un agente de reservas deja de completar reservas pese a que los registros muestran ejecuciones de herramientas exitosas, porque el fallo ocurrió tres llamadas más adentro en una cadena que no generó ninguna excepción visible.

AWS sostiene que estos problemas se agravan en los sistemas multiagente, donde una sola solicitud activa a un agente supervisor que distribuye el trabajo entre varios especialistas, cada uno con sus propias herramientas y llamadas al modelo. AWS señala que normalmente no existe un grafo de ejecución fijo que se pueda instrumentar, y que los fallos pueden producirse en múltiples puntos de traspaso sin propagarse de forma predecible por el sistema.

El sistema que construyó AWS

Para abordar esto, AWS afirma haber construido un sistema de reservas de aerolínea en producción con cuatro agentes especializados que combina Amazon Bedrock AgentCore Evaluations, para la evaluación continua de la calidad de los agentes, con AWS DevOps Agent, para la investigación autónoma de incidentes de infraestructura.

AWS describe Amazon Bedrock AgentCore como una plataforma para crear, conectar y optimizar agentes a gran escala, con cualquier framework o modelo. Dentro de esa plataforma, AWS explica que AgentCore Evaluations puntúa de forma continua las interacciones en vivo para detectar selecciones erróneas de herramientas, fallos de tareas y regresiones de calidad que las métricas de infraestructura pasan por alto por completo. AWS DevOps Agent, según la compañía, rastrea de forma autónoma los fallos entre los distintos servicios, correlacionando políticas de IAM, registros de invocación y trazas de orquestación sin necesidad de investigación manual. AWS sostiene que, en conjunto, estas dos capas están pensadas para mostrar tanto si un agente funciona correctamente como si la infraestructura subyacente lo respalda.

Tecnologías clave utilizadas

AWS enumera varios servicios que sustentan el sistema:

  • Amazon Bedrock ofrece acceso mediante API a modelos fundacionales de Anthropic, Meta, Mistral y Amazon, y impulsa la comprensión del lenguaje en el sistema de reservas de aerolínea.
  • El runtime de AgentCore gestiona la orquestación de los agentes y administra los ciclos de vida de las interacciones, con observabilidad integrada mediante instrumentación de OpenTelemetry.
  • La Fullstack AgentCore Solution Template (FAST) se menciona como parte de la implementación, aunque la entrada de blog no detalla por completo su función en el fragmento proporcionado.

Fuente: AWS Machine Learning Blog, "Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations", publicado el 11 de septiembre de 2026.

Preguntas frecuentes

¿Qué problema aborda AWS en esta entrada de blog?
AWS afirma que los sistemas multiagente en producción pueden fallar de formas que la supervisión tradicional pasa por alto, como un agente que devuelve una respuesta vacía debido a un permiso IAM faltante sin generar ningún error, o un agente supervisor que enruta mal las solicitudes mientras las métricas de infraestructura permanecen inalteradas.
¿Qué es AgentCore Evaluations?
AWS lo describe como una función que puntúa de forma continua las interacciones en vivo de los agentes para detectar selecciones erróneas de herramientas, fallos de tareas y regresiones de calidad que las métricas de infraestructura no capturan.
¿Qué es AWS DevOps Agent?
AWS afirma que rastrea de forma autónoma los fallos entre los distintos servicios, correlacionando políticas de IAM, registros de invocación y trazas de orquestación sin necesidad de investigación manual.
¿Qué ejemplo utilizó AWS para ilustrar este enfoque?
AWS construyó un sistema de reservas de aerolínea en producción con cuatro agentes especializados para mostrar cómo funcionan juntas las dos capas de supervisión.

Fuentes

  1. Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations | Artificial IntelligenceAmazon Web Services (AWS)
Etiquetasawsamazon-bedrockagentcoreai-agentsobservabilitydevops

Lecturas relacionadas

AWS detalla un asistente multimodal para hacer pedidos por WhatsApp creado con Bedrock AgentCore

AWS publicó una guía técnica para implementar en WhatsApp un asistente de pedidos para restaurantes mediante Amazon Bedrock AgentCore y los modelos Amazon Nova 2. El diseño admite mensajes de texto, notas de voz y llamadas a través de un único número empresarial, con memoria compartida entre canales y un backend común para menús, carritos, pedidos y ubicaciones.

2 min de lectura

AWS detalla el entorno de trabajo para inversiones de Heurist Finance, desarrollado sobre Bedrock AgentCore

AWS publicó un estudio de caso en el que describe cómo Heurist Finance creó un entorno de trabajo de inversión basado en IA sobre Amazon Bedrock AgentCore. AWS afirma que el sistema combina datos de mercado y alternativos, informes regulatorios, noticias, construcción de carteras, análisis de escenarios y seguimiento de posiciones en una experiencia de chat, mientras los servicios de AgentCore gestionan la identidad, la memoria, la ejecución de código, los pagos y la observabilidad.

2 min de lectura

AWS muestra cómo crear aplicaciones interactivas MCP en Bedrock AgentCore

AWS afirma que su plataforma Amazon Bedrock AgentCore admite MCP Apps, una extensión del Model Context Protocol que renderiza widgets HTML interactivos dentro de hosts de IA como ChatGPT y Claude. AWS demostró esta capacidad con una aplicación de ejemplo llamada Unicorn Rentals, que permite explorar, reservar, consultar y devolver alquileres a través del runtime y el gateway de AgentCore.

3 min de lectura