AWS afirma que su plataforma Amazon Bedrock AgentCore admite MCP Apps, una extensión del Model Context Protocol que renderiza widgets HTML interactivos dentro de hosts de IA como ChatGPT y Claude. AWS demostró esta capacidad con una aplicación de ejemplo llamada Unicorn Rentals, que permite explorar, reservar, consultar y devolver alquileres a través del runtime y el gateway de AgentCore.
AWS publicó una entrada de blog que describe cómo AgentCore Evaluations y AWS DevOps Agent trabajan juntos para supervisar agentes de IA en producción. Según AWS, AgentCore Evaluations puntúa las interacciones en vivo de los agentes para detectar problemas de calidad, mientras que DevOps Agent rastrea fallos de infraestructura entre los distintos servicios. AWS demostró el enfoque con un sistema de reservas de aerolínea compuesto por cuatro agentes.
Skild AI launched S1, a robot foundation model that learns new, multistep tasks from a single video demonstration without retraining. Built on NVIDIA's Isaac Lab, Cosmos, Omniverse and TensorRT technologies, Skild says S1 succeeded at 66% of steps on new tasks versus 9% for a comparable system, and the company has reached a $100 million annual revenue run rate.
Mistral described a project with a European energy operator that migrated 40,000 lines of Fortran 77 from a physics-intensive reservoir simulator to C++. The company said it built a numerical parity harness, used agents to document the codebase, and settled on workflows combining coder, tester and reviewer agents with human checkpoints.
AWS publicó un estudio de caso en el que describe cómo Heurist Finance creó un entorno de trabajo de inversión basado en IA sobre Amazon Bedrock AgentCore. AWS afirma que el sistema combina datos de mercado y alternativos, informes regulatorios, noticias, construcción de carteras, análisis de escenarios y seguimiento de posiciones en una experiencia de chat, mientras los servicios de AgentCore gestionan la identidad, la memoria, la ejecución de código, los pagos y la observabilidad.
Databricks afirma que Zepto creó un marco de evaluación de doble bucle para agentes de atención al cliente mediante Databricks y MLflow. El sistema combina pruebas de desarrollo, supervisión en producción, trazas de ejecución, conjuntos de datos de referencia y controles de calidad para el despliegue. Según Databricks, los agentes gestionan por completo más del 80 % de los tickets de soporte, bajo supervisión humana.
AWS publicó una guía técnica para implementar en WhatsApp un asistente de pedidos para restaurantes mediante Amazon Bedrock AgentCore y los modelos Amazon Nova 2. El diseño admite mensajes de texto, notas de voz y llamadas a través de un único número empresarial, con memoria compartida entre canales y un backend común para menús, carritos, pedidos y ubicaciones.
Las directrices de Anthropic replantean la ingeniería de prompts como ingeniería de contexto: seleccionar para cada turno el conjunto mínimo de tokens con información valiosa, en vez de acumularlo todo. En sus propias evaluaciones, eliminar automáticamente los resultados obsoletos de herramientas y utilizar un archivo de memoria externo mejoró un 39% el desempeño en una tarea de búsqueda y redujo un 84% el uso de tokens a lo largo de 100 turnos.
El éxito o el fracaso de una Skill depende de un solo campo: la descripción, escrita en tercera persona, que indique qué hace y cuándo debe utilizarse. Mantenga SKILL.md por debajo de las 500 líneas y los archivos de referencia a un solo nivel de profundidad, pruébela con todos los modelos con los que tenga previsto usarla y nunca instale una Skill de una fuente que no sea de confianza.
Los desarrolladores interesados en crear agentes de IA pueden recorrer el curso de cinco días de Google y Kaggle como un programa autoguiado. Deben estudiar los codelabs, los documentos técnicos y los notebooks, y luego construir un proyecto final que abarque el diseño del agente, la seguridad y la implementación en la nube. El Discord de Kaggle sirve para resolver dudas y formar grupos de estudio.
Anthropic anunció alianzas en el ámbito de las ciencias de la vida con el Allen Institute y el Howard Hughes Medical Institute. HHMI trabajará con Anthropic en agentes de laboratorio especializados, mientras que el Allen Institute colaborará en sistemas multiagente coordinados para el análisis científico, el diseño experimental y otras tareas de investigación. Ambas alianzas también nutrirán las capacidades más amplias de Claude en ciencias de la vida.
Un arnés es el código alrededor del modelo: reúne el contexto, ejecuta el bucle de llamadas a herramientas, transmite eventos, compacta sesiones largas y mantiene acciones irreversibles detrás de la aprobación humana. OpenAI lanzó el arnés de Codex — codex exec, el servidor de la aplicación y el SDK — bajo Apache-2.0, por lo que cualquier empresa puede incorporar ese mismo bucle de agente en su propio software mientras sigue pagando por el modelo subyacente.
Un agente de IA es un modelo de lenguaje al que se le han dado herramientas que puede invocar, un objetivo que perseguir y permiso para dar varios pasos sin consultar a una persona entre uno y otro. Un chatbot responde y se detiene; un agente sigue actuando hasta que considera cumplido el objetivo o agota su presupuesto.
Las demos ejecutan un camino feliz corto una vez con un humano observando. La producción ejecuta miles de variaciones sin supervisión, donde las tasas de error por paso se acumulan y un alcance de permisos ilimitado convierte una decisión errónea en un incidente. Los despliegues que funcionan reducen el alcance, verifican cada paso de forma económica y controlan cada acción irreversible.