AWS says its Amazon Bedrock AgentCore platform supports MCP Apps, a Model Context Protocol extension that renders interactive HTML widgets inside AI hosts like ChatGPT and Claude. AWS demonstrated the capability with a sample app called Unicorn Rentals, showing browsing, booking, viewing, and returning rentals through AgentCore's runtime and gateway.
AWS는 AgentCore Evaluations와 AWS DevOps Agent가 프로덕션 환경에서 AI 에이전트를 모니터링하기 위해 어떻게 함께 작동하는지 설명하는 블로그 게시물을 발표했다. AWS에 따르면 AgentCore Evaluations는 실시간 에이전트 상호작용의 품질 문제를 점수화하는 반면, DevOps Agent는 서비스 경계를 넘나드는 인프라 장애를 추적한다. AWS는 4개 에이전트로 구성된 항공사 예약 시스템을 통해 이 접근 방식을 시연했다.
스킬드AI(Skild AI)가 단 한 번의 영상 시연만으로 재훈련 없이 새로운 다단계 작업을 학습하는 로봇 파운데이션 모델 'S1'을 공개했다. 엔비디아의 아이작 랩(Isaac Lab), 코스모스(Cosmos), 옴니버스(Omniverse), 텐서RT(TensorRT) 기술을 기반으로 구축된 S1은 새로운 작업에서 66%의 단계 성공률을 기록해, 9%에 그친 비교 시스템을 크게 앞섰다고 스킬드AI는 밝혔다. 회사의 연간 매출 실행률(run rate)은 현재 1억 달러에 달한다.
미스트랄은 한 유럽 에너지 사업자와 진행한 프로젝트를 소개했다. 이 프로젝트에서는 물리 연산이 많은 저류층 시뮬레이터의 포트란(Fortran) 77 코드 4만 줄을 C++로 이전했다. 이 회사는 수치적 정합성을 검증하는 하네스를 구축하고, 에이전트를 활용해 코드베이스를 문서화했으며, 코더·테스터·리뷰어 에이전트와 사람의 점검 단계를 결합한 워크플로를 최종적으로 채택했다고 밝혔다.
AWS는 휴리스트 파이낸스가 Amazon Bedrock AgentCore를 기반으로 AI 투자 워크벤치를 구축한 사례 연구를 공개했다. AWS에 따르면 이 시스템은 시장·대체 데이터, 공시 자료, 뉴스, 포트폴리오 구성, 시나리오 분석, 포지션 모니터링을 하나의 채팅 환경에 통합하며, AgentCore 서비스가 신원 관리, 메모리, 코드 실행, 결제, 관측 기능을 담당한다.
Databricks says Zepto built a dual-loop evaluation framework for customer support agents using Databricks and MLflow. The system combines development testing, production monitoring, execution traces, golden datasets and deployment quality gates. According to Databricks, the agents fully manage more than 80% of support tickets with human oversight.
AWS는 Amazon Bedrock AgentCore와 Amazon Nova 2 모델을 사용해 WhatsApp에서 음식점 주문 도우미를 배포하는 기술 지침을 공개했다. 이 설계는 하나의 비즈니스 번호로 문자 메시지, 음성 메시지, 음성 통화를 지원하며, 채널 간 공유 메모리와 메뉴, 장바구니, 주문, 매장 정보를 관리하는 공통 백엔드를 사용한다.
앤트로픽 지침은 프롬프트 엔지니어링을 «컨텍스트 엔지니어링»으로 다시 정의한다 — 매 턴마다 전부 쌓지 말고 신호 밀도가 가장 높은 최소 토큰 집합만 남기라는 것. 자체 평가에서 낡은 도구 결과를 자동으로 지우는 것 + 외부 메모리 파일 조합이 검색 과제를 39% 개선했고, 100턴짜리 평가에서는 토큰 사용량을 84% 줄였다.
스킬의 생사는 필드 하나에 달렸다 — description. 3인칭으로, «무엇을 하는지»와 «언제 쓰는지»를 함께 적어야 한다. SKILL.md 는 500줄 아래로, 참조 파일은 한 단계 깊이로 유지하고, 쓸 모든 모델에서 테스트하고, 믿을 수 없는 출처의 스킬은 설치하지 않는다.
AI 에이전트 구축에 관심 있는 개발자는 Google과 Kaggle의 5일 과정을 자기 주도형 프로그램으로 이수할 수 있습니다. 코드랩과 기술 백서, 노트북을 학습한 뒤 에이전트 설계와 보안, 클라우드 배포를 아우르는 최종 프로젝트를 완성하세요. 디버깅 지원과 스터디 그룹에는 Kaggle의 Discord를 활용할 수 있습니다.
앤트로픽이 앨런 연구소, 하워드 휴스 의학연구소(HHMI)와 생명과학 분야 파트너십을 발표했다. HHMI는 앤트로픽과 함께 전문화된 실험실용 에이전트를 개발하고, 앨런 연구소는 과학 분석과 실험 설계 등 연구 작업을 위한 협업형 다중 에이전트 시스템 구축에 나선다. 두 파트너십은 클로드의 전반적인 생명과학 역량 강화에도 반영될 예정이다.
하네스는 모델을 감싼 코드다 — 맥락을 골라 넣고, 도구 호출 루프를 돌리고, 이벤트를 실시간으로 흘려보내고, 긴 대화를 압축하고, 되돌릴 수 없는 행동을 사람 승인 뒤에 세운다. 오픈AI는 코덱스의 하네스(codex exec · app-server · SDK)를 아파치-2.0 으로 공개했다. 누구나 같은 에이전트 루프를 자사 소프트웨어에 심을 수 있고, 그 뒤의 모델 값은 계속 낸다.
데모는 짧은 정상 경로를 사람이 지켜보며 한 번 돈다. 실전은 감독 없이 수천 가지 변형을 돌리고, 거기서는 단계별 오류율이 곱해지며 넓은 권한이 잘못된 판단 하나를 사고로 만든다. 되는 배포는 범위를 좁히고, 각 단계를 싸게 검증하고, 되돌릴 수 없는 행동마다 관문을 둔다.