AWS เผยรายละเอียดวิธีที่ AgentCore Evaluations และ DevOps Agent เฝ้าติดตามการทำงานของ AI Agent ในสภาพแวดล้อมจริง
AWS เผยแพร่บทความในบล็อกอธิบายว่า AgentCore Evaluations และ AWS DevOps Agent ทำงานร่วมกันอย่างไรในการติดตามคุณภาพของ AI agent และโครงสร้างพื้นฐานในสภาพแวดล้อมจริง (production)
คำตอบโดยย่อ
AWS ประกาศอะไรบ้างเกี่ยวกับการตรวจสอบและติดตามเอเจนต์ AI ในสภาพแวดล้อมการใช้งานจริงด้วย AgentCore Evaluations และ DevOps Agent
AWS เผยแพร่บล็อกโพสต์อธิบายว่า AgentCore Evaluations และ AWS DevOps Agent ทำงานร่วมกันอย่างไรในการตรวจสอบ AI เอเจนต์ที่ใช้งานจริง โดย AWS ระบุว่า AgentCore Evaluations จะให้คะแนนการโต้ตอบของเอเจนต์แบบเรียลไทม์เพื่อตรวจจับปัญหาด้านคุณภาพ ขณะที่ DevOps Agent จะตรวจสอบและติดตามความล้มเหลวของโครงสร้างพื้นฐานข้ามขอบเขตของบริการต่าง ๆ ทั้งนี้ AWS ได้สาธิตแนวทางดังกล่าวโดยใช้ระบบจองตั๋วเครื่องบินที่ประกอบด้วยเอเจนต์สี่ตัว
ประเด็นสำคัญ
- AWS ระบุว่าเครื่องมือตรวจสอบโครงสร้างพื้นฐาน เช่น Amazon CloudWatch สามารถแสดงให้เห็นว่าระบบทำงานได้อย่างถูกต้อง แต่ไม่สามารถบอกได้ว่า AI เอเจนต์นั้นช่วยให้ผู้ใช้บรรลุเป้าหมายที่ต้องการได้จริงหรือไม่
- AWS พัฒนาระบบจองตั๋วเครื่องบินในระดับใช้งานจริง ด้วยเอเจนต์เฉพาะทาง 4 ตัว เพื่อสาธิตการผสานการทำงานระหว่าง Amazon Bedrock AgentCore Evaluations กับ AWS DevOps Agent
- AWS ระบุว่า AgentCore Evaluations จะให้คะแนนการโต้ตอบของเอเจนต์แบบเรียลไทม์อย่างต่อเนื่อง เพื่อจับความผิดพลาดในการเลือกเครื่องมือ ความล้มเหลวของงาน และความถดถอยด้านคุณภาพ ซึ่งเป็นสิ่งที่ตัวชี้วัดด้านโครงสร้างพื้นฐานทั่วไปตรวจไม่พบ
- AWS ระบุว่า DevOps Agent สามารถสืบหาต้นตอของความล้มเหลวข้ามขอบเขตของบริการได้โดยอัตโนมัติ ด้วยการเชื่อมโยงข้อมูลจากนโยบาย IAM บันทึกการเรียกใช้งาน และการติดตามการทำงานของระบบออร์เคสเตรชันเข้าด้วยกัน โดยไม่ต้องอาศัยการตรวจสอบด้วยมือ
- AWS ระบุว่า Amazon Bedrock เปิดให้เข้าถึงโมเดลพื้นฐาน (foundation models) ผ่าน API จากบริษัท Anthropic, Meta, Mistral และ Amazon เอง และระบบ AgentCore runtime ยังมาพร้อมความสามารถด้านการสังเกตการณ์ (observability) ในตัว โดยอาศัยการฝังชุดเครื่องมือ OpenTelemetry
AWS เผยแพร่บทความในบล็อกอธิบายว่าเครื่องมือสองตัวของบริษัท ได้แก่ Amazon Bedrock AgentCore Evaluations และ AWS DevOps Agent สามารถนำมาใช้ร่วมกันเพื่อเฝ้าติดตามเอเจนต์ AI ที่ทำงานอยู่ในสภาพแวดล้อมจริงได้อย่างไร
ปัญหาที่ AWS อธิบายไว้
AWS ระบุว่าระบบมัลติเอเจนต์ที่ใช้งานจริงมักเกิดความล้มเหลวในรูปแบบที่การเฝ้าติดตามแบบดั้งเดิมตรวจจับไม่ได้ บริษัทยกตัวอย่างไว้สองกรณี กรณีแรกคือเอเจนต์ที่ไม่สามารถเรียกใช้ foundation model ของตนได้และส่งคืนคำตอบว่างเปล่า อันเป็นผลจากการขาดสิทธิ์ AWS Identity and Access Management (IAM) ที่จำเป็น โดยไม่มีข้อผิดพลาด 500 เกิดขึ้นให้เห็น กรณีที่สองคือเอเจนต์ผู้ควบคุมดูแล (supervisor agent) ที่มีการกำหนดขอบเขตพรอมป์ไม่รัดกุม จนเริ่มส่งคำขอราว 20 เปอร์เซ็นต์ไปยังผู้เชี่ยวชาญที่ผิดประเภท ทั้งที่ตัวชี้วัดด้านโครงสร้างพื้นฐานยังคงแสดงผลปกติ
AWS ระบุว่าเครื่องมือเฝ้าติดตามโครงสร้างพื้นฐานอย่าง Amazon CloudWatch สามารถยืนยันได้เพียงว่าระบบทำงานถูกต้องตามกระบวนการ แต่ไม่สามารถบอกได้ว่าเอเจนต์นั้นช่วยให้ผู้ใช้บรรลุเป้าหมายจริงหรือไม่ บริษัทเขียนไว้ว่าเอเจนต์อาจเรียกใช้ Amazon Bedrock ได้สำเร็จ เรียกใช้เครื่องมือทุกตัวโดยไม่มีข้อผิดพลาดใดๆ แต่ก็ยังส่งคืนคำตอบที่เข้าใจความต้องการของผู้ใช้ผิดพลาดได้อยู่ดี AWS ยังยกกรณีของเอเจนต์สำหรับจองตั๋วที่จู่ๆ ก็หยุดทำการจองให้สำเร็จ ทั้งที่บันทึกระบบแสดงว่าการเรียกใช้เครื่องมือต่างๆ สำเร็จทุกขั้นตอน เนื่องจากความล้มเหลวเกิดขึ้นลึกเข้าไปในลำดับการเรียกใช้ถึงสามชั้น จนไม่มีข้อผิดพลาดใดปรากฏออกมาให้เห็น
AWS ระบุว่าปัญหาเหล่านี้ยิ่งทวีความซับซ้อนขึ้นในระบบมัลติเอเจนต์ ซึ่งคำขอเพียงหนึ่งรายการสามารถกระตุ้นให้เอเจนต์ผู้ควบคุมดูแลกระจายงานไปยังผู้เชี่ยวชาญหลายราย โดยแต่ละรายมีเครื่องมือและการเรียกใช้โมเดลเป็นของตัวเอง AWS กล่าวว่าโดยทั่วไปแล้วไม่มีแผนผังการทำงานที่ตายตัวให้ติดตามตรวจสอบ และความล้มเหลวอาจเกิดขึ้นได้ในหลายจุดของการส่งต่องาน โดยไม่ลุกลามไปทั่วระบบในรูปแบบที่คาดเดาได้
ระบบที่ AWS สร้างขึ้น
เพื่อรับมือกับปัญหานี้ AWS ระบุว่าได้สร้างระบบจองตั๋วเครื่องบินสำหรับใช้งานจริงที่ประกอบด้วยเอเจนต์เฉพาะทางสี่ตัว โดยผสานรวม Amazon Bedrock AgentCore Evaluations สำหรับประเมินคุณภาพเอเจนต์อย่างต่อเนื่อง เข้ากับ AWS DevOps Agent สำหรับการตรวจสอบเหตุขัดข้องด้านโครงสร้างพื้นฐานแบบอัตโนมัติ
AWS อธิบาย Amazon Bedrock AgentCore ว่าเป็นแพลตฟอร์มสำหรับสร้าง เชื่อมต่อ และปรับแต่งเอเจนต์ในระดับใหญ่ โดยรองรับเฟรมเวิร์กหรือโมเดลใดก็ได้ ภายในแพลตฟอร์มดังกล่าว AWS ระบุว่า AgentCore Evaluations จะให้คะแนนการโต้ตอบที่เกิดขึ้นจริงอย่างต่อเนื่อง เพื่อจับความผิดพลาดในการเลือกเครื่องมือ ความล้มเหลวของงาน และความเสื่อมถอยของคุณภาพ ซึ่งเป็นสิ่งที่ตัวชี้วัดด้านโครงสร้างพื้นฐานมองข้ามไปโดยสิ้นเชิง ส่วน AWS DevOps Agent นั้น บริษัทระบุว่าสามารถสืบหาความล้มเหลวข้ามขอบเขตของบริการต่างๆ ได้โดยอัตโนมัติ ด้วยการเชื่อมโยงนโยบาย IAM บันทึกการเรียกใช้งาน และร่องรอยการประสานงานเข้าด้วยกัน โดยไม่ต้องอาศัยการตรวจสอบด้วยมือ AWS ระบุว่าเมื่อทำงานร่วมกัน ทั้งสองชั้นนี้มีจุดประสงค์เพื่อแสดงให้เห็นทั้งว่าเอเจนต์ทำงานถูกต้องหรือไม่ และโครงสร้างพื้นฐานเบื้องหลังรองรับการทำงานนั้นได้ดีเพียงใด
เทคโนโลยีหลักที่ใช้
AWS ระบุรายชื่อบริการหลายอย่างที่เป็นรากฐานของระบบนี้
- Amazon Bedrock ให้การเข้าถึง API ของ foundation model จาก Anthropic, Meta, Mistral และ Amazon และเป็นตัวขับเคลื่อนความเข้าใจภาษาในระบบจองตั๋วเครื่องบิน
- AgentCore runtime ทำหน้าที่ประสานงานเอเจนต์และจัดการวงจรชีวิตของการโต้ตอบ พร้อมความสามารถในการสังเกตการณ์ในตัวผ่านการติดตั้งเครื่องมือ OpenTelemetry
- Fullstack AgentCore Solution Template (FAST) ถูกกล่าวถึงในฐานะส่วนหนึ่งของการนำไปใช้งานจริง แม้ว่าบทความในบล็อกจะไม่ได้อธิบายบทบาทของเครื่องมือนี้ไว้อย่างละเอียดในเนื้อหาส่วนที่นำมาอ้างอิง
ที่มา: AWS Machine Learning Blog, "Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations," เผยแพร่เมื่อวันที่ 11 กันยายน 2026
คำถามที่พบบ่อย
- AWS กำลังแก้ปัญหาอะไรในบล็อกโพสต์นี้
- AWS ระบุว่าระบบมัลติเอเจนต์ที่ใช้งานจริงอาจล้มเหลวในรูปแบบที่การตรวจสอบแบบดั้งเดิมมองข้ามไป เช่น เอเจนต์ส่งคืนคำตอบว่างเปล่าเนื่องจากขาดสิทธิ์ IAM ที่จำเป็นโดยไม่มีการแจ้งข้อผิดพลาดใด ๆ หรือเอเจนต์ผู้ควบคุมส่งคำขอไปผิดเส้นทาง ขณะที่ตัวชี้วัดด้านโครงสร้างพื้นฐานยังคงแสดงผลปกติ
- AgentCore Evaluations คืออะไร
- AWS ระบุว่านี่คือความสามารถที่ประเมินคะแนนการโต้ตอบของเอเจนต์แบบเรียลไทม์อย่างต่อเนื่อง เพื่อตรวจจับการเลือกใช้เครื่องมือผิดพลาด ความล้มเหลวของงาน และความถดถอยด้านคุณภาพ ซึ่งเป็นสิ่งที่ตัวชี้วัดด้านโครงสร้างพื้นฐานทั่วไปไม่สามารถตรวจจับได้
- AWS DevOps Agent คืออะไร
- AWS ระบุว่าระบบสามารถตรวจสอบและติดตามความล้มเหลวข้ามขอบเขตของบริการได้โดยอัตโนมัติ ด้วยการเชื่อมโยงข้อมูลจากนโยบาย IAM บันทึกการเรียกใช้งาน และการติดตามกระบวนการประสานงานของเอเจนต์เข้าด้วยกัน โดยไม่ต้องอาศัยการตรวจสอบด้วยตนเอง
- AWS ยกตัวอย่างอะไรมาอธิบายแนวทางนี้
- AWS พัฒนาระบบจองตั๋วเครื่องบินระดับใช้งานจริง โดยใช้เอเจนต์เฉพาะทาง 4 ตัว เพื่อแสดงให้เห็นการทำงานร่วมกันของเลเยอร์การตรวจสอบทั้งสองชั้น
แหล่งข้อมูล
- Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations | Artificial Intelligence — Amazon Web Services (AWS)