AI Agent คืออะไร และแตกต่างจาก Chatbot อย่างไร
ตัวแทนของปัญญาประดิษฐ์คือโมเดลภาษาที่เชื่อมต่อกับเครื่องมือและมีเป้าหมาย ดังนั้นจึงสามารถทำหลายขั้นตอนได้ด้วยตนเอง นี่คือสิ่งที่หมายถึงในทางปฏิบัติและจุดที่ยังมีปัญหา
คำตอบโดยย่อ
AI เอเจนต์คืออะไร?
เอเจนต์ AI คือแบบจำลองภาษาที่ได้รับเครื่องมือที่สามารถเรียกใช้ได้ เป้าหมายที่ต้องบรรลุ และได้รับอนุญาตให้ดำเนินการหลายขั้นตอนโดยไม่ต้องขออนุญาตจากมนุษย์ในแต่ละขั้นตอน แชทบอทจะตอบคำถามและหยุดทำงาน เอเจนต์จะทำงานต่อไปจนกว่าจะตัดสินว่าบรรลุเป้าหมายแล้ว หรือจนกว่าจะหมดงบประมาณ
ประเด็นสำคัญ
- ความแตกต่างทางเทคนิคคือการทำลูป: เอเจนต์เรียกใช้เครื่องมือ, อ่านผลลัพธ์, แล้วตัดสินใจทำสิ่งต่อไปซ้ำ ๆ
- เครื่องมือเป็นฟังก์ชันซอฟต์แวร์ธรรมดา โมเดลไม่ได้รับความสามารถใหม่; มันได้รับความสามารถในการเรียกใช้ฟังก์ชันที่มีอยู่แล้ว
- ความเชื่อถือได้ ไม่ใช่ปัญญา เป็นปัจจัยจำกัดหลัก การทำขั้นตอนที่เชื่อถือได้ 95% แบบทำซ้ำ 20 ครั้งติดต่อกัน จะประสบความสำเร็จประมาณหนึ่งในสาม
- วิธีแก้ปัญหาที่เป็นประโยชน์คือการจำกัดขอบเขต, การตรวจสอบจุดเช็คพอยท์, และการตั้งขอบเขตสิทธิ์ — ไม่ใช่การใช้โมเดลที่ใหญ่กว่า
คำว่า เอเจนต์ ถูกขยายความให้ครอบคลุมเกือบทุกสิ่งที่มีโมเดลภาษาอยู่ภายใน นั่นเป็นปัญหาทางการตลาด ไม่ใช่ปัญหาทางเทคนิค ภายใต้พื้นฐานนั้น มีคำจำกัดความที่เฉพาะเจาะจงและค่อนข้างแคบ และมันก็คุ้มค่าที่จะรู้ เพราะความแตกต่างจะกำหนดว่าอะไรที่อาจผิดพลาดได้
คำจำกัดความ: โมเดลในลูปพร้อมเครื่องมือ
แชทบอทธรรมดาทำสิ่งเดียว: รับข้อความและส่งคืนข้อความ สิ่งใดก็ตามที่มัน "รู้" จะต้องอยู่ในโมเดลหรือในพรอมต์อยู่แล้ว
เอเจนต์เพิ่มสามสิ่ง:
- เครื่องมือ (Tools) ฟังก์ชันธรรมดาที่โมเดลอาจเรียกใช้ — ค้นหาฐานข้อมูล, ส่งคำขอ HTTP, รันคำสั่งเชลล์, เขียนไฟล์ โมเดลไม่ได้รันสิ่งเหล่านี้ด้วยตัวเอง มันจะส่งคำขอที่มีโครงสร้าง โค้ดของคุณจะรันมัน และผลลัพธ์จะถูกป้อนกลับ
- เป้าหมาย (A goal) งานที่ระบุในระดับที่สูงกว่าขั้นตอนเดียว: "กระทบยอดใบแจ้งหนี้เหล่านี้" ไม่ใช่ "อ่านบรรทัดที่ 4"
- ลูป (A loop) หลังจากการได้ผลลัพธ์จากเครื่องมือแต่ละครั้ง โมเดลจะตัดสินใจว่าจะทำอะไรต่อไป มันจะดำเนินการต่อไปจนกว่าจะตัดสินว่าบรรลุเป้าหมายแล้ว, ถึงขีดจำกัดของขั้นตอน, หรือล้มเหลว
ลูปนั้นคือทั้งหมด สิ่งอื่น ๆ ทั้งหมด — หน่วยความจำ, การวางแผน, เอเจนต์ย่อย, กระดานขีดเขียน — เป็นการปรับปรุงเพิ่มเติมจากมัน
เครื่องมือคืออะไรกันแน่
นี่คือส่วนที่ทำให้คนประหลาดใจ: เครื่องมือไม่ใช่ส่วนประกอบ AI พิเศษ เครื่องมือคือฟังก์ชันที่มีชื่อ, คำอธิบาย, และสคีมาสำหรับอาร์กิวเมนต์ คุณสามารถเขียนมันได้ในบ่ายวันเดียว
name: search_orders
description: ค้นหาคำสั่งซื้อตามอีเมลลูกค้าหรือหมายเลขคำสั่งซื้อ
parameters:
query: string
limit: integer (ค่าเริ่มต้น 20)โมเดลจะเห็นคำอธิบายนั้นในบริบทของมัน, ตัดสินใจว่า search_orders เกี่ยวข้อง, และส่งการเรียกพร้อมอาร์กิวเมนต์ รันไทม์ของคุณจะดำเนินการฟังก์ชันจริงและส่งคืนผลลัพธ์เป็นข้อความ โมเดลไม่เคยแตะต้องฐานข้อมูลของคุณโดยตรง
มีผลที่ตามมาสองประการ ประการแรก เอเจนต์มีความสามารถเท่ากับเครื่องมือที่คุณให้เท่านั้น — โมเดลมีส่วนร่วมในการตัดสินใจว่า เครื่องมือใด และ อาร์กิวเมนต์ใด, ไม่มีอะไรมากกว่านั้น ประการที่สอง คำอธิบายเครื่องมือเป็นส่วนหนึ่งของพรอมต์ และคำอธิบายที่คลุมเครือจะทำให้เกิดการเรียกที่ผิดพลาด เช่นเดียวกับคำแนะนำที่คลุมเครือทำให้เกิดคำตอบที่ผิดพลาด
Model Context Protocol (MCP) มีอยู่เพื่อหยุดทุกคนจากการสร้างเซิร์ฟเวอร์เครื่องมือเดียวกันซ้ำ ๆ มันทำให้มาตรฐานวิธีการที่เซิร์ฟเวอร์เครื่องมือโฆษณาว่ามีอะไรให้บ้าง, เพื่อให้การใช้งานเพียงครั้งเดียวสามารถให้บริการผลิตภัณฑ์เอเจนต์ที่แตกต่างกันได้มากมาย
ทำไมความน่าเชื่อถือจึงเป็นส่วนที่ยาก
เอเจนต์ล้มเหลวในลักษณะที่สังเกตเห็นได้ง่ายในการสาธิต สมมติว่าแต่ละขั้นตอนในเวิร์กโฟลว์สำเร็จ 95% — ซึ่งถือว่าน่าพอใจสำหรับโมเดลภาษาที่ทำสิ่งที่ไม่ใช่เรื่องเล็กน้อย
| ขั้นตอนต่อเนื่อง | โอกาสที่ทั้งหมดจะสำเร็จ |
|---|---|
| 3 | 86% |
| 10 | 60% |
| 20 | 36% |
| 50 | 8% |
ไม่มีอะไรผิดปกติกับโมเดล ข้อผิดพลาดเพียงแค่สะสม นี่คือเหตุผลที่เอเจนต์ที่ทำงานได้จริงในสายการผลิตมักจะดูไม่น่าตื่นเต้น: ห้าถึงสิบห้าขั้นตอน, ขอบเขตที่จำกัดอย่างเข้มงวด, และจุดตรวจสอบของมนุษย์ในช่วงเวลาที่สำคัญ
นอกจากนี้ยังอธิบายรูปแบบที่คุณจะเห็นซ้ำ ๆ ในคำแนะนำของผู้ขาย: เลือกสถาปัตยกรรมที่ง่ายที่สุดที่ใช้งานได้ การเรียกโมเดลเดียวที่ถูกพรอมต์อย่างดีจะดีกว่าการต่อกันเป็นสาย; การต่อกันเป็นสายจะดีกว่าลูปอัตโนมัติ; ลูปอัตโนมัติจะดีกว่าฝูงเอเจนต์ การเพิ่มขึ้นแต่ละขั้นจะซื้อความยืดหยุ่นและแลกมาด้วยความสามารถในการคาดการณ์
ที่ที่เอเจนต์สร้างคุณค่าได้อย่างแท้จริง
งานที่เหมาะกับเอเจนต์มีลักษณะร่วมกัน: เป้าหมาย ชัดเจน, เส้นทาง ไม่ชัดเจน, และผลลัพธ์ ตรวจสอบได้ง่าย
- การเขียนโค้ด การทดสอบจะผ่านหรือไม่ผ่าน เอเจนต์สามารถวนซ้ำกับสัญญาณวัตถุประสงค์
- การวิจัยและการดึงข้อมูล การรวบรวมเนื้อหาจากหลายแหล่ง, ซึ่งมนุษย์จะอ่านผลลัพธ์อยู่ดี
- การคัดแยก การจำแนกและจัดเส้นทางตั๋ว, การติดธงความผิดปกติ, การร่างการตอบกลับครั้งแรกเพื่อตรวจสอบ
- การจัดการข้อมูล การกระทบยอดบันทึกระหว่างระบบที่มีสคีมาเกือบจะตรงกันแต่ไม่ตรงกันพอดี
งานที่เหมาะกับพวกมันไม่ดีคือภาพสะท้อน: การตรวจสอบมีค่าใช้จ่ายสูง, ความผิดพลาดไม่สามารถย้อนกลับได้, หรือเส้นทางที่ถูกต้องนั้นทราบอยู่แล้ว — ในกรณีนั้น ให้เขียนสคริปต์แทน ไม่มีใครต้องการเอเจนต์เพื่อส่งรายงานตอนกลางคืน
ขอบเขตการอนุญาต
เนื่องจากเอเจนต์ตัดสินใจขั้นตอนของตัวเอง, "มันได้รับอนุญาตให้ทำอะไร" จึงไม่สามารถตอบได้ด้วยการอ่านเส้นทางโค้ด มันต้องถูกบังคับใช้ภายนอกโมเดล
ในทางปฏิบัติ นั่นหมายถึง:
- อ่านกว้าง, เขียนแคบ ให้เอเจนต์ดูอะไรก็ได้ที่มันต้องการ; จำกัดทุกการกระทำที่เปลี่ยนแปลงสถานะ
- การอนุมัติสำหรับการไม่สามารถย้อนกลับได้ เงิน, ข้อความภายนอก, การลบ, การปรับใช้การผลิต
- งบประมาณ จำกัดขั้นตอน, เวลาจริง, และการใช้โทเค็น เอเจนต์ที่ติดอยู่ในลูปคือเหตุการณ์การเรียกเก็บเงิน
- บันทึกที่คุณสามารถเล่นซ้ำได้ การเรียกเครื่องมือและผลลัพธ์ทุกครั้ง, ที่ถูกจัดเก็บ เมื่อมีบางอย่างผิดพลาด, "มันทำอะไรจริง ๆ" จะต้องสามารถตอบได้ในไม่กี่วินาที
Prompt injection สมควรได้รับบรรทัดของตัวเอง หากเอเจนต์ของคุณอ่านหน้าเว็บ, อีเมล, หรือความคิดเห็นใน pull request, ผู้โจมตีสามารถใส่คำแนะนำในเนื้อหานั้นได้ โมเดลไม่มีวิธีที่น่าเชื่อถือในการแยกแยะคำแนะนำของคุณออกจากคำแนะนำที่มันเพิ่งอ่าน การป้องกันไม่ใช่พรอมต์ที่ดีกว่า — มันคือการไม่ให้สิทธิ์เอเจนต์ที่มันไม่ควรมีตั้งแต่แรก
วิธีแยกแยะการโฆษณาเกินจริงออกจากสาระสำคัญ
เมื่อผลิตภัณฑ์เรียกตัวเองว่า agentic, สามคำถามจะแยกแยะของจริงออกจากการรีแบรนด์:
- มันสามารถเรียกเครื่องมืออะไรได้บ้าง, อย่างแม่นยำ? รายการที่คุณอ่านได้, หรือการพูดคลุมเครือ?
- จะเกิดอะไรขึ้นเมื่อขั้นตอนล้มเหลว? ลองใหม่, ส่งต่อ, หยุด — หรือผลิตคำตอบที่ดูเหมือนถูกต้องแต่ผิดพลาดอย่างเงียบ ๆ?
- มันสามารถทำอะไรได้โดยไม่ต้องถาม? หากคำตอบคือ "ทุกอย่าง", นั่นไม่ใช่ความเป็นอิสระ, มันคือความรับผิดที่ไม่มีขอบเขต
เอเจนต์ไม่ใช่แชทบอทที่ฉลาดขึ้น มันคือแชทบอทที่มีมืออยู่บนการควบคุม, และวิศวกรรมที่สำคัญเกือบทั้งหมดเกี่ยวข้องกับมือคู่นั้น
คำถามที่พบบ่อย
- เอเจนต์ AI เหมือนกับซอฟต์แวร์อัตโนมัติหรือไม่
- ไม่ การอัตโนมัติแบบดั้งเดิมทำตามสคริปต์ที่เขียนล่วงหน้า แต่ตัวแทนจะตัดสินใจเลือกลำดับขั้นตอนในขณะทำงานตามที่มันสังเกตเห็น ทำให้มีความยืดหยุ่นและความไม่แน่นอนมากขึ้น
- AI เอเจนต์ทำงานได้โดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้องเลยหรือไม่
- ส่วนใหญ่ในสภาพการผลิตไม่ได้ทำบ่อยนัก. ตัวแทนส่วนใหญ่ที่ถูกนำไปใช้งานทำงานภายในขอบเขตการอนุญาต: พวกเขาสามารถอ่านได้อย่างอิสระ แต่ต้องขออนุญาตก่อนทำการที่ต้องใช้เงิน เสียข้อความ หรือลบข้อมูล.
- ระบบหลายเอเจนต์คืออะไร?
- หลายตัวเอเจนต์ที่มีคำสั่งและเครื่องมือต่างกันทำงานในส่วนต่าง ๆ ของงานเดียวกัน โดยมักมีเอเจนต์ประสานงานหนึ่งตัว ช่วยได้เมื่อส่วนย่อยต้องใช้เครื่องมือที่แท้จริงแตกต่างกัน และเพิ่มความซับซ้อนเมื่อไม่จำเป็น
- MCP คืออะไรและทำไมเอเจนต์ถึงพูดถึงมันบ่อยๆ?
- โมเดล คอนเทกซ์ โพรโทคอล เป็นมาตรฐานเปิดสำหรับอธิบายเครื่องมือและแหล่งข้อมูลให้กับโมเดล ทำให้เซิร์ฟเวอร์เครื่องมือตัวเดียวทำงานร่วมกับผลิตภัณฑ์เอเจนต์ต่าง ๆ ได้โดยไม่ต้องสร้างใหม่ทุกครั้ง
แหล่งข้อมูล
- Model Context Protocol — specification — MCP
- Building effective agents — Anthropic
- Function calling — API documentation — OpenAI