Skip to content
เอเจนต์และระบบอัตโนมัติ

AI Agent คืออะไร และแตกต่างจาก Chatbot อย่างไร

ตัวแทนของปัญญาประดิษฐ์คือโมเดลภาษาที่เชื่อมต่อกับเครื่องมือและมีเป้าหมาย ดังนั้นจึงสามารถทำหลายขั้นตอนได้ด้วยตนเอง นี่คือสิ่งที่หมายถึงในทางปฏิบัติและจุดที่ยังมีปัญหา

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

AI เอเจนต์คืออะไร?

เอเจนต์ AI คือแบบจำลองภาษาที่ได้รับเครื่องมือที่สามารถเรียกใช้ได้ เป้าหมายที่ต้องบรรลุ และได้รับอนุญาตให้ดำเนินการหลายขั้นตอนโดยไม่ต้องขออนุญาตจากมนุษย์ในแต่ละขั้นตอน แชทบอทจะตอบคำถามและหยุดทำงาน เอเจนต์จะทำงานต่อไปจนกว่าจะตัดสินว่าบรรลุเป้าหมายแล้ว หรือจนกว่าจะหมดงบประมาณ

ประเด็นสำคัญ

  • ความแตกต่างทางเทคนิคคือการทำลูป: เอเจนต์เรียกใช้เครื่องมือ, อ่านผลลัพธ์, แล้วตัดสินใจทำสิ่งต่อไปซ้ำ ๆ
  • เครื่องมือเป็นฟังก์ชันซอฟต์แวร์ธรรมดา โมเดลไม่ได้รับความสามารถใหม่; มันได้รับความสามารถในการเรียกใช้ฟังก์ชันที่มีอยู่แล้ว
  • ความเชื่อถือได้ ไม่ใช่ปัญญา เป็นปัจจัยจำกัดหลัก การทำขั้นตอนที่เชื่อถือได้ 95% แบบทำซ้ำ 20 ครั้งติดต่อกัน จะประสบความสำเร็จประมาณหนึ่งในสาม
  • วิธีแก้ปัญหาที่เป็นประโยชน์คือการจำกัดขอบเขต, การตรวจสอบจุดเช็คพอยท์, และการตั้งขอบเขตสิทธิ์ — ไม่ใช่การใช้โมเดลที่ใหญ่กว่า

คำว่า เอเจนต์ ถูกขยายความให้ครอบคลุมเกือบทุกสิ่งที่มีโมเดลภาษาอยู่ภายใน นั่นเป็นปัญหาทางการตลาด ไม่ใช่ปัญหาทางเทคนิค ภายใต้พื้นฐานนั้น มีคำจำกัดความที่เฉพาะเจาะจงและค่อนข้างแคบ และมันก็คุ้มค่าที่จะรู้ เพราะความแตกต่างจะกำหนดว่าอะไรที่อาจผิดพลาดได้

คำจำกัดความ: โมเดลในลูปพร้อมเครื่องมือ

แชทบอทธรรมดาทำสิ่งเดียว: รับข้อความและส่งคืนข้อความ สิ่งใดก็ตามที่มัน "รู้" จะต้องอยู่ในโมเดลหรือในพรอมต์อยู่แล้ว

เอเจนต์เพิ่มสามสิ่ง:

  1. เครื่องมือ (Tools) ฟังก์ชันธรรมดาที่โมเดลอาจเรียกใช้ — ค้นหาฐานข้อมูล, ส่งคำขอ HTTP, รันคำสั่งเชลล์, เขียนไฟล์ โมเดลไม่ได้รันสิ่งเหล่านี้ด้วยตัวเอง มันจะส่งคำขอที่มีโครงสร้าง โค้ดของคุณจะรันมัน และผลลัพธ์จะถูกป้อนกลับ
  2. เป้าหมาย (A goal) งานที่ระบุในระดับที่สูงกว่าขั้นตอนเดียว: "กระทบยอดใบแจ้งหนี้เหล่านี้" ไม่ใช่ "อ่านบรรทัดที่ 4"
  3. ลูป (A loop) หลังจากการได้ผลลัพธ์จากเครื่องมือแต่ละครั้ง โมเดลจะตัดสินใจว่าจะทำอะไรต่อไป มันจะดำเนินการต่อไปจนกว่าจะตัดสินว่าบรรลุเป้าหมายแล้ว, ถึงขีดจำกัดของขั้นตอน, หรือล้มเหลว

ลูปนั้นคือทั้งหมด สิ่งอื่น ๆ ทั้งหมด — หน่วยความจำ, การวางแผน, เอเจนต์ย่อย, กระดานขีดเขียน — เป็นการปรับปรุงเพิ่มเติมจากมัน

เครื่องมือคืออะไรกันแน่

นี่คือส่วนที่ทำให้คนประหลาดใจ: เครื่องมือไม่ใช่ส่วนประกอบ AI พิเศษ เครื่องมือคือฟังก์ชันที่มีชื่อ, คำอธิบาย, และสคีมาสำหรับอาร์กิวเมนต์ คุณสามารถเขียนมันได้ในบ่ายวันเดียว

name: search_orders
description: ค้นหาคำสั่งซื้อตามอีเมลลูกค้าหรือหมายเลขคำสั่งซื้อ
parameters:
  query: string
  limit: integer (ค่าเริ่มต้น 20)

โมเดลจะเห็นคำอธิบายนั้นในบริบทของมัน, ตัดสินใจว่า search_orders เกี่ยวข้อง, และส่งการเรียกพร้อมอาร์กิวเมนต์ รันไทม์ของคุณจะดำเนินการฟังก์ชันจริงและส่งคืนผลลัพธ์เป็นข้อความ โมเดลไม่เคยแตะต้องฐานข้อมูลของคุณโดยตรง

มีผลที่ตามมาสองประการ ประการแรก เอเจนต์มีความสามารถเท่ากับเครื่องมือที่คุณให้เท่านั้น — โมเดลมีส่วนร่วมในการตัดสินใจว่า เครื่องมือใด และ อาร์กิวเมนต์ใด, ไม่มีอะไรมากกว่านั้น ประการที่สอง คำอธิบายเครื่องมือเป็นส่วนหนึ่งของพรอมต์ และคำอธิบายที่คลุมเครือจะทำให้เกิดการเรียกที่ผิดพลาด เช่นเดียวกับคำแนะนำที่คลุมเครือทำให้เกิดคำตอบที่ผิดพลาด

Model Context Protocol (MCP) มีอยู่เพื่อหยุดทุกคนจากการสร้างเซิร์ฟเวอร์เครื่องมือเดียวกันซ้ำ ๆ มันทำให้มาตรฐานวิธีการที่เซิร์ฟเวอร์เครื่องมือโฆษณาว่ามีอะไรให้บ้าง, เพื่อให้การใช้งานเพียงครั้งเดียวสามารถให้บริการผลิตภัณฑ์เอเจนต์ที่แตกต่างกันได้มากมาย

ทำไมความน่าเชื่อถือจึงเป็นส่วนที่ยาก

เอเจนต์ล้มเหลวในลักษณะที่สังเกตเห็นได้ง่ายในการสาธิต สมมติว่าแต่ละขั้นตอนในเวิร์กโฟลว์สำเร็จ 95% — ซึ่งถือว่าน่าพอใจสำหรับโมเดลภาษาที่ทำสิ่งที่ไม่ใช่เรื่องเล็กน้อย

ขั้นตอนต่อเนื่องโอกาสที่ทั้งหมดจะสำเร็จ
386%
1060%
2036%
508%

ไม่มีอะไรผิดปกติกับโมเดล ข้อผิดพลาดเพียงแค่สะสม นี่คือเหตุผลที่เอเจนต์ที่ทำงานได้จริงในสายการผลิตมักจะดูไม่น่าตื่นเต้น: ห้าถึงสิบห้าขั้นตอน, ขอบเขตที่จำกัดอย่างเข้มงวด, และจุดตรวจสอบของมนุษย์ในช่วงเวลาที่สำคัญ

นอกจากนี้ยังอธิบายรูปแบบที่คุณจะเห็นซ้ำ ๆ ในคำแนะนำของผู้ขาย: เลือกสถาปัตยกรรมที่ง่ายที่สุดที่ใช้งานได้ การเรียกโมเดลเดียวที่ถูกพรอมต์อย่างดีจะดีกว่าการต่อกันเป็นสาย; การต่อกันเป็นสายจะดีกว่าลูปอัตโนมัติ; ลูปอัตโนมัติจะดีกว่าฝูงเอเจนต์ การเพิ่มขึ้นแต่ละขั้นจะซื้อความยืดหยุ่นและแลกมาด้วยความสามารถในการคาดการณ์

ที่ที่เอเจนต์สร้างคุณค่าได้อย่างแท้จริง

งานที่เหมาะกับเอเจนต์มีลักษณะร่วมกัน: เป้าหมาย ชัดเจน, เส้นทาง ไม่ชัดเจน, และผลลัพธ์ ตรวจสอบได้ง่าย

  • การเขียนโค้ด การทดสอบจะผ่านหรือไม่ผ่าน เอเจนต์สามารถวนซ้ำกับสัญญาณวัตถุประสงค์
  • การวิจัยและการดึงข้อมูล การรวบรวมเนื้อหาจากหลายแหล่ง, ซึ่งมนุษย์จะอ่านผลลัพธ์อยู่ดี
  • การคัดแยก การจำแนกและจัดเส้นทางตั๋ว, การติดธงความผิดปกติ, การร่างการตอบกลับครั้งแรกเพื่อตรวจสอบ
  • การจัดการข้อมูล การกระทบยอดบันทึกระหว่างระบบที่มีสคีมาเกือบจะตรงกันแต่ไม่ตรงกันพอดี

งานที่เหมาะกับพวกมันไม่ดีคือภาพสะท้อน: การตรวจสอบมีค่าใช้จ่ายสูง, ความผิดพลาดไม่สามารถย้อนกลับได้, หรือเส้นทางที่ถูกต้องนั้นทราบอยู่แล้ว — ในกรณีนั้น ให้เขียนสคริปต์แทน ไม่มีใครต้องการเอเจนต์เพื่อส่งรายงานตอนกลางคืน

ขอบเขตการอนุญาต

เนื่องจากเอเจนต์ตัดสินใจขั้นตอนของตัวเอง, "มันได้รับอนุญาตให้ทำอะไร" จึงไม่สามารถตอบได้ด้วยการอ่านเส้นทางโค้ด มันต้องถูกบังคับใช้ภายนอกโมเดล

ในทางปฏิบัติ นั่นหมายถึง:

  • อ่านกว้าง, เขียนแคบ ให้เอเจนต์ดูอะไรก็ได้ที่มันต้องการ; จำกัดทุกการกระทำที่เปลี่ยนแปลงสถานะ
  • การอนุมัติสำหรับการไม่สามารถย้อนกลับได้ เงิน, ข้อความภายนอก, การลบ, การปรับใช้การผลิต
  • งบประมาณ จำกัดขั้นตอน, เวลาจริง, และการใช้โทเค็น เอเจนต์ที่ติดอยู่ในลูปคือเหตุการณ์การเรียกเก็บเงิน
  • บันทึกที่คุณสามารถเล่นซ้ำได้ การเรียกเครื่องมือและผลลัพธ์ทุกครั้ง, ที่ถูกจัดเก็บ เมื่อมีบางอย่างผิดพลาด, "มันทำอะไรจริง ๆ" จะต้องสามารถตอบได้ในไม่กี่วินาที

Prompt injection สมควรได้รับบรรทัดของตัวเอง หากเอเจนต์ของคุณอ่านหน้าเว็บ, อีเมล, หรือความคิดเห็นใน pull request, ผู้โจมตีสามารถใส่คำแนะนำในเนื้อหานั้นได้ โมเดลไม่มีวิธีที่น่าเชื่อถือในการแยกแยะคำแนะนำของคุณออกจากคำแนะนำที่มันเพิ่งอ่าน การป้องกันไม่ใช่พรอมต์ที่ดีกว่า — มันคือการไม่ให้สิทธิ์เอเจนต์ที่มันไม่ควรมีตั้งแต่แรก

วิธีแยกแยะการโฆษณาเกินจริงออกจากสาระสำคัญ

เมื่อผลิตภัณฑ์เรียกตัวเองว่า agentic, สามคำถามจะแยกแยะของจริงออกจากการรีแบรนด์:

  1. มันสามารถเรียกเครื่องมืออะไรได้บ้าง, อย่างแม่นยำ? รายการที่คุณอ่านได้, หรือการพูดคลุมเครือ?
  2. จะเกิดอะไรขึ้นเมื่อขั้นตอนล้มเหลว? ลองใหม่, ส่งต่อ, หยุด — หรือผลิตคำตอบที่ดูเหมือนถูกต้องแต่ผิดพลาดอย่างเงียบ ๆ?
  3. มันสามารถทำอะไรได้โดยไม่ต้องถาม? หากคำตอบคือ "ทุกอย่าง", นั่นไม่ใช่ความเป็นอิสระ, มันคือความรับผิดที่ไม่มีขอบเขต

เอเจนต์ไม่ใช่แชทบอทที่ฉลาดขึ้น มันคือแชทบอทที่มีมืออยู่บนการควบคุม, และวิศวกรรมที่สำคัญเกือบทั้งหมดเกี่ยวข้องกับมือคู่นั้น

คำถามที่พบบ่อย

เอเจนต์ AI เหมือนกับซอฟต์แวร์อัตโนมัติหรือไม่
ไม่ การอัตโนมัติแบบดั้งเดิมทำตามสคริปต์ที่เขียนล่วงหน้า แต่ตัวแทนจะตัดสินใจเลือกลำดับขั้นตอนในขณะทำงานตามที่มันสังเกตเห็น ทำให้มีความยืดหยุ่นและความไม่แน่นอนมากขึ้น
AI เอเจนต์ทำงานได้โดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้องเลยหรือไม่
ส่วนใหญ่ในสภาพการผลิตไม่ได้ทำบ่อยนัก. ตัวแทนส่วนใหญ่ที่ถูกนำไปใช้งานทำงานภายในขอบเขตการอนุญาต: พวกเขาสามารถอ่านได้อย่างอิสระ แต่ต้องขออนุญาตก่อนทำการที่ต้องใช้เงิน เสียข้อความ หรือลบข้อมูล.
ระบบหลายเอเจนต์คืออะไร?
หลายตัวเอเจนต์ที่มีคำสั่งและเครื่องมือต่างกันทำงานในส่วนต่าง ๆ ของงานเดียวกัน โดยมักมีเอเจนต์ประสานงานหนึ่งตัว ช่วยได้เมื่อส่วนย่อยต้องใช้เครื่องมือที่แท้จริงแตกต่างกัน และเพิ่มความซับซ้อนเมื่อไม่จำเป็น
MCP คืออะไรและทำไมเอเจนต์ถึงพูดถึงมันบ่อยๆ?
โมเดล คอนเทกซ์ โพรโทคอล เป็นมาตรฐานเปิดสำหรับอธิบายเครื่องมือและแหล่งข้อมูลให้กับโมเดล ทำให้เซิร์ฟเวอร์เครื่องมือตัวเดียวทำงานร่วมกับผลิตภัณฑ์เอเจนต์ต่าง ๆ ได้โดยไม่ต้องสร้างใหม่ทุกครั้ง

แหล่งข้อมูล

  1. Model Context Protocol — specification — MCP
  2. Building effective agents — Anthropic
  3. Function calling — API documentation — OpenAI
แท็กagentstool useautomationLLM

อ่านเพิ่มเติม

หน้าต่างบริบทของเอเจนต์ AI คือ 'งบประมาณ' ไม่ใช่ 'สมุดบันทึก' — นี่คือวิธีที่ Anthropic ใช้จ่ายมัน

แนวทางของ Anthropic ปรับกรอบความคิดจาก 'วิศวกรรมพรอมป์' ไปสู่ 'วิศวกรรมบริบท' นั่นคือการคัดสรรชุดโทเคนที่มีนัยสำคัญสูงในจำนวนน้อยที่สุดสำหรับแต่ละรอบการทำงาน แทนที่จะสะสมทุกอย่างไว้ ในการทดสอบภายในของบริษัทเอง การล้างผลลัพธ์เก่าจากเครื่องมือโดยอัตโนมัติ ร่วมกับไฟล์หน่วยความจำภายนอก ช่วยเพิ่มประสิทธิภาพงานค้นหาได้ถึง 39% และลดการใช้โทเคนลง 84% ตลอด 100 รอบการสนทนา

อ่าน 8 นาที

การวิเคราะห์: โอเพ่นเอไอ เผยแพร่ชุดเครื่องมือแบบเปิดแหล่งที่มา, ไม่ใช่โมเดล — และนั่นคือกลยุทธ์

ชุดควบคุมเป็นโค้ดรอบ ๆ โมเดล: มันประกอบรวมบริบท, รันลูปการเรียกเครื่องมือ, สตรีมเหตุการณ์, บีบอัดเซสชันยาว, และเก็บการกระทำที่ไม่สามารถยกเลิกไว้ภายใต้การอนุมัติของมนุษย์ OpenAI ได้ปล่อยชุดควบคุมของ Codex — codex exec, แอปพลิเคชันเซิร์ฟเวอร์และ SDK — ภายใต้ใบอนุญาต Apache-2.0 ดังนั้นบริษัทใด ๆ สามารถฝังลูปตัวแทนเดียวกันนี้ในซอฟต์แวร์ของตนเองได้ พร้อมทั้งยังต้องจ่ายค่าโมเดลที่อยู่เบื้องหลัง

อ่าน 12 นาที

การวิเคราะห์: สิ่งที่จริงๆ แล้วเปลี่ยนไปเมื่อเอเจนต์ AI ย้ายจากการสาธิตสู่การผลิต

Demos ทำการรันเส้นทางสุขสันต์สั้น ๆ หนึ่งครั้งโดยมีมนุษย์สังเกต Production รันหลายพันแบบโดยไม่มีการดูแล ที่ซึ่งอัตราข้อผิดพลาดในแต่ละขั้นตอนสะสมและขอบเขตสิทธิ์ที่ไม่จำกัดทำให้การตัดสินใจผิดพลาดกลายเป็นเหตุการณ์ การปรับใช้ที่ประสบความสำเร็จจะจำกัดขอบเขต ตรวจสอบแต่ละขั้นตอนอย่างถูกวิธีโดยค่าใช้จ่ายต่ำ และกั้นการกระทำที่ไม่สามารถยกเลิกได้ทุกครั้ง

อ่าน 9 นาที