การวิเคราะห์: ราคาของ AI ยังคงลดลง แต่ทำไมค่าใช้จ่ายถึงเพิ่มขึ้น?
ค่าใช้จ่ายต่อโทเคนลดลงอย่างมาก แม้ว่าการใช้จ่ายรวมของ AI จะเพิ่มขึ้น ทั้งสองอย่างนี้เป็นความจริง และช่องว่างระหว่างพวกมันอธิบายส่วนใหญ่ของสิ่งที่เกิดขึ้นกับเศรษฐศาสตร์ของผลิตภัณฑ์ AI
คำตอบโดยย่อ
ทำไมค่าใช้จ่ายของ AI จึงเพิ่มขึ้น แม้ราคาต่อโทเคนจะลดลง?
ราคาต่อโทเคนได้ลดลงอย่างชัดเจนด้วยการใช้ฮาร์ดแวร์ที่ดีขึ้น โมเดลที่ถูกฝึกย่อย (distilled) ขนาดเล็ก และการปรับปรุงการให้บริการ การบริโภคเพิ่มขึ้นเร็วขึ้น: บริบทที่ยาวขึ้น โมเดลที่ทำการคิดวิเคราะห์ซึ่งสร้างโทเคนจำนวนมากต่อคำตอบแต่ละคำ และเอเจนต์ที่แปลงการกระทำของผู้ใช้หนึ่งครั้งเป็นหลายสิบครั้งของการเรียกโมเดล การลดราคาต่อหน่วยพร้อมกับการเพิ่มจำนวนหน่วยทำให้ค่าบริการเพิ่มขึ้น
ประเด็นสำคัญ
- ราคาต่อหน่วยลดลงแต่การใช้จ่ายรวมเพิ่มขึ้น — จำนวนโทเคนต่องานเพิ่มเร็วกว่าที่ราคาลดลง
- โมเดลการ推理และลูปของเอเจนต์เป็นสองตัวคูณหลักที่เพิ่มจำนวนโทเคนต่อการกระทำของผู้ใช้
- การกำหนดราคาต่อที่นั่งสำหรับฟีเจอร์ AI ที่ไม่จำกัดทำให้กำไรของผู้ใช้งานหนักลดลง; เนื่องจากเหตุนี้ จึงมีการแพร่หลายของราคาที่เชื่อมโยงกับการใช้งาน
- การประหยัดที่มากที่สุดที่มีให้ในผลิตภัณฑ์ส่วนใหญ่คือการส่งคำขอที่ง่ายดายไปยังโมเดลขนาดเล็ก
สองข้อความที่เป็นจริงพร้อมกันและมักถูกสับสนว่าเป็นความขัดแย้ง: ราคาของหน่วยคำนวณ AI ลดลงอย่างมาก และบริษัทใช้จ่ายกับ AI มากกว่าที่เคยเป็นมา ความแตกต่างระหว่างพวกเขาคือที่ที่เศรษฐศาสตร์ที่น่าสนใจอยู่
สิ่งที่จริงๆ แล้วถูกทำให้ราคาถูกกว่า หลายปัจจัยผลักดันให้ราคาต่อโทเคนลดลงพร้อมกัน:
- รุ่นอุปกรณ์ใหม่ ทุกรุ่นเร่งประมวลผลให้ได้มากขึ้นต่อวัตต์และต่อดอลลาร์
- การปรับปรุงการให้บริการ ตัวอย่างเช่น การจัดแบทช์แบบต่อเนื่อง คีย์‑วัลล์แคชแบบพาเกิล การถอดรหัสเชิงคาดเดา และการทำควอนตัม ใช้เทคนิควิศวกรรมที่ไม่เปลี่ยนโมเดลและสะสมผลลัพธ์
- โครงสร้างที่หายาก เช่น โมเดลผสม‑ผู้เชี่ยวชาญ ที่ทำให้เฉพาะส่วนเล็กๆ ของพารามิเตอร์ทำงานต่อโทเคน ทำให้โมเดลใหญ่ๆ ให้บริการได้เหมือนโมเดลเล็กกว่า
- การสกัดความรู้ (distillation) โมเดลเล็กที่ฝึกจากผลลัพธ์ของโมเดลใหญ่ทำงานได้หลายประเภทงานในราคาที่เป็นส่วนของราคาใหญ่
- ความแข่งขัน มีผู้ให้บริการที่น่าเชื่อถือหลายรายในแต่ละระดับความสามารถ โดยค่าใช้จ่ายในการเปลี่ยนผู้ให้บริการต่ำพอที่จะเป็นเรื่องจริง
ผลลัพธ์คือการลดราคาอย่างแท้จริงหลายระดับสำหรับความสามารถระดับหนึ่งในไม่กี่ปีที่ผ่านมา ทั้งนี้ไม่มีใครปฏิเสธเรื่องนี้
สิ่งที่ทำให้ราคาต่องานเพิ่มขึ้น ในขณะเดียวกัน จำนวนโทเคนที่ผู้ใช้แต่ละคนใช้ต่อการกระทำหนึ่งครั้งเพิ่มขึ้น เพราะสาเหตุต่อไปนี้:
- บริบทที่ยาวขึ้น ผลิตภัณฑ์ที่เคยส่งพrompt 500 โทเคน ตอนนี้แนบไฟล์ ประวัติการสนทนา แหล่งข้อมูลที่ดึงมา และคำอธิบายเครื่องมือ ทำให้จำนวนอินพุตต่อการเรียกอาจถึงหมื่นโทเคนโดยไม่แปลกใจ
- โมเดลที่ทำการคิดก่อนตอบ สร้างโทเคนภายในหลายเท่าเมื่อเทียบกับโมเดลที่ตอบโดยตรง อัตราค่าตั๋วไม่เปลี่ยนแปลง แต่จำนวนโทเคนเพิ่มขึ้น
- ตัวแทน (agents) เป็นตัวคูณที่ใหญ่ที่สุด หนึ่งคำสั่งเช่น “ตรวจสอบบัญชีเหล่านี้ให้ตรงกัน” กลายเป็นหลายคำเรียกโมเดล ต่อเนื่องกันทุกคำเรียกมีบริบทที่เพิ่มขึ้น ทำให้จากมุมมองการเรียกเก็บเงิน ไม่ใช่การเรียกหนึ่งเดียวแต่หลายครั้งที่เพิ่มความยาวทุกครั้ง
- การรีทรีและการประเมิน การทำงานในผลิตภัณฑ์ที่ทำการรีทรีเมื่อล้มเหลวและรันชุดการประเมินอย่างต่อเนื่อง ทั้งสองอย่างนี้มองไม่เห็นโดยผู้ใช้แต่ปรากฏบนใบแจ้งหนี้
คูณการลดราคา 10 เท่ากับการเพิ่ม 30 เท่าของจำนวนโทเคนต่องาน ผลลัพธ์คือค่าใช้จ่ายเพิ่มสามเท่า แม้ว่าแต่ละหน่วยจะถูกกว่า นี่คือปริศนาทั้งหมด
ผลต่อกำไรของผลิตภัณฑ์ รูปแบบนี้ชัดเจนที่สุดในซอฟต์แวร์แบบต่อที่นั่ง (per‑seat) ที่ค่าใช้จ่ายต่อที่นั่งมีราคาคงที่ต่อเดือน ส่วนฟ
คำถามที่พบบ่อย
- AI กำลังถูกลงหรือแพงขึ้น?
- การคำนวณต่อหน่วยราคาถูกลง แต่ราคาต่อการทำงานแต่ละงานในหลายผลิตภัณฑ์กลับสูงขึ้น เนื่องจากงานต่าง ๆ ปัจจุบันใช้การคำนวณมากกว่าเดิมมาก ทำให้แนวโน้มที่คุณรู้สึกถึงขึ้นอยู่กับว่า การใช้โทเคนต่องานของคุณคงที่หรือไม่
- ทำไมโมเดลการ推理ถึงมีราคาสูงกว่าที่ระบุ?
- พวกเขาสร้างโทเคนการคิดภายในก่อนที่จะให้คำตอบที่เห็นได้ การเรียกเก็บค่าใช้จ่ายตามจำนวนโทเคนเหล่านี้ไม่เปลี่ยนแปลง; จำนวนโทเคนต่อคำขอเพิ่มมากกว่ามาก
- AI ผลิตภัณฑ์ทำอย่างไรจึงปกป้องกำไรของตน?
- การกำหนดเส้นทางโมเดล, การเก็บแคชคำขอ, การประมวลผลแบบ batch สำหรับงานที่ไม่ต้องโต้ตอบ, ความยาวบริบทที่จำกัด, และราคาที่ขยายตามการใช้งานแทนที่จะเป็นตามจำนวนที่นั่ง
- การโฮสต์ด้วยตนเองของโมเดลแบบ open‑weights ลดต้นทุนได้หรือไม่?
- มันทำงานได้ที่ความดังสูงและคงที่ ทำให้ฮาร์ดแวร์ทำงานต่อเนื่อง. ในขณะที่ปริมาณต่ำหรือผันผวน ตัวเร่งที่ว่างเปล่ามักมีค่าใช้จ่ายมากกว่าการเรียก API
แหล่งข้อมูล
- API pricing — OpenAI
- API pricing — Anthropic
- Electricity 2024 — analysis and forecast to 2026 — International Energy Agency