ราคาของโมเดล AI จริงๆ ทำงานอย่างไร: token, การเก็บข้อมูลในแคชและการจัดกลุ่ม
API ของ AI คิดค่าใช้จ่ายตามจำนวนโทเคน ทั้งเข้าและออก โดยอัตราต่างกัน — และวิธีการที่ทำให้ค่าใช้จ่ายลดลงได้ถึง 80% มักไม่ใช่สิ่งที่ทีมมักใช้ก่อนเป็นอันดับแรก คู่มือเชิงปฏิบัติเกี่ยวกับโมเดลค่าใช้จ่าย
คำตอบโดยย่อ
การคำนวณราคา API ของ AI คำนวณอย่างไร?
ส่วนใหญ่ API ของ AI คิดค่าใช้จ่ายตามจำนวนโทเคนล้านตัวอักษร โดยคิดราคาแยกสำหรับอินพุตและเอาต์พุต เอาต์พุตมักมีราคาสูงกว่าอินพุตหลายเท่า การเก็บข้อมูลอินพุตไว้ในคิวช์ การประมวลผลแบบแบตช์ และการใช้โมเดลที่เล็กกว่าสามารถลดค่าใช้จ่ายได้อย่างมาก และค่าใช้จ่ายทั้งหมดของการสนทนาเติบโตตามประวัติการสนทนา เนื่องจากส่วนใหญ่ของ API จะส่งข้อความทั้งหมดของแชทใหม่ในแต่ละรอบ
ประเด็นสำคัญ
- ค่า Input และค่า Output คิดแยกกัน โดยค่า Output มักมีราคาสูงกว่า โดยมักเป็น 3‑5 เท่าของค่า Input
- ค่าแชทเพิ่มขึ้นแบบกำลังสองตามความยาวของบทสนทนา เนื่องจากประวัติทั้งหมดถูกส่งใหม่ในแต่ละรอบ
- การจัดเก็บคำขอและปลายทางแบบกลุ่มเป็นส่วนลดที่ใหญ่ที่สุดสองอย่างโดยไม่ต้องเปลี่ยนโมเดล
- การจัดเส้นทางโมเดล — เริ่มด้วยโมเดลขนาดเล็ก, เพิ่มความซับซ้อนตามความยาก — มักจะเอาชนะการปรับแต่งระดับคำสั่งทุกรูปแบบ
ราคา AI ดูเหมือนจะง่าย — ตัวเลขต่อล้านโทเค็น — แล้วใบแจ้งหนี้แรกก็มาถึงและไม่มีใครสามารถอธิบายได้ รูปแบบการกำหนดราคาไม่ได้ซับซ้อน แต่มีรูปร่างที่ลงโทษวิธีการสร้างสิ่งต่างๆ แบบตรงไปตรงมา
หน่วยพื้นฐาน
ผู้ให้บริการรายใหญ่ทุกรายจะเรียกเก็บเงินต่อ ล้านโทเค็น โดยมีอัตราสองอัตราแยกกัน:
- โทเค็นอินพุต — ทุกสิ่งที่คุณส่ง: พร้อมท์ระบบ, คำจำกัดความเครื่องมือ, ประวัติการสนทนา, เอกสารแนบ
- โทเค็นเอาต์พุต — ทุกสิ่งที่โมเดลสร้างขึ้น
เอาต์พุตเป็นส่วนที่มีราคาแพง โดยทั่วไปจะสูงกว่าอัตราอินพุตสามถึงห้าเท่า เหตุผลคือกลไก: อินพุตสามารถประมวลผลแบบขนานตลอดลำดับ ในขณะที่เอาต์พุตต้องผลิตทีละโทเค็น โดยแต่ละโทเค็นต้องผ่านโมเดลทั้งหมด
ผลลัพธ์ที่ใช้งานได้จริงประการแรก: คำตอบที่เยิ่นเย้อมีค่าใช้จ่ายมากกว่าคำถามที่ยาว "สรุปเป็นสามหัวข้อย่อย" เป็นการควบคุมค่าใช้จ่าย ไม่ใช่แค่ความชอบด้านสไตล์
เงินไปอยู่ที่ไหนจริงๆ
ประวัติการสนทนา นี่คือสิ่งที่ทำให้ทีมประหลาดใจ API แชทส่วนใหญ่ไม่มีสถานะ: เพื่อสนทนาต่อ คุณต้องส่งใหม่ เทิร์นที่ 1 ส่ง 500 โทเค็น เทิร์นที่ 10 ส่งทุกอย่างตั้งแต่เทิร์นที่ 1–9 บวกกับข้อความใหม่ ตลอดเธรดที่ยาวนาน อินพุตสะสมจะเพิ่มขึ้นประมาณกำลังสองของจำนวนเทิร์น
ค่าใช้จ่ายคงที่ต่อคำขอ พร้อมท์ระบบ 2,000 โทเค็น และสคีมาเครื่องมือ 3,000 โทเค็น มีค่าใช้จ่าย 5,000 โทเค็นอินพุต ในการเรียกใช้แต่ละครั้ง รวมถึงการเรียกใช้ที่ผู้ใช้พิมพ์ว่า "ขอบคุณ"
โทเค็นการให้เหตุผล โมเดลที่คิดก่อนตอบจะปล่อยโทเค็นภายในที่ถูกเรียกเก็บเงินเป็นเอาต์พุต คำขอที่ส่งคืนคำตอบสามบรรทัดอาจสร้างโทเค็นมากกว่าสามบรรทัด
การลองใหม่และลูปเอเจนต์ เอเจนต์ที่ใช้สิบห้าขั้นตอนคือสิบห้าคำขอที่เรียกเก็บเงินได้ โดยแต่ละคำขอจะแบกรับบริบทเต็มรูปแบบ ตรรกะการลองใหม่จะคูณสิ่งนี้อย่างเงียบๆ
คันโยกทั้งสี่ เรียงตามผลกระทบ
1. ส่งไปยังโมเดลที่เล็กกว่า ช่องว่างราคาของโมเดลระดับแนวหน้ากับโมเดลขนาดเล็กมักจะอยู่ที่ 10–30 เท่า เวิร์กโหลดการผลิตส่วนใหญ่มีคำขอที่ง่ายจำนวนมาก — การจำแนกประเภท, การดึงข้อมูล, การจัดรูปแบบ — ที่โมเดลขนาดเล็กจัดการได้อย่างเต็มคุณภาพ ส่งสิ่งเหล่านั้นไปยังโมเดลขนาดเล็กและยกระดับเฉพาะเมื่อมีความยากหรือความมั่นใจต่ำ ไม่มีอะไรอื่นในรายการนี้ที่ใกล้เคียงกับการประหยัดเท่ากัน
2. แคชส่วนหน้าคงที่ การแคชพร้อมท์จะคิดค่าบริการส่วนเล็กๆ ของอัตราอินพุตสำหรับส่วนหน้าของผู้ให้บริการที่เคยเห็นแล้ว ต้องใช้ส่วนหน้าแบบไบต์ต่อไบต์ ซึ่งกำหนดระเบียบวินัย:
[พร้อมท์ระบบ] ← คงที่, แคชสิ่งเหล่านี้
[คำจำกัดความเครื่องมือ] ← คงที่
[เอกสารอ้างอิง] ← คงที่ต่อเซสชัน
[ประวัติการสนทนา] ← เปลี่ยนแปลง
[ข้อความปัจจุบัน] ← เปลี่ยนแปลงการใส่การประทับเวลาหรือชื่อผู้ใช้ที่ด้านบนของพร้อมท์จะทำให้การแคชไร้ผลโดยสิ้นเชิง นี่เป็นข้อผิดพลาดทั่วไปและมีราคาแพง
3. จัดกลุ่มสิ่งที่ไม่ได้โต้ตอบ จุดสิ้นสุดของแบทช์จะแลกเปลี่ยนความหน่วงกับราคาประมาณครึ่งหนึ่ง การจำแนกประเภทข้ามคืน, การเติมข้อมูลฝัง, ชุดการประเมิน, การแปลจำนวนมาก — ไม่มีสิ่งใดเหล่านี้ต้องการการตอบสนองแบบซิงโครนัส
4. ทำให้ลูปสั้นลง จำกัดประวัติการสนทนาไว้ที่ N เทิร์นล่าสุด บวกกับบทสรุป ตัดคำจำกัดความเครื่องมือให้เหลือเฉพาะที่งานนี้ต้องการ ตั้งค่าขีดจำกัดความยาวเอาต์พุตที่ชัดเจน เล็กน้อยในแต่ละส่วน; รวมกันมักจะเป็นหนึ่งในสามของใบแจ้งหนี้
ค่าใช้จ่ายที่ไม่ใช่โทเค็น
- การฝัง มีราคาถูกต่อการเรียกใช้และทำงานได้ง่ายระหว่างการจัดทำดัชนีใหม่ การฝังคลังข้อมูลทั้งหมดใหม่หลังจากการเปลี่ยนแปลงการแบ่งส่วนเป็นรายการจริง
- การปรับแต่งอย่างละเอียด มีค่าใช้จ่ายในการฝึกอบรม บวกกับในบางกรณี อัตราการอนุมานที่สูงขึ้น หรือค่าใช้จ่ายในการโฮสต์สำหรับโมเดลที่กำหนดเอง
- อินพุตรูปภาพและเสียง แปลงเป็นโทเค็นเทียบเท่าในอัตราที่แตกต่างกันไปตามผู้ให้บริการและความละเอียด — ตรวจสอบสูตรเฉพาะแทนที่จะสันนิษฐาน
- ระดับการจำกัดอัตรา ปริมาณงานที่สูงขึ้นบางครั้งต้องการการใช้จ่ายที่มุ่งมั่น นั่นเป็นคำถามด้านการจัดซื้อจัดจ้าง ไม่ใช่คำถามด้านวิศวกรรม และคุ้มค่าที่จะสอบถามตั้งแต่เนิ่นๆ
การสร้างการคาดการณ์ที่คุณสามารถปกป้องได้
ติดตั้งเครื่องมือก่อน บันทึกต่อคำขอ: โมเดล, โทเค็นอินพุต, โทเค็นเอาต์พุต, โทเค็นที่แคช, ฟีเจอร์ และผู้ใช้ หากไม่มีการแบ่งรายละเอียดนี้ การเพิ่มประสิทธิภาพต้นทุนก็คือการคาดเดา
จากนั้นการคำนวณก็ตรงไปตรงมา:
ต้นทุนรายเดือน ≈ คำขอ/เดือน
× (โทเค็นอินพุต × อัตราอินพุต
+ โทเค็นที่แคช × อัตราแคช
+ โทเค็นเอาต์พุต × อัตราเอาต์พุต)สร้างแบบจำลองสามสถานการณ์ — คาดการณ์, สองเท่า, และสิบเท่า — และตรวจสอบว่าสถานการณ์ใดที่ทำลายเศรษฐศาสตร์หน่วยของคุณ ผลิตภัณฑ์ต่อที่นั่งพร้อมฟีเจอร์แชทที่ไม่มีขีดจำกัดสามารถพลิกกลับอัตรากำไรของตัวเองได้ และเวลาที่จะค้นพบสิ่งนั้นคือก่อนเปิดตัว
ความจริงที่ไม่สบายใจในการตรวจสอบส่วนใหญ่คือการประหยัดที่ใหญ่ที่สุดไม่ใช่พร้อมท์ที่ชาญฉลาด แต่คือการสังเกตว่า 70% ของการรับส่งข้อมูลไม่เคยต้องการโมเดลที่มีราคาแพง
คำถามที่พบบ่อย
- ทำไมค่าใช้จ่ายของฉันถึงเพิ่มเร็วกว่าการใช้งานของฉัน?
- ความยาวของการสนทนาที่เป็นไปได้มากที่สุดคืออะไร? หากในแต่ละรอบเราส่งประวัติทั้งหมดใหม่ การสนทนา 20 รอบจะมีค่าใช้จ่ายมากกว่าการถาม 20 คำถามแยกกันมาก การสรุปหรือตัดทอนรอบเก่าจะช่วยแก้ไขปัญหานี้
- prompt caching คืออะไรและช่วยประหยัดได้เท่าไหร่?
- ผู้ให้บริการสามารถเก็บคิวไบต์ของส่วนที่ไม่เปลี่ยนแปลงของคำขอ — พรอมต์ระบบ, คำจำกัดการใช้งาน, เอกสารยาว — และคิดค่าบริการเป็นส่วนหนึ่งของอัตราอินพุตปกติในคำขอที่ซ้ำกันอีกครั้ง การทำงานนี้จะเกิดขึ้นเฉพาะเมื่อส่วนที่ไม่เปลี่ยนแปลงเป็นแบบไบต์เดียวกัน ดังนั้นเนื้อหาที่คงที่ต้องอยู่ก่อนเป็นอันดับแรก
- การใช้ API แบตช์คุ้มค่ากับความล่าช้าหรือไม่?
- สำหรับสิ่งที่ไม่ใช่การปฏิสัมพัน
- โมเดลการ推理 มีราคาสูงกว่าที่ระบุในราคาหรือไม่?
- หลายครั้งใช่เลย พวกเขาสร้างโทเคนการคิดภายในก่อนที่จะให้คำตอบที่เห็นได้ และโทเคนเหล่านั้นก็ถูกคิดค่าใช้จ่ายตามจำนวนโทเคนที่ใช้ ค่าที่ระบุคือค่าใช้จ่ายต่อโทเคน; จำนวนโทเคนต่อคำขอคือสิ่งที่เปลี่ยนแปลง
แหล่งข้อมูล
- API pricing — Anthropic
- API pricing — OpenAI
- Gemini API pricing — Google