Skip to content
ธุรกิจและการลงทุน

ราคาของโมเดล AI จริงๆ ทำงานอย่างไร: token, การเก็บข้อมูลในแคชและการจัดกลุ่ม

API ของ AI คิดค่าใช้จ่ายตามจำนวนโทเคน ทั้งเข้าและออก โดยอัตราต่างกัน — และวิธีการที่ทำให้ค่าใช้จ่ายลดลงได้ถึง 80% มักไม่ใช่สิ่งที่ทีมมักใช้ก่อนเป็นอันดับแรก คู่มือเชิงปฏิบัติเกี่ยวกับโมเดลค่าใช้จ่าย

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

การคำนวณราคา API ของ AI คำนวณอย่างไร?

ส่วนใหญ่ API ของ AI คิดค่าใช้จ่ายตามจำนวนโทเคนล้านตัวอักษร โดยคิดราคาแยกสำหรับอินพุตและเอาต์พุต เอาต์พุตมักมีราคาสูงกว่าอินพุตหลายเท่า การเก็บข้อมูลอินพุตไว้ในคิวช์ การประมวลผลแบบแบตช์ และการใช้โมเดลที่เล็กกว่าสามารถลดค่าใช้จ่ายได้อย่างมาก และค่าใช้จ่ายทั้งหมดของการสนทนาเติบโตตามประวัติการสนทนา เนื่องจากส่วนใหญ่ของ API จะส่งข้อความทั้งหมดของแชทใหม่ในแต่ละรอบ

ประเด็นสำคัญ

  • ค่า Input และค่า Output คิดแยกกัน โดยค่า Output มักมีราคาสูงกว่า โดยมักเป็น 3‑5 เท่าของค่า Input
  • ค่าแชทเพิ่มขึ้นแบบกำลังสองตามความยาวของบทสนทนา เนื่องจากประวัติทั้งหมดถูกส่งใหม่ในแต่ละรอบ
  • การจัดเก็บคำขอและปลายทางแบบกลุ่มเป็นส่วนลดที่ใหญ่ที่สุดสองอย่างโดยไม่ต้องเปลี่ยนโมเดล
  • การจัดเส้นทางโมเดล — เริ่มด้วยโมเดลขนาดเล็ก, เพิ่มความซับซ้อนตามความยาก — มักจะเอาชนะการปรับแต่งระดับคำสั่งทุกรูปแบบ

ราคา AI ดูเหมือนจะง่าย — ตัวเลขต่อล้านโทเค็น — แล้วใบแจ้งหนี้แรกก็มาถึงและไม่มีใครสามารถอธิบายได้ รูปแบบการกำหนดราคาไม่ได้ซับซ้อน แต่มีรูปร่างที่ลงโทษวิธีการสร้างสิ่งต่างๆ แบบตรงไปตรงมา

หน่วยพื้นฐาน

ผู้ให้บริการรายใหญ่ทุกรายจะเรียกเก็บเงินต่อ ล้านโทเค็น โดยมีอัตราสองอัตราแยกกัน:

  • โทเค็นอินพุต — ทุกสิ่งที่คุณส่ง: พร้อมท์ระบบ, คำจำกัดความเครื่องมือ, ประวัติการสนทนา, เอกสารแนบ
  • โทเค็นเอาต์พุต — ทุกสิ่งที่โมเดลสร้างขึ้น

เอาต์พุตเป็นส่วนที่มีราคาแพง โดยทั่วไปจะสูงกว่าอัตราอินพุตสามถึงห้าเท่า เหตุผลคือกลไก: อินพุตสามารถประมวลผลแบบขนานตลอดลำดับ ในขณะที่เอาต์พุตต้องผลิตทีละโทเค็น โดยแต่ละโทเค็นต้องผ่านโมเดลทั้งหมด

ผลลัพธ์ที่ใช้งานได้จริงประการแรก: คำตอบที่เยิ่นเย้อมีค่าใช้จ่ายมากกว่าคำถามที่ยาว "สรุปเป็นสามหัวข้อย่อย" เป็นการควบคุมค่าใช้จ่าย ไม่ใช่แค่ความชอบด้านสไตล์

เงินไปอยู่ที่ไหนจริงๆ

ประวัติการสนทนา นี่คือสิ่งที่ทำให้ทีมประหลาดใจ API แชทส่วนใหญ่ไม่มีสถานะ: เพื่อสนทนาต่อ คุณต้องส่งใหม่ เทิร์นที่ 1 ส่ง 500 โทเค็น เทิร์นที่ 10 ส่งทุกอย่างตั้งแต่เทิร์นที่ 1–9 บวกกับข้อความใหม่ ตลอดเธรดที่ยาวนาน อินพุตสะสมจะเพิ่มขึ้นประมาณกำลังสองของจำนวนเทิร์น

ค่าใช้จ่ายคงที่ต่อคำขอ พร้อมท์ระบบ 2,000 โทเค็น และสคีมาเครื่องมือ 3,000 โทเค็น มีค่าใช้จ่าย 5,000 โทเค็นอินพุต ในการเรียกใช้แต่ละครั้ง รวมถึงการเรียกใช้ที่ผู้ใช้พิมพ์ว่า "ขอบคุณ"

โทเค็นการให้เหตุผล โมเดลที่คิดก่อนตอบจะปล่อยโทเค็นภายในที่ถูกเรียกเก็บเงินเป็นเอาต์พุต คำขอที่ส่งคืนคำตอบสามบรรทัดอาจสร้างโทเค็นมากกว่าสามบรรทัด

การลองใหม่และลูปเอเจนต์ เอเจนต์ที่ใช้สิบห้าขั้นตอนคือสิบห้าคำขอที่เรียกเก็บเงินได้ โดยแต่ละคำขอจะแบกรับบริบทเต็มรูปแบบ ตรรกะการลองใหม่จะคูณสิ่งนี้อย่างเงียบๆ

คันโยกทั้งสี่ เรียงตามผลกระทบ

1. ส่งไปยังโมเดลที่เล็กกว่า ช่องว่างราคาของโมเดลระดับแนวหน้ากับโมเดลขนาดเล็กมักจะอยู่ที่ 10–30 เท่า เวิร์กโหลดการผลิตส่วนใหญ่มีคำขอที่ง่ายจำนวนมาก — การจำแนกประเภท, การดึงข้อมูล, การจัดรูปแบบ — ที่โมเดลขนาดเล็กจัดการได้อย่างเต็มคุณภาพ ส่งสิ่งเหล่านั้นไปยังโมเดลขนาดเล็กและยกระดับเฉพาะเมื่อมีความยากหรือความมั่นใจต่ำ ไม่มีอะไรอื่นในรายการนี้ที่ใกล้เคียงกับการประหยัดเท่ากัน

2. แคชส่วนหน้าคงที่ การแคชพร้อมท์จะคิดค่าบริการส่วนเล็กๆ ของอัตราอินพุตสำหรับส่วนหน้าของผู้ให้บริการที่เคยเห็นแล้ว ต้องใช้ส่วนหน้าแบบไบต์ต่อไบต์ ซึ่งกำหนดระเบียบวินัย:

[พร้อมท์ระบบ]        ← คงที่, แคชสิ่งเหล่านี้
[คำจำกัดความเครื่องมือ]     ← คงที่
[เอกสารอ้างอิง]  ← คงที่ต่อเซสชัน
[ประวัติการสนทนา] ← เปลี่ยนแปลง
[ข้อความปัจจุบัน]      ← เปลี่ยนแปลง

การใส่การประทับเวลาหรือชื่อผู้ใช้ที่ด้านบนของพร้อมท์จะทำให้การแคชไร้ผลโดยสิ้นเชิง นี่เป็นข้อผิดพลาดทั่วไปและมีราคาแพง

3. จัดกลุ่มสิ่งที่ไม่ได้โต้ตอบ จุดสิ้นสุดของแบทช์จะแลกเปลี่ยนความหน่วงกับราคาประมาณครึ่งหนึ่ง การจำแนกประเภทข้ามคืน, การเติมข้อมูลฝัง, ชุดการประเมิน, การแปลจำนวนมาก — ไม่มีสิ่งใดเหล่านี้ต้องการการตอบสนองแบบซิงโครนัส

4. ทำให้ลูปสั้นลง จำกัดประวัติการสนทนาไว้ที่ N เทิร์นล่าสุด บวกกับบทสรุป ตัดคำจำกัดความเครื่องมือให้เหลือเฉพาะที่งานนี้ต้องการ ตั้งค่าขีดจำกัดความยาวเอาต์พุตที่ชัดเจน เล็กน้อยในแต่ละส่วน; รวมกันมักจะเป็นหนึ่งในสามของใบแจ้งหนี้

ค่าใช้จ่ายที่ไม่ใช่โทเค็น

  • การฝัง มีราคาถูกต่อการเรียกใช้และทำงานได้ง่ายระหว่างการจัดทำดัชนีใหม่ การฝังคลังข้อมูลทั้งหมดใหม่หลังจากการเปลี่ยนแปลงการแบ่งส่วนเป็นรายการจริง
  • การปรับแต่งอย่างละเอียด มีค่าใช้จ่ายในการฝึกอบรม บวกกับในบางกรณี อัตราการอนุมานที่สูงขึ้น หรือค่าใช้จ่ายในการโฮสต์สำหรับโมเดลที่กำหนดเอง
  • อินพุตรูปภาพและเสียง แปลงเป็นโทเค็นเทียบเท่าในอัตราที่แตกต่างกันไปตามผู้ให้บริการและความละเอียด — ตรวจสอบสูตรเฉพาะแทนที่จะสันนิษฐาน
  • ระดับการจำกัดอัตรา ปริมาณงานที่สูงขึ้นบางครั้งต้องการการใช้จ่ายที่มุ่งมั่น นั่นเป็นคำถามด้านการจัดซื้อจัดจ้าง ไม่ใช่คำถามด้านวิศวกรรม และคุ้มค่าที่จะสอบถามตั้งแต่เนิ่นๆ

การสร้างการคาดการณ์ที่คุณสามารถปกป้องได้

ติดตั้งเครื่องมือก่อน บันทึกต่อคำขอ: โมเดล, โทเค็นอินพุต, โทเค็นเอาต์พุต, โทเค็นที่แคช, ฟีเจอร์ และผู้ใช้ หากไม่มีการแบ่งรายละเอียดนี้ การเพิ่มประสิทธิภาพต้นทุนก็คือการคาดเดา

จากนั้นการคำนวณก็ตรงไปตรงมา:

ต้นทุนรายเดือน ≈ คำขอ/เดือน
             × (โทเค็นอินพุต × อัตราอินพุต
              + โทเค็นที่แคช × อัตราแคช
              + โทเค็นเอาต์พุต × อัตราเอาต์พุต)

สร้างแบบจำลองสามสถานการณ์ — คาดการณ์, สองเท่า, และสิบเท่า — และตรวจสอบว่าสถานการณ์ใดที่ทำลายเศรษฐศาสตร์หน่วยของคุณ ผลิตภัณฑ์ต่อที่นั่งพร้อมฟีเจอร์แชทที่ไม่มีขีดจำกัดสามารถพลิกกลับอัตรากำไรของตัวเองได้ และเวลาที่จะค้นพบสิ่งนั้นคือก่อนเปิดตัว

ความจริงที่ไม่สบายใจในการตรวจสอบส่วนใหญ่คือการประหยัดที่ใหญ่ที่สุดไม่ใช่พร้อมท์ที่ชาญฉลาด แต่คือการสังเกตว่า 70% ของการรับส่งข้อมูลไม่เคยต้องการโมเดลที่มีราคาแพง

คำถามที่พบบ่อย

ทำไมค่าใช้จ่ายของฉันถึงเพิ่มเร็วกว่าการใช้งานของฉัน?
ความยาวของการสนทนาที่เป็นไปได้มากที่สุดคืออะไร? หากในแต่ละรอบเราส่งประวัติทั้งหมดใหม่ การสนทนา 20 รอบจะมีค่าใช้จ่ายมากกว่าการถาม 20 คำถามแยกกันมาก การสรุปหรือตัดทอนรอบเก่าจะช่วยแก้ไขปัญหานี้
prompt caching คืออะไรและช่วยประหยัดได้เท่าไหร่?
ผู้ให้บริการสามารถเก็บคิวไบต์ของส่วนที่ไม่เปลี่ยนแปลงของคำขอ — พรอมต์ระบบ, คำจำกัดการใช้งาน, เอกสารยาว — และคิดค่าบริการเป็นส่วนหนึ่งของอัตราอินพุตปกติในคำขอที่ซ้ำกันอีกครั้ง การทำงานนี้จะเกิดขึ้นเฉพาะเมื่อส่วนที่ไม่เปลี่ยนแปลงเป็นแบบไบต์เดียวกัน ดังนั้นเนื้อหาที่คงที่ต้องอยู่ก่อนเป็นอันดับแรก
การใช้ API แบตช์คุ้มค่ากับความล่าช้าหรือไม่?
สำหรับสิ่งที่ไม่ใช่การปฏิสัมพัน
โมเดลการ推理 มีราคาสูงกว่าที่ระบุในราคาหรือไม่?
หลายครั้งใช่เลย พวกเขาสร้างโทเคนการคิดภายในก่อนที่จะให้คำตอบที่เห็นได้ และโทเคนเหล่านั้นก็ถูกคิดค่าใช้จ่ายตามจำนวนโทเคนที่ใช้ ค่าที่ระบุคือค่าใช้จ่ายต่อโทเคน; จำนวนโทเคนต่อคำขอคือสิ่งที่เปลี่ยนแปลง

แหล่งข้อมูล

  1. API pricing — Anthropic
  2. API pricing — OpenAI
  3. Gemini API pricing — Google
แท็กpricingtokenscostcachingbatch

อ่านเพิ่มเติม

การวิเคราะห์: ราคาของ AI ยังคงลดลง แต่ทำไมค่าใช้จ่ายถึงเพิ่มขึ้น?

ราคาต่อโทเคนได้ลดลงอย่างชัดเจนด้วยการใช้ฮาร์ดแวร์ที่ดีขึ้น โมเดลที่ถูกฝึกย่อย (distilled) ขนาดเล็ก และการปรับปรุงการให้บริการ การบริโภคเพิ่มขึ้นเร็วขึ้น: บริบทที่ยาวขึ้น โมเดลที่ทำการคิดวิเคราะห์ซึ่งสร้างโทเคนจำนวนมากต่อคำตอบแต่ละคำ และเอเจนต์ที่แปลงการกระทำของผู้ใช้หนึ่งครั้งเป็นหลายสิบครั้งของการเรียกโมเดล การลดราคาต่อหน่วยพร้อมกับการเพิ่มจำนวนหน่วยทำให้ค่าบริการเพิ่มขึ้น

อ่าน 4 นาที

Cloudera จับมือ Mistral ผนึกกำลังพัฒนา AI สำหรับองค์กรแบบอธิปไตย

มิสทรัล เอไอ (Mistral AI) และคลาวเดอรา (Cloudera) ประกาศความร่วมมือในการผนวกโมเดลปัญญาประดิษฐ์ของมิสทรัลเข้ากับแพลตฟอร์มข้อมูลไฮบริดของคลาวเดอรา ข้อตกลงนี้เปิดทางให้องค์กรต่าง ๆ สามารถประมวลผลการอนุมาน (inference) ได้ทั้งบนคลาวด์ส่วนตัว คลาวด์สาธารณะ ระบบภายในองค์กร และสภาพแวดล้อมที่ตัดขาดจากเครือข่ายภายนอก (air-gapped) รวมถึงฝึกฝนโมเดลเฉพาะทางด้วยข้อมูลกรรมสิทธิ์ของตนเอง โดยยังคงความเป็นเจ้าของทั้งข้อมูลและองค์ความรู้ที่ได้จากกระบวนการดังกล่าวไว้อย่างสมบูรณ์ ทั้งสองบริษัทระบุเมื่อวันที่ 10 กันยายน 2026

อ่าน 5 นาที

Mistral ระดมทุน 3 พันล้านยูโรในรอบ Series D ซึ่งนำโดย Samsung

Mistral ประกาศระดมทุนรอบ Series D มูลค่า 3 พันล้านยูโร ซึ่งนำโดย Samsung Electronics ส่งผลให้มูลค่าบริษัทหลังการระดมทุนสูงกว่า 2.1 หมื่นล้านยูโร Mistral ระบุว่าจะใช้เงินทุนเพื่อขยายการวิจัยเทคโนโลยีแนวหน้า ศักยภาพด้านการประมวลผล และโครงสร้างพื้นฐาน พร้อมเร่งการเติบโตเชิงพาณิชย์และขยายการดำเนินงานในต่างประเทศ

อ่าน 4 นาที