Skip to content
ชิปและโครงสร้างพื้นฐาน

ทำไม AI จึงใช้ไฟฟ้ามากขนาดนั้น?

การฝึกทำให้ข่าวสารดึงความสนใจ แต่การให้บริการโมเดลใช้พลังงานตลอดอายุการทำงานของระบบ นี่คือที่ที่พลังงานจริงๆ ถูกใช้ และทำให้ข้อจำกัดเปลี่ยนจากชิปเป็นการเชื่อมต่อกับเครือข่ายไฟฟ้า

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

ทำไม AI ถึงใช้ไฟฟ้ามากมาย?

อุปกรณ์เร่งประมวลผล AI ใช้พลังงานต่อตู้มากกว่าอุปกรณ์เซิร์ฟเวอร์แบบดั้งเดิมหลายเท่า และพลังงานนั้นต้องจ่ายส่งมอบ คลายความร้อน และชำระค่าใช้จ่ายตลอดเวลา การฝึกโมเดลขนาดใหญ่เป็นการพีคพลังงานชั่วคราวเพียงครั้งเดียว; การให้บริการโมเดลนั้นแก่ผู้ใช้หลายล้านคนเป็นภาระคงที่ตลอดเวลา และการทำนายเป็นส่วนที่ใช้พลังงานส่วนใหญ่ในช่วงชีวิตของโมเดลที่ถูกนำไปใช้งาน

ประเด็นสำคัญ

  • ชั้นวาง AI สามารถดึงพลังงานได้หลายระดับมากกว่าชั้นวางเซิร์ฟเวอร์แบบดั้งเดิม ทำให้การออกแบบอาคารต้องเปลี่ยนแปลง ไม่ใช่แค่รายการสั่งซื้อ
  • การฝึกเป็นการพีคชั่วคราว ส่วนการทำนายเป็นภาระคงที่ ตลอดอายุของโมเดล การให้บริการมีส่วนใหญ่.
  • ข้อจำกัดหลักในหลายพื้นที่ตอนนี้คือการเชื่อมต่อกับกริดและเครื่องแปลงไฟฟ้า ไม่ใช่การขาดแคลนชิป
  • ประสิทธิภาพต่อโทเคนที่เพิ่มขึ้นนั้นจริงและมาก แต่ความต้องการได้เติบโตเร็วกว่า ทำให้การบริโ consumption ทั้งหมดยังคงเพิ่มต่อไป

ศูนย์ข้อมูลได้ใช้ไฟฟ้าเป็นจำนวนมากมาเป็นเวลาสองทศวรรษ สิ่งที่เปลี่ยนแปลงไปกับ AI คือ ความหนาแน่น: พลังงานที่แร็คเดียวต้องการ และดังนั้นอาคารต้องสามารถส่งและระบายออกได้เท่าใด

พลังงานไปที่ไหนบ้าง

สี่แห่ง เรียงตามลำดับจากมากไปน้อย:

ตัวเร่งความเร็ว GPU และชิป AI ที่ออกแบบมาโดยเฉพาะ ถูกสร้างขึ้นเพื่อให้หน่วยคำนวณหลายพันหน่วยทำงานพร้อมกัน ตัวเร่งความเร็วระดับไฮเอนด์ใช้พลังงานหลายร้อยถึงกว่าพันวัตต์ด้วยตัวเอง และโหนดการฝึกอบรมจะรวมหลายตัวเข้าด้วยกัน ในขณะที่แร็คเซิร์ฟเวอร์ทั่วไปอาจใช้พลังงาน 5–15 กิโลวัตต์ แร็ค AI ถูกกำหนดไว้ที่หลายสิบกิโลวัตต์ และในการออกแบบใหม่ล่าสุดคือมากกว่า 100 กิโลวัตต์

การย้ายข้อมูล โมเดลขนาดใหญ่จะถูกแบ่งออกเป็นหลายชิป ซึ่งต้องแลกเปลี่ยนผลลัพธ์ระหว่างกลางอย่างต่อเนื่อง หน่วยความจำแบนด์วิดท์สูงและโครงสร้างการเชื่อมต่อใช้ส่วนแบ่งที่สำคัญของทั้งหมด — และแตกต่างจากการประมวลผล ส่วนแบ่งนั้นไม่ลดลงอย่างรวดเร็วเท่ากับแต่ละรุ่น

การทำความเย็น ทุกวัตต์ที่เข้าออกจะกลายเป็นความร้อน การระบายความร้อนด้วยอากาศจะใช้งานไม่ได้ที่ประมาณ 30–40 กิโลวัตต์ต่อแร็ค ซึ่งเป็นเหตุผลว่าทำไมการระบายความร้อนด้วยของเหลวจึงเปลี่ยนจากการเป็นของแปลกใหม่ไปสู่มาตรฐานในศูนย์ AI แห่งใหม่ ประสิทธิภาพจะถูกติดตามด้วย PUE (power usage effectiveness): พลังงานทั้งหมดของโรงงานหารด้วยพลังงาน IT โรงงานสมัยใหม่ที่บริหารจัดการได้ดีจะอยู่ที่ประมาณ 1.1–1.2; ไซต์ที่ใช้การระบายความร้อนด้วยอากาศแบบเก่าจะแย่กว่ามาก

อื่นๆ ทั้งหมด การสูญเสียการแปลงพลังงาน, แหล่งจ่ายไฟสำรอง, เครือข่าย, ที่เก็บข้อมูล

การฝึกอบรมคือจุดสูงสุด การอนุมานคือภาระ

การฝึกอบรมโมเดลระดับแนวหน้าใช้ตัวเร่งความเร็วหลายพันตัวทำงานเต็มที่มาหลายสัปดาห์ มันมีราคาแพง มองเห็นได้ และมีขีดจำกัด

การให้บริการโมเดลนั้นแตกต่างกันในลักษณะ การร้องขอแต่ละครั้งจะทำการประมวลผล และผลิตภัณฑ์ที่ได้รับความนิยมจะจัดการคำขอหลายล้านรายการต่อวัน ทุกวัน เป็นเวลาหลายปี พลังงานต่อการร้องขอมีน้อย แต่การคูณนั้นไม่ใช่ สำหรับโมเดลใดๆ ที่ใช้งานจริง พลังงานการอนุมานสะสมจะแซงหน้าพลังงานการฝึกอบรมได้ภายในอายุการใช้งาน — และแตกต่างจากการฝึกอบรม ภาระจะไม่สิ้นสุด

สองสิ่งผลักดันพลังงานการอนุมานให้สูงขึ้นไปอีก:

  • ผลลัพธ์ที่ยาวนานขึ้น การสร้างเป็นแบบลำดับ — แต่ละโทเค็นต้องการการผ่านโมเดลทั้งหมด โมเดลสไตล์การให้เหตุผลที่สร้างสายโซ่ภายในที่ยาวก่อนที่จะตอบสนอง จะทำงานมากขึ้นตามสัดส่วนต่อการร้องขอ
  • ตัวแทน คำสั่งของผู้ใช้หนึ่งคำสั่งสามารถกลายเป็นคำขอโมเดลหลายสิบรายการบวกกับการเรียกใช้เครื่องมือ จากมุมมองของศูนย์ข้อมูล นั่นคือคำขอหลายสิบรายการ ไม่ใช่หนึ่งเดียว

และสิ่งหนึ่งที่ลดลงอย่างมากคือ: การเลือกโมเดล พลังงานจะเพิ่มขึ้นตามการประมวลผล ดังนั้นการให้บริการงานด้วยโมเดลขนาดเล็กแทนที่จะเป็นโมเดลขนาดใหญ่ไม่ใช่การประหยัดเพียงเล็กน้อย การกำหนดเส้นทาง — โมเดลราคาถูกก่อน เพิ่มระดับเมื่อจำเป็นเท่านั้น — เป็นคันโยกที่มีประสิทธิภาพมากที่สุดที่ทีมส่วนใหญ่มี

ข้อจำกัดย้ายจากชิปไปสู่โครงข่ายไฟฟ้า

ในช่วงเวลาหนึ่ง คอขวดคืออุปทานของตัวเร่งความเร็ว แต่ที่เพิ่มขึ้นเรื่อยๆ คือ การเชื่อมต่อทางไฟฟ้า: คิวเพื่อเชื่อมต่อโหลดขนาดใหญ่ใหม่เข้ากับเครือข่ายส่งกำลัง และระยะเวลารอคอยสำหรับหม้อแปลงและสวิตช์เกียร์ ในตลาดหลักหลายแห่ง คิวเหล่านั้นวัดได้เป็นปี

นั่นปรับเปลี่ยนอุตสาหกรรมในรูปแบบที่น่าจับตามอง:

  • การตั้งค่าตามพลังงาน ผู้ประกอบการสร้างในที่ที่มีการผลิตและกำลังการผลิตของโครงข่ายไฟฟ้าอยู่แล้ว แทนที่จะอยู่ใกล้ผู้ใช้ — ยอมรับได้สำหรับการฝึกอบรม แต่ยากกว่าสำหรับการให้บริการที่ไวต่อความหน่วง
  • ข้อตกลงการผลิตระยะยาว ข้อตกลงการซื้อพลังงานหลายปี รวมถึงกับผู้ผลิตพลังงานนิวเคลียร์และพลังงานความร้อนใต้พิภพ ได้กลายเป็นข่าวโครงสร้างพื้นฐานมาตรฐานแทนที่จะเป็นการประกาศด้านความยั่งยืน
  • การผลิตและการจัดเก็บพลังงานในสถานที่ การผลิตหลังมิเตอร์เพื่อหลีกเลี่ยงคิวการเชื่อมต่อโดยสิ้นเชิง
  • การเมืองท้องถิ่น การเพิ่มขึ้นของราคาไฟฟ้าและการใช้น้ำเป็นประเด็นเทศบาลที่กำลังดำเนินอยู่ทุกที่ที่มีการเสนอโรงงานขนาดใหญ่

ประสิทธิภาพกำลังดีขึ้น — และการบริโภคยังคงเพิ่มขึ้น

ทั้งสองประโยคเป็นจริง และความตึงเครียดทำให้เกิดความสับสนในการรายงานข่าวจำนวนมาก

พลังงานต่อโทเค็นลดลงอย่างมากผ่านฮาร์ดแวร์ที่ดีขึ้น, การควอนไทซ์, การจัดกลุ่ม, การแคช, สถาปัตยกรรมแบบกระจายที่เปิดใช้งานเพียงบางส่วนของโมเดลต่อโทเค็น, และโมเดลขนาดเล็กที่กลั่นแล้วซึ่งจัดการงานประจำ นี่ไม่ใช่การเพิ่มขึ้นเพียงเล็กน้อย แต่เป็นการเพิ่มขึ้นอย่างมาก

อย่างไรก็ตาม การบริโภคทั้งหมดก็เพิ่มขึ้น เพราะการใช้งานเติบโตเร็วกว่าประสิทธิภาพ นี่คือรูปแบบการฟื้นตัวมาตรฐาน: เมื่อหน่วยของสิ่งใดสิ่งหนึ่งมีราคาถูกลง ก็จะมีการใช้งานมากขึ้น ประสิทธิภาพเป็นสิ่งจำเป็นและไม่เพียงพอ

สิ่งที่ควรรวัดจริงๆ

หากคุณดำเนินธุรกิจบริการและต้องการตัวเลขที่น่าเชื่อถือมากกว่าหัวข้อข่าว:

  • PUE ของโรงงาน จากผู้ประกอบการ
  • ความเข้มของคาร์บอนของโครงข่ายไฟฟ้า ที่และ เมื่อ คุณดำเนินการ เวิร์กโหลดเดียวกันสามารถแตกต่างกันหลายเท่าระหว่างภูมิภาคและระหว่างช่วงเวลาของวัน
  • โทเค็นที่ให้บริการต่อหน่วยพลังงาน ติดตามเมื่อเวลาผ่านไป สิ่งนี้จะจับการเลือกโมเดลและการกำหนดเส้นทางของคุณ ซึ่งเป็นส่วนที่คุณควบคุม
  • ประสิทธิภาพการใช้น้ำ หากคุณดำเนินงานในภูมิภาคที่ขาดแคลนน้ำ

บทสรุปที่น่าอึดอัด: คันโยกส่วนใหญ่ที่ลดการใช้พลังงาน AI คือคันโยกเดียวกับที่ลดต้นทุน AI — โมเดลขนาดเล็กเมื่อเพียงพอ, การแคช, การจัดกลุ่ม, ผลลัพธ์ที่สั้นลง การจัดตำแหน่งนั้นเป็นเหตุผลที่จะมองโลกในแง่ดีปานกลางเกี่ยวกับแนวโน้มต่อการร้องขอ และเป็นเหตุผลว่าทำไมความต้องการทั้งหมดจึงยังคงเพิ่มขึ้น

คำถามที่พบบ่อย

การใช้ไฟฟ้าของการสอบถาม AI หนึ่งครั้งเท่าไหร่?
มันแตกต่างกันหลายระดับตามขนาดโมเดล ความยาวของผลลัพธ์ และอุปกรณ์ โดยส่วนใหญ่ของตัวเลขที่เผยแพร่สำหรับคำขอแต่ละคำเป็นเพียงการประมาณมากกว่าการวัดที่แท้จริง การเปรียบเทียบที่เป็นประโยชน์จึงไม่ใช่ต่อคำขอแต่ละคำ แต่เป็นต่อการนำไปใช้งาน: บริการที่รับหลายล้านคำขอต่อวันจะมีการใช้พลังงานหลายเมกะวัตต์อย่างต่อเนื่อง
การฝึกหรือการทำนายใช้พลังงานมากกว่ากัน?
การฝึกอบรมมีค่าใช้จ่าย一次性大;而推理的成本较小且会无限重复。对于任何广泛使用的模型,累计的推理成本在其服务生命周期内很快就会超过训练的能源消耗。
การใช้โมเดลที่เล็กกว่าจะช่วยได้จริงหรือไม่?
โดยส่วนใหญ่ พลังงานที่ใช้ต่อโทเคนขึ้นอยู่กับการคำนวณที่ทำ ดังนั้นการส่งคำขอที่ง่ายไปยังโมเดลเล็ก และเก็บโมเดลใหญ่ไว้สำหรับคำขอที่ยาก จะทำให้ค่าใช้จ่ายและการใช้พลังงานลดลงสำหรับงานเดียวกัน
ทำไมศูนย์ข้อมูลถึงต้องใช้น้ำมากขนาดนั้น?
การทำความเย็นด้วยการระเหยมีราคาถูกและประหยัดแต่ใช้ น้ำ มาก การออกแบบระบบปิดวงจรและการทำความเย็นด้วยของเหลวใช้น้ำได้น้อยกว่าแต่ใช้ไฟฟ้ามากกว่า ทำให้ทรัพยากรสองอย่างนี้แลกกัน

แหล่งข้อมูล

  1. Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
  2. Data centre energy use — research programme — Lawrence Berkeley National Laboratory
  3. Power usage effectiveness (PUE) — The Green Grid
แท็กdata centresenergyGPUsinferencesustainability

อ่านเพิ่มเติม

AWS เปิดตัวฟีเจอร์แคชโมเดล ลดเวลาสตาร์ทเย็นของการอนุมานบน SageMaker HyperPod

AWS เปิดตัวฟีเจอร์แคชโมเดลสำหรับ Amazon SageMaker Inference บน HyperPod โดยฟีเจอร์นี้จะโหลดน้ำหนักโมเดลและอิมเมจคอนเทนเนอร์ไว้ล่วงหน้าบนโหนดของคลัสเตอร์ ทำให้พอดสามารถอ่านข้อมูลจากสตอเรจ NVMe ภายในเครื่องด้วยความเร็วประมาณ 7 กิกะไบต์ต่อวินาที แทนที่จะต้องดาวน์โหลดผ่านเครือข่าย ส่งผลให้พอดมักเริ่มให้บริการทราฟฟิกได้ภายในไม่กี่วินาที แทนที่จะใช้เวลาหลักสิบนาทีตามที่ AWS ระบุ

อ่าน 5 นาที

วิเคราะห์: การรันโมเดลโอเพนเวทเองบนเซิร์ฟเวอร์ตัวเอง — สมการที่ตัดสินความคุ้มค่า และต้นทุนที่ไม่มีใครตั้งงบไว้ล่วงหน้า

คุ้มก็ต่อเมื่อมีอัตราการใช้งานสูงและสม่ำเสมอเท่านั้น การรันเองคือการเปลี่ยนต้นทุนผันแปรต่อโทเคนให้กลายเป็นต้นทุนคงที่รายชั่วโมง จึงจะคุ้มค่าเมื่อตัวเร่งประมวลผลทำงานแทบตลอดเวลา แต่จะขาดทุนหนักเมื่อปล่อยให้ว่างงาน การเปรียบเทียบที่ตรงไปตรงมาต้องคิดต้นทุนทั้งระบบ ทั้งชั่วโมงการใช้ตัวเร่งประมวลผล ระบบสำรอง เวลาทำงานของทีมวิศวกร และงานประเมินผลที่ต้องใช้ยืนยันว่าโมเดลขนาดเล็กกว่านั้นดีพอ แล้วนำไปเทียบกับค่าใช้จ่าย API สำหรับปริมาณการใช้งานเท่ากัน ส่วนเรื่องอธิปไตยของข้อมูล ข้อกำหนดที่ตั้งจัดเก็บข้อมูล และเพดานความหน่วงต่ำสุด เป็นเหตุผลแยกต่างหากที่อาจสนับสนุนการรันเองได้ ไม่ว่าผลการคำนวณจะออกมาอย่างไรก็ตาม

อ่าน 16 นาที

d-Matrix เชื่อมต่อ Raptor XPU เข้ากับแพลตฟอร์มของ NVIDIA ผ่าน NVLink Fusion

d-Matrix announced it will use NVIDIA NVLink Fusion to connect its next-generation Raptor XPUs to NVIDIA's AI infrastructure platform, including NVLink scale-up and Spectrum-X networking and the MGX rack architecture. The company said this gives it a path to deploy Raptor at large scale alongside NVIDIA systems.

อ่าน 4 นาที