ทำไม AI จึงใช้ไฟฟ้ามากขนาดนั้น?
การฝึกทำให้ข่าวสารดึงความสนใจ แต่การให้บริการโมเดลใช้พลังงานตลอดอายุการทำงานของระบบ นี่คือที่ที่พลังงานจริงๆ ถูกใช้ และทำให้ข้อจำกัดเปลี่ยนจากชิปเป็นการเชื่อมต่อกับเครือข่ายไฟฟ้า
คำตอบโดยย่อ
ทำไม AI ถึงใช้ไฟฟ้ามากมาย?
อุปกรณ์เร่งประมวลผล AI ใช้พลังงานต่อตู้มากกว่าอุปกรณ์เซิร์ฟเวอร์แบบดั้งเดิมหลายเท่า และพลังงานนั้นต้องจ่ายส่งมอบ คลายความร้อน และชำระค่าใช้จ่ายตลอดเวลา การฝึกโมเดลขนาดใหญ่เป็นการพีคพลังงานชั่วคราวเพียงครั้งเดียว; การให้บริการโมเดลนั้นแก่ผู้ใช้หลายล้านคนเป็นภาระคงที่ตลอดเวลา และการทำนายเป็นส่วนที่ใช้พลังงานส่วนใหญ่ในช่วงชีวิตของโมเดลที่ถูกนำไปใช้งาน
ประเด็นสำคัญ
- ชั้นวาง AI สามารถดึงพลังงานได้หลายระดับมากกว่าชั้นวางเซิร์ฟเวอร์แบบดั้งเดิม ทำให้การออกแบบอาคารต้องเปลี่ยนแปลง ไม่ใช่แค่รายการสั่งซื้อ
- การฝึกเป็นการพีคชั่วคราว ส่วนการทำนายเป็นภาระคงที่ ตลอดอายุของโมเดล การให้บริการมีส่วนใหญ่.
- ข้อจำกัดหลักในหลายพื้นที่ตอนนี้คือการเชื่อมต่อกับกริดและเครื่องแปลงไฟฟ้า ไม่ใช่การขาดแคลนชิป
- ประสิทธิภาพต่อโทเคนที่เพิ่มขึ้นนั้นจริงและมาก แต่ความต้องการได้เติบโตเร็วกว่า ทำให้การบริโ consumption ทั้งหมดยังคงเพิ่มต่อไป
ศูนย์ข้อมูลได้ใช้ไฟฟ้าเป็นจำนวนมากมาเป็นเวลาสองทศวรรษ สิ่งที่เปลี่ยนแปลงไปกับ AI คือ ความหนาแน่น: พลังงานที่แร็คเดียวต้องการ และดังนั้นอาคารต้องสามารถส่งและระบายออกได้เท่าใด
พลังงานไปที่ไหนบ้าง
สี่แห่ง เรียงตามลำดับจากมากไปน้อย:
ตัวเร่งความเร็ว GPU และชิป AI ที่ออกแบบมาโดยเฉพาะ ถูกสร้างขึ้นเพื่อให้หน่วยคำนวณหลายพันหน่วยทำงานพร้อมกัน ตัวเร่งความเร็วระดับไฮเอนด์ใช้พลังงานหลายร้อยถึงกว่าพันวัตต์ด้วยตัวเอง และโหนดการฝึกอบรมจะรวมหลายตัวเข้าด้วยกัน ในขณะที่แร็คเซิร์ฟเวอร์ทั่วไปอาจใช้พลังงาน 5–15 กิโลวัตต์ แร็ค AI ถูกกำหนดไว้ที่หลายสิบกิโลวัตต์ และในการออกแบบใหม่ล่าสุดคือมากกว่า 100 กิโลวัตต์
การย้ายข้อมูล โมเดลขนาดใหญ่จะถูกแบ่งออกเป็นหลายชิป ซึ่งต้องแลกเปลี่ยนผลลัพธ์ระหว่างกลางอย่างต่อเนื่อง หน่วยความจำแบนด์วิดท์สูงและโครงสร้างการเชื่อมต่อใช้ส่วนแบ่งที่สำคัญของทั้งหมด — และแตกต่างจากการประมวลผล ส่วนแบ่งนั้นไม่ลดลงอย่างรวดเร็วเท่ากับแต่ละรุ่น
การทำความเย็น ทุกวัตต์ที่เข้าออกจะกลายเป็นความร้อน การระบายความร้อนด้วยอากาศจะใช้งานไม่ได้ที่ประมาณ 30–40 กิโลวัตต์ต่อแร็ค ซึ่งเป็นเหตุผลว่าทำไมการระบายความร้อนด้วยของเหลวจึงเปลี่ยนจากการเป็นของแปลกใหม่ไปสู่มาตรฐานในศูนย์ AI แห่งใหม่ ประสิทธิภาพจะถูกติดตามด้วย PUE (power usage effectiveness): พลังงานทั้งหมดของโรงงานหารด้วยพลังงาน IT โรงงานสมัยใหม่ที่บริหารจัดการได้ดีจะอยู่ที่ประมาณ 1.1–1.2; ไซต์ที่ใช้การระบายความร้อนด้วยอากาศแบบเก่าจะแย่กว่ามาก
อื่นๆ ทั้งหมด การสูญเสียการแปลงพลังงาน, แหล่งจ่ายไฟสำรอง, เครือข่าย, ที่เก็บข้อมูล
การฝึกอบรมคือจุดสูงสุด การอนุมานคือภาระ
การฝึกอบรมโมเดลระดับแนวหน้าใช้ตัวเร่งความเร็วหลายพันตัวทำงานเต็มที่มาหลายสัปดาห์ มันมีราคาแพง มองเห็นได้ และมีขีดจำกัด
การให้บริการโมเดลนั้นแตกต่างกันในลักษณะ การร้องขอแต่ละครั้งจะทำการประมวลผล และผลิตภัณฑ์ที่ได้รับความนิยมจะจัดการคำขอหลายล้านรายการต่อวัน ทุกวัน เป็นเวลาหลายปี พลังงานต่อการร้องขอมีน้อย แต่การคูณนั้นไม่ใช่ สำหรับโมเดลใดๆ ที่ใช้งานจริง พลังงานการอนุมานสะสมจะแซงหน้าพลังงานการฝึกอบรมได้ภายในอายุการใช้งาน — และแตกต่างจากการฝึกอบรม ภาระจะไม่สิ้นสุด
สองสิ่งผลักดันพลังงานการอนุมานให้สูงขึ้นไปอีก:
- ผลลัพธ์ที่ยาวนานขึ้น การสร้างเป็นแบบลำดับ — แต่ละโทเค็นต้องการการผ่านโมเดลทั้งหมด โมเดลสไตล์การให้เหตุผลที่สร้างสายโซ่ภายในที่ยาวก่อนที่จะตอบสนอง จะทำงานมากขึ้นตามสัดส่วนต่อการร้องขอ
- ตัวแทน คำสั่งของผู้ใช้หนึ่งคำสั่งสามารถกลายเป็นคำขอโมเดลหลายสิบรายการบวกกับการเรียกใช้เครื่องมือ จากมุมมองของศูนย์ข้อมูล นั่นคือคำขอหลายสิบรายการ ไม่ใช่หนึ่งเดียว
และสิ่งหนึ่งที่ลดลงอย่างมากคือ: การเลือกโมเดล พลังงานจะเพิ่มขึ้นตามการประมวลผล ดังนั้นการให้บริการงานด้วยโมเดลขนาดเล็กแทนที่จะเป็นโมเดลขนาดใหญ่ไม่ใช่การประหยัดเพียงเล็กน้อย การกำหนดเส้นทาง — โมเดลราคาถูกก่อน เพิ่มระดับเมื่อจำเป็นเท่านั้น — เป็นคันโยกที่มีประสิทธิภาพมากที่สุดที่ทีมส่วนใหญ่มี
ข้อจำกัดย้ายจากชิปไปสู่โครงข่ายไฟฟ้า
ในช่วงเวลาหนึ่ง คอขวดคืออุปทานของตัวเร่งความเร็ว แต่ที่เพิ่มขึ้นเรื่อยๆ คือ การเชื่อมต่อทางไฟฟ้า: คิวเพื่อเชื่อมต่อโหลดขนาดใหญ่ใหม่เข้ากับเครือข่ายส่งกำลัง และระยะเวลารอคอยสำหรับหม้อแปลงและสวิตช์เกียร์ ในตลาดหลักหลายแห่ง คิวเหล่านั้นวัดได้เป็นปี
นั่นปรับเปลี่ยนอุตสาหกรรมในรูปแบบที่น่าจับตามอง:
- การตั้งค่าตามพลังงาน ผู้ประกอบการสร้างในที่ที่มีการผลิตและกำลังการผลิตของโครงข่ายไฟฟ้าอยู่แล้ว แทนที่จะอยู่ใกล้ผู้ใช้ — ยอมรับได้สำหรับการฝึกอบรม แต่ยากกว่าสำหรับการให้บริการที่ไวต่อความหน่วง
- ข้อตกลงการผลิตระยะยาว ข้อตกลงการซื้อพลังงานหลายปี รวมถึงกับผู้ผลิตพลังงานนิวเคลียร์และพลังงานความร้อนใต้พิภพ ได้กลายเป็นข่าวโครงสร้างพื้นฐานมาตรฐานแทนที่จะเป็นการประกาศด้านความยั่งยืน
- การผลิตและการจัดเก็บพลังงานในสถานที่ การผลิตหลังมิเตอร์เพื่อหลีกเลี่ยงคิวการเชื่อมต่อโดยสิ้นเชิง
- การเมืองท้องถิ่น การเพิ่มขึ้นของราคาไฟฟ้าและการใช้น้ำเป็นประเด็นเทศบาลที่กำลังดำเนินอยู่ทุกที่ที่มีการเสนอโรงงานขนาดใหญ่
ประสิทธิภาพกำลังดีขึ้น — และการบริโภคยังคงเพิ่มขึ้น
ทั้งสองประโยคเป็นจริง และความตึงเครียดทำให้เกิดความสับสนในการรายงานข่าวจำนวนมาก
พลังงานต่อโทเค็นลดลงอย่างมากผ่านฮาร์ดแวร์ที่ดีขึ้น, การควอนไทซ์, การจัดกลุ่ม, การแคช, สถาปัตยกรรมแบบกระจายที่เปิดใช้งานเพียงบางส่วนของโมเดลต่อโทเค็น, และโมเดลขนาดเล็กที่กลั่นแล้วซึ่งจัดการงานประจำ นี่ไม่ใช่การเพิ่มขึ้นเพียงเล็กน้อย แต่เป็นการเพิ่มขึ้นอย่างมาก
อย่างไรก็ตาม การบริโภคทั้งหมดก็เพิ่มขึ้น เพราะการใช้งานเติบโตเร็วกว่าประสิทธิภาพ นี่คือรูปแบบการฟื้นตัวมาตรฐาน: เมื่อหน่วยของสิ่งใดสิ่งหนึ่งมีราคาถูกลง ก็จะมีการใช้งานมากขึ้น ประสิทธิภาพเป็นสิ่งจำเป็นและไม่เพียงพอ
สิ่งที่ควรรวัดจริงๆ
หากคุณดำเนินธุรกิจบริการและต้องการตัวเลขที่น่าเชื่อถือมากกว่าหัวข้อข่าว:
- PUE ของโรงงาน จากผู้ประกอบการ
- ความเข้มของคาร์บอนของโครงข่ายไฟฟ้า ที่และ เมื่อ คุณดำเนินการ เวิร์กโหลดเดียวกันสามารถแตกต่างกันหลายเท่าระหว่างภูมิภาคและระหว่างช่วงเวลาของวัน
- โทเค็นที่ให้บริการต่อหน่วยพลังงาน ติดตามเมื่อเวลาผ่านไป สิ่งนี้จะจับการเลือกโมเดลและการกำหนดเส้นทางของคุณ ซึ่งเป็นส่วนที่คุณควบคุม
- ประสิทธิภาพการใช้น้ำ หากคุณดำเนินงานในภูมิภาคที่ขาดแคลนน้ำ
บทสรุปที่น่าอึดอัด: คันโยกส่วนใหญ่ที่ลดการใช้พลังงาน AI คือคันโยกเดียวกับที่ลดต้นทุน AI — โมเดลขนาดเล็กเมื่อเพียงพอ, การแคช, การจัดกลุ่ม, ผลลัพธ์ที่สั้นลง การจัดตำแหน่งนั้นเป็นเหตุผลที่จะมองโลกในแง่ดีปานกลางเกี่ยวกับแนวโน้มต่อการร้องขอ และเป็นเหตุผลว่าทำไมความต้องการทั้งหมดจึงยังคงเพิ่มขึ้น
คำถามที่พบบ่อย
- การใช้ไฟฟ้าของการสอบถาม AI หนึ่งครั้งเท่าไหร่?
- มันแตกต่างกันหลายระดับตามขนาดโมเดล ความยาวของผลลัพธ์ และอุปกรณ์ โดยส่วนใหญ่ของตัวเลขที่เผยแพร่สำหรับคำขอแต่ละคำเป็นเพียงการประมาณมากกว่าการวัดที่แท้จริง การเปรียบเทียบที่เป็นประโยชน์จึงไม่ใช่ต่อคำขอแต่ละคำ แต่เป็นต่อการนำไปใช้งาน: บริการที่รับหลายล้านคำขอต่อวันจะมีการใช้พลังงานหลายเมกะวัตต์อย่างต่อเนื่อง
- การฝึกหรือการทำนายใช้พลังงานมากกว่ากัน?
- การฝึกอบรมมีค่าใช้จ่าย一次性大;而推理的成本较小且会无限重复。对于任何广泛使用的模型,累计的推理成本在其服务生命周期内很快就会超过训练的能源消耗。
- การใช้โมเดลที่เล็กกว่าจะช่วยได้จริงหรือไม่?
- โดยส่วนใหญ่ พลังงานที่ใช้ต่อโทเคนขึ้นอยู่กับการคำนวณที่ทำ ดังนั้นการส่งคำขอที่ง่ายไปยังโมเดลเล็ก และเก็บโมเดลใหญ่ไว้สำหรับคำขอที่ยาก จะทำให้ค่าใช้จ่ายและการใช้พลังงานลดลงสำหรับงานเดียวกัน
- ทำไมศูนย์ข้อมูลถึงต้องใช้น้ำมากขนาดนั้น?
- การทำความเย็นด้วยการระเหยมีราคาถูกและประหยัดแต่ใช้ น้ำ มาก การออกแบบระบบปิดวงจรและการทำความเย็นด้วยของเหลวใช้น้ำได้น้อยกว่าแต่ใช้ไฟฟ้ามากกว่า ทำให้ทรัพยากรสองอย่างนี้แลกกัน
แหล่งข้อมูล
- Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
- Data centre energy use — research programme — Lawrence Berkeley National Laboratory
- Power usage effectiveness (PUE) — The Green Grid