Skip to content

ชิปและโครงสร้างพื้นฐาน

ชิปเร่งความเร็ว ศูนย์ข้อมูล อุปทานหน่วยความจำ และค่าไฟของ AI

6 บทความ

d-Matrix เชื่อมต่อ Raptor XPU เข้ากับแพลตฟอร์มของ NVIDIA ผ่าน NVLink Fusion

d-Matrix announced it will use NVIDIA NVLink Fusion to connect its next-generation Raptor XPUs to NVIDIA's AI infrastructure platform, including NVLink scale-up and Spectrum-X networking and the MGX rack architecture. The company said this gives it a path to deploy Raptor at large scale alongside NVIDIA systems.

อ่าน 4 นาที

AWS เปิดตัวฟีเจอร์แคชโมเดล ลดเวลาสตาร์ทเย็นของการอนุมานบน SageMaker HyperPod

AWS เปิดตัวฟีเจอร์แคชโมเดลสำหรับ Amazon SageMaker Inference บน HyperPod โดยฟีเจอร์นี้จะโหลดน้ำหนักโมเดลและอิมเมจคอนเทนเนอร์ไว้ล่วงหน้าบนโหนดของคลัสเตอร์ ทำให้พอดสามารถอ่านข้อมูลจากสตอเรจ NVMe ภายในเครื่องด้วยความเร็วประมาณ 7 กิกะไบต์ต่อวินาที แทนที่จะต้องดาวน์โหลดผ่านเครือข่าย ส่งผลให้พอดมักเริ่มให้บริการทราฟฟิกได้ภายในไม่กี่วินาที แทนที่จะใช้เวลาหลักสิบนาทีตามที่ AWS ระบุ

อ่าน 5 นาที

Databricks เปิดเผยรายละเอียดระบบ Proteus สำหรับการสร้างเคอร์เนล GPU เฉพาะทาง

Databricks unveiled Proteus, a system that uses agents to generate specialized GPU kernels and subjects candidates to controlled validation and repeated benchmarking. The company says individual kernels generated for Qwen 3.5 122B were 1.8 to 5.2 times faster than the best implementations available in vLLM.

อ่าน 2 นาที

Anthropic เลือก Google Cloud หนุนการพัฒนา Claude

Anthropic เลือก Google Cloud เป็นผู้ให้บริการคลาวด์ ภายใต้ความร่วมมือที่ประกาศเมื่อวันที่ 3 กุมภาพันธ์ 2023 ทั้งสองบริษัทมีแผนร่วมกันพัฒนาระบบคอมพิวเตอร์สำหรับ AI ขณะที่ Anthropic ระบุว่าจะใช้คลัสเตอร์ GPU และ TPU ของ Google Cloud ในการฝึกฝน ขยายขนาด และนำระบบ AI ของตนไปใช้งาน รวมถึง Claude

อ่าน 4 นาที

วิเคราะห์: การรันโมเดลโอเพนเวทเองบนเซิร์ฟเวอร์ตัวเอง — สมการที่ตัดสินความคุ้มค่า และต้นทุนที่ไม่มีใครตั้งงบไว้ล่วงหน้า

คุ้มก็ต่อเมื่อมีอัตราการใช้งานสูงและสม่ำเสมอเท่านั้น การรันเองคือการเปลี่ยนต้นทุนผันแปรต่อโทเคนให้กลายเป็นต้นทุนคงที่รายชั่วโมง จึงจะคุ้มค่าเมื่อตัวเร่งประมวลผลทำงานแทบตลอดเวลา แต่จะขาดทุนหนักเมื่อปล่อยให้ว่างงาน การเปรียบเทียบที่ตรงไปตรงมาต้องคิดต้นทุนทั้งระบบ ทั้งชั่วโมงการใช้ตัวเร่งประมวลผล ระบบสำรอง เวลาทำงานของทีมวิศวกร และงานประเมินผลที่ต้องใช้ยืนยันว่าโมเดลขนาดเล็กกว่านั้นดีพอ แล้วนำไปเทียบกับค่าใช้จ่าย API สำหรับปริมาณการใช้งานเท่ากัน ส่วนเรื่องอธิปไตยของข้อมูล ข้อกำหนดที่ตั้งจัดเก็บข้อมูล และเพดานความหน่วงต่ำสุด เป็นเหตุผลแยกต่างหากที่อาจสนับสนุนการรันเองได้ ไม่ว่าผลการคำนวณจะออกมาอย่างไรก็ตาม

อ่าน 16 นาที

ทำไม AI จึงใช้ไฟฟ้ามากขนาดนั้น?

อุปกรณ์เร่งประมวลผล AI ใช้พลังงานต่อตู้มากกว่าอุปกรณ์เซิร์ฟเวอร์แบบดั้งเดิมหลายเท่า และพลังงานนั้นต้องจ่ายส่งมอบ คลายความร้อน และชำระค่าใช้จ่ายตลอดเวลา การฝึกโมเดลขนาดใหญ่เป็นการพีคพลังงานชั่วคราวเพียงครั้งเดียว; การให้บริการโมเดลนั้นแก่ผู้ใช้หลายล้านคนเป็นภาระคงที่ตลอดเวลา และการทำนายเป็นส่วนที่ใช้พลังงานส่วนใหญ่ในช่วงชีวิตของโมเดลที่ถูกนำไปใช้งาน

อ่าน 10 นาที