
ที่มาภาพ: TechRadar
AMD กับ Cerebras ประสานเทคโนโลยีเพื่อ Inference แบบ Disaggregated
⚡ สรุป 30 วิ
AMD กับ Cerebras เปิดตัวระบบ ‘disaggregated inference’ ให้ Helios จัด pre‑fill ส่วน WSE ทำ decode ส่งผลเพิ่ม TPS/W หลายเท่าและลดต้นทุนเมื่อตีกับโซลูชันของ…
AMD และ Cerebras Systems ประกาศความร่วมมือด้านเทคนิคเพื่อแบ่งงาน inference ระหว่างระบบ Helios rackscale ของ AMD กับ Wa‑Scale Engine (WSE) ของ Cerebras — โดยมุ่งให้การประมวลผล “prefill” ถูกย้ายไปยัง Helios ส่วน “decode” ยังคงอยู่บน WSE การเปิดตัวนี้คาดว่าจะส่งผลต่อการแข่งขันในตลาด AI inference อย่างมีนัยสำคัญ
Overview
ความร่วมมือครั้งนี้เป็นการผสานเทคโนโลยีของสองบริษัทเพื่อสร้างโซลูชันที่เรียกว่า “disaggregated inference” ซึ่ง AMD จะรับหน้าที่ประมวลผล prompt บน rackscale Helios ส่วน Cerebras จะใช้ WSE สร้าง token ขั้นสุดท้าย ระบบดังกล่าวจะให้บริการผ่าน Cerebras Cloud ตั้งแต่ครึ่งหลังของปี 2026 ทั้งสองบริษัทอธิบายว่าแนวทางนี้ช่วยลดข้อจำกัดด้านประสิทธิภาพที่เคยพบกับการใช้งาน WSE แบบเดี่ยวได้
Technical Partnership Details
ในเชิงสถาปัตยกรรม Helios rackscale มีความสามารถในการจัดเก็บข้อมูลและดำเนินการ pre‑fill ที่ต้องใช้หน่วยความจำจำนวนมากโดยไม่กระทบต่อพลังงาน ระบบนี้ทำหน้าที่เป็น “front‑end” ของโมเดล AI ก่อนส่งผลลัพธ์ไปยัง WSE ซึ่งรับผิดชอบส่วน decode ซึ่งเป็นขั้นตอนที่ Cerebras มีประสิทธิภาพสูงอยู่แล้ว การผสานเช่นนี้ทำให้การใช้ **tokens per second per watt (TPS/W) เพิ่มขึ้นอย่างมีนัยสำคัญ
- **5× TPS/W เมื่อเทียบกับการใช้งาน WSE เพียงอย่างเดียวในขั้นตอน internal testing
- ใช้โมเดล Kimi 2.6 1T (mixture‑of‑experts) ที่เปิดตัวเมื่อ 20 เมษายน 2026
- โมเดลทำงานที่ระดับ INT4 โดยมีน้ำหนักทั้งหมดประมาณ 500 GB
Performance Claims & Benchmarks
การทดสอบภายในของ AMD และ Cerebras แสดงให้เห็นว่า ระบบผสมผสานสามารถผลิตโทเคนได้เร็วกว่าเดิมถึงห้าครั้งต่อวัตต์เมื่อทำงานกับโมเดล Kimi 2.6 ที่ใช้ 32 billion พารามิเตอร์ต่อ token แม้ว่าการเปรียบเทียบนี้จะอิงฐานเป็น WSE เดียวโดยไม่มีการเทียบกับโซลูชัน rackscale ของ Nvidia ทำให้ข้อมูลด้านประสิทธิภาพยังต้องได้รับการตรวจสอบเพิ่มเติม
โมเดล Kimi 2.6 มีขนาด 500 GB ที่ระดับ INT4 ซึ่งเกินความจุของ wafer‑scale engine เพียง 44 GB ต่อ wafer การจัดเก็บทั้งหมดจึงต้องใช้ “wafer” มากกว่าหนึ่งสิบแผ่น ในขณะที่ Helios rack สามารถบรรจุข้อมูลได้หลายร้อยเท่าของความจุดังกล่าว ทำให้ข้อจำกัดด้าน memory bandwidth ของ WSE ลดลงอย่างมีนัยสำคัญ
Market Context & Financial Implications
เมื่อปลายปี 2023 Nvidia จ่าย $20 billion เพื่อรับไลเซนส์เทคโนโลยี SRAM decode** จากสตาร์ทอัพ Groq การลงทุนนี้เป็นการยืนยันว่าเทคโนโลยี decode มีความสำคัญต่อการแข่งขัน AI inference อย่างไรบ้าง AMD สามารถเข้าถึงเทคโนโลยีเดียวกันผ่านพันธมิตรโดยไม่ต้องใช้เงินจำนวนดังกล่าว ซึ่งอาจทำให้ต้นทุนรวมของโซลูชันลดลงอย่างมีนัยสำคัญ
ข้อมูลการเงินยังไม่ได้เปิดเผยในขณะนี้ แต่ตลาดได้จับตามองความเคลื่อนไหวของหุ้นที่เกี่ยวข้อง: หลังจากจดทะเบียนบน Nasdaq ในเดือนพฤษภาคม 2026 ราคาหุ้น Cerebras ตั้งต้นที่ $185, เปิดตัวที่ $350, ปิดวันแรกที่ $311.07 และลดลงสู่ระดับประมาณ $227 จนถึงปลายมิถุนายน 2026 ส่วนหุ้นของ AMD เติบโตกว่า **121 % ตลอดปี เนื่องจากนักลงทุนมองว่าโซลูชัน Instinct AI ของบริษัทเป็นแรงขับเคลื่อนหลัก
Industry Reactions & Outlook
ผู้สังเกตการณ์ตลาดไอทีระบุว่าการผสาน Helios กับ WSE แสดงให้เห็นถึงแนวโน้ม “disaggregation” ที่เพิ่มความยืดหยุ่นในการออกแบบระบบ AI inference แม้จะยังไม่มีการเปิดเผยตัวเลขเปรียบเทียบกับโซลูชันของ Nvidia อย่างเป็นทางการ การทดสอบเพิ่มเติมบนโมเดลที่มีขนาดแตกต่างกัน (เช่น โมเดลหนาแน่นที่สามารถอยู่ในหลาย wafer) จะช่วยให้เห็นภาพรวมของประสิทธิภาพได้ชัดเจนยิ่งขึ้น
นอกจากนี้ ความกังวลเกี่ยวกับ “circular financing” ในอุตสาหกรรม AI ยังคงมีอยู่ เนื่องจาก Nvidia เพิ่งสนับสนุนการซื้อศูนย์ข้อมูลของ OpenAI ซึ่งตลาดมองว่าเป็นความเสี่ยงต่อการใช้เงินทุนในระดับมหาศาล AMD ก็เคยเชื่อมโยงการขายฮาร์ดแวร์กับการลงทุนหรือสัดส่วนหุ้นในบริษัท AI (เช่น Anthropic) ทำให้ผู้ลงทุนอาจเฝ้าติดตามเงื่อนไขทางการเงินของความร่วมมือครั้งนี้อย่างใกล้ชิด
Summary
AMD และ Cerebras เปิดตัวโซลูชัน inference แยกงานที่คาดว่าจะให้ประสิทธิภาพสูงกว่าเดิมถึง **5× ในแง่ของ TPS/W โดยใช้โมเดล Kimi 2.6 เป็นฐาน แม้ว่ายังไม่มีข้อมูลการเงินหรือเปรียบเทียบกับ Nvidia อย่างเป็นทางการ ความเคลื่อนไหวนี้สะท้อนแนวโน้มการพัฒนา AI inference ที่มุ่งเน้นความยืดหยุ่นและต้นทุนที่ต่ำลงในอุตสาหกรรม.
แชร์บทความนี้:
ชอบบทความแบบนี้?
สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม
แหล่งข่าวต้นฉบับ
- ชื่อต้นฉบับ
- Nvidia paid $20 billion for SRAM decode - AMD just partnered for it instead
- ผู้เขียน
- Rahim Amir
- แหล่ง
- TechRadar
- วันที่เผยแพร่
- 29 กรกฎาคม 2569 เวลา 07:35



