AMD กับ Cerebras ประสานเทคโนโลยีเพื่อ Inference แบบ Disaggregated

ที่มาภาพ: TechRadar

AI-อ่าน 6 นาทีTechRadar

AMD กับ Cerebras ประสานเทคโนโลยีเพื่อ Inference แบบ Disaggregated

⚡ สรุป 30 วิ

AMD กับ Cerebras เปิดตัวระบบ ‘disaggregated inference’ ให้ Helios จัด pre‑fill ส่วน WSE ทำ decode ส่งผลเพิ่ม TPS/W หลายเท่าและลดต้นทุนเมื่อตีกับโซลูชันของ…

AMD และ Cerebras Systems ประกาศความร่วมมือด้านเทคนิคเพื่อแบ่งงาน inference ระหว่างระบบ Helios rackscale ของ AMD กับ Wa‑​Scale Engine (WSE) ของ Cerebras — โดยมุ่งให้การประมวลผล “prefill” ถูกย้ายไปยัง Helios ส่วน “decode” ยังคงอยู่บน WSE การเปิดตัวนี้คาดว่าจะส่งผลต่อการแข่งขันในตลาด AI inference อย่างมีนัยสำคัญ

Overview

ความร่วมมือครั้งนี้เป็นการผสานเทคโนโลยีของสองบริษัทเพื่อสร้างโซลูชันที่เรียกว่า “disaggregated inference” ซึ่ง AMD จะรับหน้าที่ประมวลผล prompt บน rackscale Helios ส่วน Cerebras จะใช้ WSE สร้าง token ขั้นสุดท้าย ระบบดังกล่าวจะให้บริการผ่าน Cerebras Cloud ตั้งแต่ครึ่งหลังของปี 2026 ทั้งสองบริษัทอธิบายว่าแนวทางนี้ช่วยลดข้อจำกัดด้านประสิทธิภาพที่เคยพบกับการใช้งาน WSE แบบเดี่ยวได้

Technical Partnership Details

ในเชิงสถาปัตยกรรม Helios rackscale มีความสามารถในการจัดเก็บข้อมูลและดำเนินการ pre‑fill ที่ต้องใช้หน่วยความจำจำนวนมากโดยไม่กระทบต่อพลังงาน ระบบนี้ทำหน้าที่เป็น “front‑end” ของโมเดล AI ก่อนส่งผลลัพธ์ไปยัง WSE ซึ่งรับผิดชอบส่วน decode ซึ่งเป็นขั้นตอนที่ Cerebras มีประสิทธิภาพสูงอยู่แล้ว การผสานเช่นนี้ทำให้การใช้ **tokens per second per watt (TPS/W) เพิ่มขึ้นอย่างมีนัยสำคัญ

  • **5× TPS/W เมื่อเทียบกับการใช้งาน WSE เพียงอย่างเดียวในขั้นตอน internal testing
  • ใช้โมเดล Kimi 2.6 1T (mixture‑of‑experts) ที่เปิดตัวเมื่อ 20 เมษายน 2026
  • โมเดลทำงานที่ระดับ INT4 โดยมีน้ำหนักทั้งหมดประมาณ 500 GB

Performance Claims & Benchmarks

การทดสอบภายในของ AMD และ Cerebras แสดงให้เห็นว่า ระบบผสมผสานสามารถผลิตโทเคนได้เร็วกว่าเดิมถึงห้าครั้งต่อวัตต์เมื่อทำงานกับโมเดล Kimi 2.6 ที่ใช้ 32 billion พารามิเตอร์ต่อ token แม้ว่าการเปรียบเทียบนี้จะอิงฐานเป็น WSE เดียวโดยไม่มีการเทียบกับโซลูชัน rackscale ของ Nvidia ทำให้ข้อมูลด้านประสิทธิภาพยังต้องได้รับการตรวจสอบเพิ่มเติม

โมเดล Kimi 2.6 มีขนาด 500 GB ที่ระดับ INT4 ซึ่งเกินความจุของ wafer‑scale engine เพียง 44 GB ต่อ wafer การจัดเก็บทั้งหมดจึงต้องใช้ “wafer” มากกว่าหนึ่งสิบแผ่น ในขณะที่ Helios rack สามารถบรรจุข้อมูลได้หลายร้อยเท่าของความจุดังกล่าว ทำให้ข้อจำกัดด้าน memory bandwidth ของ WSE ลดลงอย่างมีนัยสำคัญ

Market Context & Financial Implications

เมื่อปลายปี 2023 Nvidia จ่าย $20 billion เพื่อรับไลเซนส์เทคโนโลยี SRAM decode** จากสตาร์ทอัพ Groq การลงทุนนี้เป็นการยืนยันว่าเทคโนโลยี decode มีความสำคัญต่อการแข่งขัน AI inference อย่างไรบ้าง AMD สามารถเข้าถึงเทคโนโลยีเดียวกันผ่านพันธมิตรโดยไม่ต้องใช้เงินจำนวนดังกล่าว ซึ่งอาจทำให้ต้นทุนรวมของโซลูชันลดลงอย่างมีนัยสำคัญ

ข้อมูลการเงินยังไม่ได้เปิดเผยในขณะนี้ แต่ตลาดได้จับตามองความเคลื่อนไหวของหุ้นที่เกี่ยวข้อง: หลังจากจดทะเบียนบน Nasdaq ในเดือนพฤษภาคม 2026 ราคาหุ้น Cerebras ตั้งต้นที่ $185, เปิดตัวที่ $350, ปิดวันแรกที่ $311.07 และลดลงสู่ระดับประมาณ $227 จนถึงปลายมิถุนายน 2026 ส่วนหุ้นของ AMD เติบโตกว่า **121 % ตลอดปี เนื่องจากนักลงทุนมองว่าโซลูชัน Instinct AI ของบริษัทเป็นแรงขับเคลื่อนหลัก

Industry Reactions & Outlook

ผู้สังเกตการณ์ตลาดไอทีระบุว่าการผสาน Helios กับ WSE แสดงให้เห็นถึงแนวโน้ม “disaggregation” ที่เพิ่มความยืดหยุ่นในการออกแบบระบบ AI inference แม้จะยังไม่มีการเปิดเผยตัวเลขเปรียบเทียบกับโซลูชันของ Nvidia อย่างเป็นทางการ การทดสอบเพิ่มเติมบนโมเดลที่มีขนาดแตกต่างกัน (เช่น โมเดลหนาแน่นที่สามารถอยู่ในหลาย wafer) จะช่วยให้เห็นภาพรวมของประสิทธิภาพได้ชัดเจนยิ่งขึ้น

นอกจากนี้ ความกังวลเกี่ยวกับ “circular financing” ในอุตสาหกรรม AI ยังคงมีอยู่ เนื่องจาก Nvidia เพิ่งสนับสนุนการซื้อศูนย์ข้อมูลของ OpenAI ซึ่งตลาดมองว่าเป็นความเสี่ยงต่อการใช้เงินทุนในระดับมหาศาล AMD ก็เคยเชื่อมโยงการขายฮาร์ดแวร์กับการลงทุนหรือสัดส่วนหุ้นในบริษัท AI (เช่น Anthropic) ทำให้ผู้ลงทุนอาจเฝ้าติดตามเงื่อนไขทางการเงินของความร่วมมือครั้งนี้อย่างใกล้ชิด

Summary

AMD และ Cerebras เปิดตัวโซลูชัน inference แยกงานที่คาดว่าจะให้ประสิทธิภาพสูงกว่าเดิมถึง **5× ในแง่ของ TPS/W โดยใช้โมเดล Kimi 2.6 เป็นฐาน แม้ว่ายังไม่มีข้อมูลการเงินหรือเปรียบเทียบกับ Nvidia อย่างเป็นทางการ ความเคลื่อนไหวนี้สะท้อนแนวโน้มการพัฒนา AI inference ที่มุ่งเน้นความยืดหยุ่นและต้นทุนที่ต่ำลงในอุตสาหกรรม.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
Nvidia paid $20 billion for SRAM decode - AMD just partnered for it instead
ผู้เขียน
Rahim Amir
แหล่ง
TechRadar
วันที่เผยแพร่
29 กรกฎาคม 2569 เวลา 07:35

Related

บทความที่เกี่ยวข้อง

AMD เปิดตัวชิป X100 Strix Halo สำหรับ AI กายภาพรวม CPU Zen 5, GPU RDNA 3.5 และ NPU XDNA 2.AI
26 กรกฎาคม 2569 เวลา 00:30

AMD เปิดตัวชิป X100 Strix Halo สำหรับ AI กายภาพรวม CPU Zen 5, GPU RDNA 3.5 และ NPU XDNA 2.

AMD เปิดตัวซีรีส์ X100 ที่รวม Zen 5, RDNA 3.5 และ NPU XDNA 2 เพื่อท้าทาย Panther Lake ของ Intel. ชิปรองรับความเร็วสูงถึง 5.1 GHz, หน่วยความจำรวม 128 GB…

Tom's Hardware6 นาที
ทดสอบ DLSS 4.5 vs FSR 4 แบบบลายด์ ผลไม่แตกต่างอย่างชัดเจนAI
15 กรกฎาคม 2569 เวลา 01:00

ทดสอบ DLSS 4.5 vs FSR 4 แบบบลายด์ ผลไม่แตกต่างอย่างชัดเจน

การทดสอบเปรียบเทียบ DLSS 4.5 กับ FSR 4 ในเกมของผู้เขียนแสดงว่าภาพและ FPS ใกล้เคียงกัน ไม่พบความแตกต่างอย่างเด่นชัด ผู้ซื้อ GPU…

XDA Developers4 นาที
Intel ยอมรับว่าต้องเร่งพัฒนาผลิตภัณฑ์ใหม่เพื่อก้าวข้าม ARM และ AMD ผ่านตลาด Edge AIAI
-

Intel ยอมรับว่าต้องเร่งพัฒนาผลิตภัณฑ์ใหม่เพื่อก้าวข้าม ARM และ AMD ผ่านตลาด Edge AI

Intel ยอมรับว่าต้องรีบเร่งพัฒนาโปรเซสเซอร์ใหม่เพื่อแข่งขันกับ ARM และ AMD ในยุค Edge AI. แม้รายได้ไตรมาส 2 เติบโต 25% แต่กำไรตาม GAAP ขาดทุน $11 พันล้าน…

The Register5 นาที
Samsung เปิดฟีเจอร์ AI ด้านสุขภาพใน Galaxy Watch Ultra 2 และแอป Samsung HealthAI
28 กรกฎาคม 2569 เวลา 08:30

Samsung เปิดฟีเจอร์ AI ด้านสุขภาพใน Galaxy Watch Ultra 2 และแอป Samsung Health

Samsung เปิดใช้งาน AI ตรวจภาวะหยุดหายใจขณะหลับและจังหวะหัวใจผิดปกติผ่านแอป Samsung Health และ Galaxy Watch Ultra 2.…

TechRadar6 นาที
คัดลอกลิงก์แล้ว!