
ที่มาภาพ: XDA Developers
รัน AI บน NAS UGREEN DXP4800 Pro ด้วย CPU อย่างเดียว ที่ 5 token/วินาที
⚡ สรุป 30 วิ
ผู้ใช้ทดลองรันโมเดล AI บน NAS รุ่น UGREEN DXP4800 Pro โดยไม่มี GPU พบอัตราการสร้าง token ประมาณ 5 token ต่อวินาที…
Lead paragraph ผู้ใช้ได้ทดลองรันโมเดล AI บนเครื่อง NAS รุ่น UGREEN DXP4800 Pro ที่ไม่มี GPU แยก และพบว่าการทำงานด้วยการประมวลผลบน CPU อย่างเดียวให้ความเร็วประมาณ 5 token ต่อวินาที แม้ต้องรอคอยนานกว่าที่คาดหวัง แต่ก็พิสูจน์ได้ว่าเทคโนโลยี AI สามารถใช้งานได้จริงในสภาพแวดล้อมที่ไม่ออกแบบมาสำหรับการประมวลผลเชิงลึกนี้
Overview
NAS (Network‑Attached Storage) มักถูกใช้เพื่อเก็บข้อมูลและให้บริการไฟล์เครือข่ายเป็นหลัก การนำ NAS มาใช้เป็นแพลตฟอร์มสำหรับ AI inference จึงถือเป็นการทดลองที่ค่อนข้างแปลกใหม่ ผู้เขียนระบุว่าเครื่อง UGREEN DXP4800 Pro ไม่มี GPU แยก ซึ่งตามแนวคิดทั่วไปแล้ว AI โมเดลโดยเฉพาะรุ่นใหญ่ต้องอาศัยกราฟิกการ์ดเพื่อให้ได้ประสิทธิภาพที่เหมาะสม อย่างไรก็ตาม การทดลองนี้มุ่งเน้นไปที่ความเป็นไปได้และประโยชน์เชิงปฏิบัติของการใช้ CPU เพียงอย่างเดียว
จากบทความ ผู้เขียนเลือกติดตั้งซอฟต์แวร์ Ollama ซึ่งเป็น runtime สำหรับโมเดลภาษาเปิด‑source และต่อด้วย Open WebUI เพื่อให้มีอินเตอร์เฟซเว็บที่ใช้งานง่าย ขั้นตอนเหล่านี้ทำให้ NAS สามารถดึงโมเดลขนาดเล็ก (ประมาณ 4 billion parameters) มารันได้โดยไม่ต้องพึ่งพา GPU
Setup
การเตรียมระบบเริ่มต้นด้วยการติดตั้ง Ollama บน NAS ซึ่งรองรับสถาปัตยกรรม x86_64 ของ CPU ที่มีอยู่ จากนั้นผู้ใช้ทำการเชื่อมต่อ Open WebUI เข้ากับ Ollama ผ่าน API endpoint ภายในเครือข่ายท้องถิ่น การตั้งค่านี้ไม่จำเป็นต้องปรับแต่งพิเศษหรือเพิ่มฮาร์ดแวร์เสริมใด ๆ
- ดาวน์โหลดและติดตั้งแพ็คเกจ Ollama จากที่จัดทำโดยผู้พัฒนา
- ตั้งค่า Open WebUI ให้ชี้ไปยัง URL ของ Ollama บน NAS
- ดึงโมเดลขนาด 4 B พารามิเตอร์ลงมาโดยใช้คำสั่งของ Ollama
ขั้นตอนเหล่านี้เสร็จสมบูรณ์ภายในไม่กี่นาที และทำให้ระบบพร้อมใช้งานทันที แม้จะเป็นการรันบน CPU เท่านั้น แต่กระบวนการตั้งค่าไม่ได้ซับซ้อนจนเกินความสามารถของผู้ใช้ระดับกลาง
Performance
ผลลัพธ์ที่ได้แสดงให้เห็นว่า อัตราการสร้าง token อยู่ที่ประมาณ 5 token/วินาที ซึ่งค่อนข้างช้าเมื่อเทียบกับ GPU‑accelerated inference ที่มักให้ค่ามากกว่าหลายสิบหรือหลายร้อย token ต่อวินาที อย่างไรก็ตาม ความเร็วนี้เพียงพอสำหรับการทดลองและการใช้งานที่ไม่ต้องการตอบสนองแบบเรียลไทม์
ผู้เขียนยอมรับว่าการรอคอยระหว่างคำสั่งต่อเนื่องนั้นยาวนานกว่าที่คาดหวัง แต่ก็ยังสามารถทำงานได้โดยไม่มีข้อผิดพลาดหรือความขัดข้องของระบบ นอกจากนี้ การใช้โมเดลขนาดเล็กช่วยลดภาระการใช้หน่วยความจำและเวลาในการโหลดโมเดล ทำให้ NAS สามารถทำงานต่อเนื่องเป็นชั่วโมงโดยไม่เกิดอาการหยุดทำงาน
Use Cases
แม้ว่าประสิทธิภาพจะไม่ได้สูงสุด แต่ก็มีกรณีการใช้งานที่เหมาะสมกับสภาวะนี้ ตัวอย่างเช่น การสร้างสรุปข้อมูลหรือบันทึกข้อความขนาดสั้น ๆ ที่ไม่ต้องการความเร็วสูง ผู้ใช้สามารถตั้งค่า prompt ที่สั้นและคาดหวังผลลัพธ์ในระดับหนึ่งได้โดยไม่มีค่าใช้จ่ายเพิ่มเติมจากคลาวด์
อีกด้านหนึ่งคือการใช้งานภายในองค์กรที่ต้องการเก็บข้อมูลสำคัญไว้บน NAS เท่านั้น เพื่อความเป็นส่วนตัว การรัน AI บนเครื่องเดียวกันกับที่จัดเก็บไฟล์ทำให้ไม่ต้องส่งข้อมูลออกไปยังบริการออนไลน์ใด ๆ ซึ่งลดความเสี่ยงด้านความปลอดภัยและช่วยปฏิบัติตามข้อกำหนดการคุ้มครองข้อมูลส่วนบุคคล
Analysis
จากมุมมองของเทคโนโลยี การทดลองนี้ชี้ให้เห็นว่า CPU‑only inference สามารถทำงานได้แม้บนอุปกรณ์ที่ไม่ได้ออกแบบมาเพื่อ AI อย่างเฉพาะเจาะจง ความสำเร็จขึ้นอยู่กับการเลือกโมเดลขนาดเล็กและซอฟต์แวร์ที่มีประสิทธิภาพเช่น Ollama ที่สามารถจัดการทรัพยากรระบบได้ดี
อย่างไรก็ตาม ประสิทธิภาพที่ 5 token/วินาที ยังคงเป็นข้อจำกัดสำคัญสำหรับงานที่ต้องการผลลัพธ์เร็วหรือโต้ตอบต่อผู้ใช้แบบเรียลไทม์ การใช้งานในระดับนี้จึงเหมาะกับงานเบื้องหลัง (batch) หรือสคริปต์อัตโนมัติที่ยอมรับเวลาในการประมวลผลเพิ่มขึ้น
อีกประเด็นหนึ่งคือ ต้นทุนพลังงาน เนื่องจาก NAS ทำงานตลอด 24 ชั่วโมง การรัน AI บน CPU เพิ่มภาระการใช้ไฟฟ้าโดยตรง ซึ่งผู้ใช้อาจต้องคำนึงถึงค่าใช้จ่ายด้านพลังงานในระยะยาว
Impact
ผลกระทบของการทดลองนี้อาจทำให้ผู้ใช้ NAS พิจารณาเพิ่มความสามารถ AI เข้าไปเป็นส่วนหนึ่งของโครงสร้างพื้นฐานที่มีอยู่แล้ว โดยไม่จำเป็นต้องลงทุนใน GPU หรือคลาวด์คอมพิวติ้ง นอกจากนี้ การเปิดเผยขั้นตอนและผลลัพธ์อย่างละเอียดยังช่วยกระตุ้นชุมชนโอเพ่นซอร์สให้พัฒนาเครื่องมือเพิ่มประสิทธิภาพการรันโมเดลบน CPU ต่อไป
สำหรับอุตสาหกรรมเทคโนโลยีสารสนเทศในประเทศไทย การใช้ NAS ร่วมกับ AI แบบ on‑premise สามารถเป็นทางเลือกที่เหมาะสมในการรักษาข้อมูลสำคัญภายในประเทศ ลดความเสี่ยงจากการส่งข้อมูลข้ามพรมแดน และสนับสนุนแนวคิด “Data sovereignty” อย่างต่อเนื่อง
Summary
ผู้ทดลองยืนยันว่า AI inference บน NAS UGREEN DXP4800 Pro สามารถทำงานได้แม้ไม่มี GPU โดยให้ความเร็วประมาณ 5 token ต่อวินาที แม้ต้องรอคอยมากกว่าที่คาดหวัง แต่ก็เพียงพอสำหรับการใช้งานบางประเภท การทดลองนี้แสดงศักยภาพของ CPU‑only AI ในสภาพแวดล้อมที่เน้นความเป็นส่วนตัวและต้นทุนต่ำ.
แชร์บทความนี้:
ชอบบทความแบบนี้?
สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม
แหล่งข่าวต้นฉบับ
- ชื่อต้นฉบับ
- I'm running AI on my NAS at 5 tokens per second, and it's surprisingly useful
- ผู้เขียน
- Jeff Butts
- แหล่ง
- XDA Developers
- วันที่เผยแพร่
- 2 สิงหาคม 2569 เวลา 18:30



