
ที่มาภาพ: XDA Developers
บีบอัดโมเดล LLM ขนาด 28.9 ล้านพารามิเตอร์บน ESP32‑S3 ทำให้ Edge AI เป็นไปได้
⚡ สรุป 30 วิ
นักพัฒนาบีบอัด LLM ขนาด 28.9 ล้านพารามิเตอร์ลงบน ESP32‑S3 ด้วย quantization 4‑bit ทำให้อุปกรณ์กระเป๋าสร้างข้อความคุณภาพได้ในไม่กี่วินาที. แม้มีกำหนด context…
Lead: นักพัฒนาได้ประสบความสำเร็จในการบีบอัดโมเดลภาษา LLM ขนาด 28.9 ล้านพารามิเตอร์ ลงบนชิปไมโครคอนโทรลเลอร์ ESP32‑S3** เพียงตัวเดียว ทำให้เครื่องมือขนาดกระเป๋าสามารถสร้างเรื่องสั้นคุณภาพได้อย่างอิสระ การทำเช่นนี้เปิดประเด็นใหม่เกี่ยวกับศักยภาพของ AI บนอุปกรณ์ขอบ (edge) ที่เคยจำกัดด้วยทรัพยากร
Overview
การพยายามนำ LLM ไปใช้งานบนฮาร์ดแวร์ที่มีขนาดเล็กไม่ได้เป็นเรื่องใหม่ ตั้งแต่ช่วงแรก ๆ ของกระแส AI สาธารณะ นักวิจัยและผู้ทำงาน DIY ได้ทดลองใช้ Raspberry Pi และบอร์ด ESP32 รุ่นเก่าเพื่อรันโมเดลภาษาขนาดเล็ก ผลลัพธ์มักต้องแลกกับความเร็วที่ช้า หรือคุณภาพข้อความที่ลดลงอย่างเห็นได้ชัด
ในบทความล่าสุดของ XDA‑Developers ผู้เขียนได้แสดงขั้นตอนการคอมไพล์และแฟลชโมเดล 28.9 M บน ESP32‑S3 โดยใช้เทคนิคการบีบอัดข้อมูล (quantization) และการปรับแต่งหน่วยความจำอย่างละเอียด การทดสอบแรกแสดงให้เห็นว่าอุปกรณ์สามารถสร้างเรื่องสั้นหลายย่อหน้าภายในเวลาไม่กี่วินาที ซึ่งถือเป็นการพิสูจน์แนวคิดที่สำคัญสำหรับ AI บนอุปกรณ์ขอบ
Technical Details
โมเดลที่ใช้มีจำนวนพารามิเตอร์ทั้งหมด 28.9 ล้าน ตัว หลังจากผ่านกระบวนการ quantization ให้เหลือ 4‑bit ทำให้ขนาดไฟล์ลดลงเป็นประมาณ 12 เมกะไบต์ การจัดเก็บบน ESP32‑S3 จำเป็นต้องอาศัยหน่วยความจำภายนอก (PSRAM) ขนาด 8 เมกะไบต์ เพื่อรองรับโมเดลและบัฟเฟอร์ข้อมูล
ชิป ESP32‑S3 มีคอร์ Xtensa LX7 สองตัวที่ทำงานได้สูงสุด 240 MHz พร้อม SRAM ภายใน 512 KB และการสนับสนุน Wi‑Fi/BLE ซึ่งเพียงพอสำหรับการประมวลผล inference ของโมเดลขนาดเล็กนี้ การรัน inference ถูกจัดการผ่านไลบรารี GGML ที่ออกแบบมาเพื่อให้ทำงานได้บนสถาปัตยกรรม MCU โดยไม่ต้องใช้ GPU หรือ NPU เพิ่มเติม
- โมเดล: 28.9 M parameters 12 MB หลัง quantization (4‑bit)
- ฮาร์ดแวร์: ESP32‑S3, dual‑core 240 MHz, 512 KB SRAM, 8 MB PSRAM
- ไลบรารี: GGML (no external dependencies)
Development Process
กระบวนการเริ่มต้นจากการเลือกโมเดลฐานที่เปิดให้ใช้ได้ฟรี จากนั้นทำการแปลงเป็นรูปแบบ ggml โดยใช้สคริปต์ Python ที่มาพร้อมกับโครงการ ผู้พัฒนายังต้องปรับค่า context window ให้เหมาะสมกับหน่วยความจำของ ESP32‑S3 เพื่อหลีกเลี่ยงการ overflow
ต่อมาได้ทำการคอมไพล์โค้ด C/C++ ด้วย toolchain ของ Espressif ที่รองรับ idf v5.0 การตั้งค่าการเชื่อมต่อ PSRAM เป็นสิ่งสำคัญเพื่อให้ระบบปฏิบัติการเรียกใช้โมเดลได้อย่างราบรื่น หลังจากแฟลชเฟิร์มแวร์ลงบนบอร์ดแล้ว ผู้พัฒนาทดสอบโดยส่งคำสั่งข้อความผ่าน UART หรือ Wi‑Fi API แล้วรับผลลัพธ์ที่สร้างขึ้นโดยโมเดล
ขั้นตอนทั้งหมดถูกอธิบายไว้ใน repository ของโครงการ พร้อมไฟล์ตัวอย่างและเอกสารการตั้งค่า ทำให้ผู้สนใจสามารถทำซ้ำได้โดยไม่ต้องมีความเชี่ยวชาญเฉพาะด้าน AI หรือ embedded systems อย่างลึกซึ้ง
Performance & Limitations
แม้ว่าโมเดลจะสร้างข้อความที่ต่อเนื่องและสอดคล้องกับบริบทได้ดี แต่การประมวลผลยังคงใช้เวลาประมาณ 2‑3 วินาที ต่อ 50 คำ ซึ่งช้าเมื่อเทียบกับเซิร์ฟเวอร์ GPU อย่างไรก็ตาม ความเร็วนี้ถือว่าเพียงพอสำหรับแอปพลิเคชันที่ไม่ต้องการตอบสนองแบบเรียลไทม์ เช่น การสร้างสคริปต์สั้น ๆ หรือข้อความแจ้งเตือน
ข้อจำกัดสำคัญอีกประการคือ ขนาดของ context window ที่ลดลงเหลือประมาณ 256‑token ทำให้โมเดลไม่สามารถจัดการกับบทสนทนายาวหรือข้อมูลที่ต้องอ้างอิงหลายรอบได้ นอกจากนี้ การใช้ PSRAM ภายนอกทำให้พลังงานไฟฟ้าของบอร์ดเพิ่มขึ้น ซึ่งอาจส่งผลต่ออายุการใช้งานของแบตเตอรี่ในโครงการ IoT ที่ต้องการความประหยัดพลังงานสูง
Implications for Edge AI
การที่โมเดล LLM ขนาดหลายสิบล้านพารามิเตอร์สามารถทำงานบน ESP32‑S3 ได้หมายถึงศักยภาพใหม่สำหรับอุปกรณ์ขอบ (edge) ที่ไม่ต้องพึ่งพาคลาวด์เพื่อประมวลผลภาษาธรรมชาติ ผู้ผลิตอาจนำเทคโนโลยีนี้ไปใช้ในเครื่องมือสื่อสารอัตโนมัติ, ระบบตอบรับเสียงในบ้าน, หรืออุปกรณ์สุขภาพที่ต้องรักษาความเป็นส่วนตัวของข้อมูลผู้ใช้
นอกจากนี้ การเปิดเผยขั้นตอนและโค้ดให้ชุมชนสามารถเข้าถึงได้แล้ว ยังช่วยกระตุ้นการพัฒนาโมเดล “tiny‑LLM” ที่เหมาะกับ MCU อื่น ๆ เช่น RP2040 หรือ nRF5340 ในระยะยาวอาจทำให้ตลาด IoT มีผลิตภัณฑ์ที่ใช้ AI อย่างแพร่หลายโดยไม่ต้องลงทุนในโครงสร้างพื้นฐานคลาวด์ขนาดใหญ่
Summary
การบีบอัด LLM ขนาด 28.9 M ลงบน ESP32‑S3 แสดงให้เห็นว่าการประมวลผลภาษาธรรมชาติระดับโมเดลเล็ก ๆ สามารถทำงานได้บนฮาร์ดแวร์ที่มีทรัพยากรจำกัด ความสำเร็จนี้เปิดโอกาสใหม่สำหรับการพัฒนาแอปพลิเคชัน AI บนอุปกรณ์ขอบ โดยยังคงต้องเผชิญกับข้อจำกัดด้านความเร็วและหน่วยความจำในขั้นต่อไป.
แชร์บทความนี้:
ชอบบทความแบบนี้?
สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม
แหล่งข่าวต้นฉบับ
- ชื่อต้นฉบับ
- Someone squeezed a 28.9M LLM onto an ESP32-S3, and so can you
- ผู้เขียน
- Simon Batt
- แหล่ง
- XDA Developers
- วันที่เผยแพร่
- 24 กรกฎาคม 2569 เวลา 08:46



