
ที่มาภาพ: TechRadar
LLM ขนาดเล็กทำงานบน ESP32‑S3 เพียง $10 ให้ความเร็ว 9.88 token ต่อวินาที
⚡ สรุป 30 วิ
slvDev พัฒนาโมเดล LLM 28.9 ล้านพารามิเตอร์ ทำงานอิสระบน ESP32‑S3 ราคา $10 ด้วยเทคนิค quantization 4‑bit เร็ว 9.88 token/วินาที ไม่ต้องเชื่อมอินเทอร์เน็ต
การพัฒนาโมเดลภาษาแบบขนาดเล็กที่ทำงานได้โดยอิสระบนไมโครคอนโทรลเลอร์ราคาเพียง $10 นำเสนอแนวทางใหม่สำหรับการใช้งาน LLM ในอุปกรณ์ฝังตัวอย่าง ESP32‑S3 โดย slvDev สร้างโมเดล 28.9 ล้านพารามิเตอร์ สามารถผลิตข้อความสไตล์ TinyStories ได้ที่อัตรา 9.88 token ต่อวินาที ทั้งหมดดำเนินการภายในชิปโดยไม่ต้องเชื่อมต่ออินเทอร์เน็ต
Overview
โครงการชื่อ esp32‑ai ถูกเปิดเผยบน GitHub เมื่อปลายเดือนกรกฎาคม 2026 ภายใต้สัญญาอนุญาต MIT license โครงการได้รับความสนใจจากชุมชนโอเพ่นซอร์สโดยรวบรวมดาว *Stars* มากกว่า 3,600 ดาวและมีการ Fork เกิน 470 ครั้ง การแสดงผลบนช่อง YouTube ของ Better Stack ยืนยันว่าโมเดลทำงานได้อย่างเต็มที่แม้ในขีดจำกัดของฮาร์ดแวร์
นักพัฒนาชี้ให้เห็นว่าการฝึกโมเดลใช้ชุดข้อมูล TinyStories จาก Microsoft Research ซึ่งเน้นการสร้างเรื่องสั้น ๆ ที่มีความยาวและโครงสร้างง่าย โมเดลนี้ถูกปรับขนาดจากเวอร์ชันเต็มเพื่อให้เข้ากับหน่วยความจำของ ESP32‑S3 ซึ่งมี 512 KB SRAM, 8 MB PSRAM และ 16 MB flash
Technical Approach
การลดขนาดโมเดลทำได้โดยใช้เทคนิค quantization ไปยังความแม่นยำระดับสี่บิต ซึ่งช่วยลดปริมาณหน่วยความจำที่ต้องใช้จากประมาณ 60 MB (สำหรับ 16‑bit) เหลือเพียง ≈ 14.9 MB การจัดเก็บส่วนใหญ่ของพารามิเตอร์ใน flash storage ทำให้สามารถเก็บ ≈ 25 ล้านพารามิเตอร์** (ประมาณ 12 MB ที่สี่บิต) ได้โดยไม่ทำให้แบนด์วิธของ flash กลายเป็นคอขวด
- พารามิเตอร์ฝังตัว (embedding tables) ถูกย้ายไปยัง flash
- หน่วยความจำทำงานระดับหลายชั้น: flash สำหรับพารามิเตอร์ที่อ่านน้อย, PSRAM เก็บ core โมเดลและ output head, SRAM ใช้เก็บ activation และ norm weights
โครงสร้างการเข้าถึงแบบนี้เรียกว่า **Per‑Layer Embeddings (PLE) ซึ่งอ่านค่าจาก flash เพียงประมาณ 450 ไบต์ต่อ token ทำให้กระบวนการคำนวณยังคงอยู่ในระดับที่สามารถทำได้เร็วพอบน ESP32‑S3
Performance & Benchmarks
ผลลัพธ์ของโครงการคือ 9.88 token ต่อวินาที ซึ่งเทียบกับความเร็วในการอ่านปกติของมนุษย์ การแสดงผลนี้ถือว่าพอเพียงสำหรับการสร้างเรื่องสั้น ๆ ในบริบทที่ไม่ต้องการตอบสนองแบบเรียลไทม์ โมเดลยังคงทำงานได้อย่างสมบูรณ์โดยไม่มีข้อมูลออกจากชิป ทำให้เหมาะกับการใช้งานในระบบที่ต้องการความเป็นส่วนตัวสูง
แม้ว่าการย้ายพารามิเตอร์ไปเก็บใน flash จะลดความหน่วงของการเข้าถึง แต่ยังคงมีข้อจำกัดด้านแบนด์วิธเมื่ออ่านบรรทัดต่อบรรทัดอย่างต่อเนื่อง อย่างไรก็ตาม การออกแบบ PLE ช่วยให้การอ่านจาก flash เกิดขึ้นเพียงครั้งเดียวต่อ token ทำให้ไม่เป็นอุปสรรคสำคัญต่ออัตราการประมวลผล
Limitations
โมเดลนี้มีขอบเขตการทำงานที่จำกัดอย่างชัดเจน ไม่สามารถตอบคำถามเชิงข้อมูล, ปฏิบัติตามคำสั่ง, เขียนโค้ด หรือให้ข้อมูลความจริงได้ ความจำกัดส่วนใหญ่เกิดจาก ≈ 4 ล้านพารามิเตอร์** ที่รับผิดชอบด้านการให้เหตุผล ซึ่งยังคงอยู่ใน SRAM/PSRAM ทำให้ความสามารถของโมเดลไม่เปลี่ยนแปลงแม้จะใช้เทคนิค PLE
ในที่เดียวกัน นักพัฒนายังปล่อย Barista, โมเดลย่อยที่ออกแบบมาเพื่อให้ข้อมูลเกี่ยวกับกาแฟเอสเปรสโซ่เท่านั้น ซึ่งเป็นการเน้นความเชี่ยวชาญเฉพาะด้าน แม้ว่าวิธีนี้จะไม่ได้ทำให้โมเดลขนาดเล็กมี “สมอง” ที่ฉลาดขึ้น แต่แสดงให้เห็นว่าการจัดสรรหน่วยความจำอย่างเหมาะสมสามารถเปิดโอกาสให้โมเดลที่เคยเป็นไปไม่ได้บนฮาร์ดแวร์ระดับต่ำทำงานได้
Implications
การสำเร็จของ esp32‑ai แสดงให้เห็นว่า LLM สามารถถูกรวมเข้าไปในอุปกรณ์ฝังตัวที่มีต้นทุนต่ำและใช้พลังงานจำกัด ทำให้เกิดโอกาสใหม่ ๆ ในการประยุกต์เช่นระบบเซนเซอร์อัจฉริยะ, ปลั๊กไฟอัจฉริยะ หรือผลิตภัณฑ์ IoT ที่ต้องการประมวลผลข้อความแบบออฟไลน์ อย่างไรก็ตาม การใช้โมเดลที่มีขนาดเล็กและความสามารถจำกัดหมายความว่าการนำไปใช้งานจริงยังคงต้องพิจารณาเรื่องคุณภาพของผลลัพธ์และความเหมาะสมกับงาน
การทดลองนี้อาจกระตุ้นให้ผู้ผลิตชิปพัฒนาหน่วยความจำที่เร็วกว่า flash หรือเพิ่มขนาด SRAM/PSRAM เพื่อสนับสนุนโมเดล LLM ขนาดใหญ่ขึ้นโดยไม่ต้องเสียค่าใช้จ่ายสูง นอกจากนี้ การเผยแพร่โค้ดแบบเปิดยังเป็นแรงผลักดันให้ชุมชนทำการต่อยอดและปรับปรุงเทคนิค PLE ให้มีประสิทธิภาพมากยิ่งขึ้น
Summary
slvDev แสดงว่าโมเดลภาษา 28.9 ล้านพารามิเตอร์ สามารถทำงานได้บน ESP32‑S3 ราคาเพียง $10 ด้วยอัตรา 9.88 token ต่อวินาที ผ่านเทคนิคการจัดเก็บพารามิเตอร์ใน flash และ quantization แม้ว่าจะมีข้อจำกัดด้านความสามารถ การทดลองนี้เปิดมิติใหม่ให้กับการนำ LLM ไปใช้บนอุปกรณ์ฝังตัวระดับต้นทุนต่ำ.
แชร์บทความนี้:
ชอบบทความแบบนี้?
สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม
แหล่งข่าวต้นฉบับ
- ชื่อต้นฉบับ
- The next age of LLMs? Dev gets a small LLM running at 10 tokens a second locally on a $10 microcontroller
- ผู้เขียน
- Rahim Amir
- แหล่ง
- TechRadar
- วันที่เผยแพร่
- 8 สิงหาคม 2569 เวลา 02:35



