LLM ขนาดเล็กทำงานบน ESP32‑S3 เพียง $10 ให้ความเร็ว 9.88 token ต่อวินาที

ที่มาภาพ: TechRadar

AI-อ่าน 6 นาทีTechRadar

LLM ขนาดเล็กทำงานบน ESP32‑S3 เพียง $10 ให้ความเร็ว 9.88 token ต่อวินาที

⚡ สรุป 30 วิ

slvDev พัฒนาโมเดล LLM 28.9 ล้านพารามิเตอร์ ทำงานอิสระบน ESP32‑S3 ราคา $10 ด้วยเทคนิค quantization 4‑bit เร็ว 9.88 token/วินาที ไม่ต้องเชื่อมอินเทอร์เน็ต

การพัฒนาโมเดลภาษาแบบขนาดเล็กที่ทำงานได้โดยอิสระบนไมโครคอนโทรลเลอร์ราคาเพียง $10 นำเสนอแนวทางใหม่สำหรับการใช้งาน LLM ในอุปกรณ์ฝังตัวอย่าง ESP32‑S3 โดย slvDev สร้างโมเดล 28.9 ล้านพารามิเตอร์ สามารถผลิตข้อความสไตล์ TinyStories ได้ที่อัตรา 9.88 token ต่อวินาที ทั้งหมดดำเนินการภายในชิปโดยไม่ต้องเชื่อมต่ออินเทอร์เน็ต

Overview

โครงการชื่อ esp32‑ai ถูกเปิดเผยบน GitHub เมื่อปลายเดือนกรกฎาคม 2026 ภายใต้สัญญาอนุญาต MIT license โครงการได้รับความสนใจจากชุมชนโอเพ่นซอร์สโดยรวบรวมดาว *Stars* มากกว่า 3,600 ดาวและมีการ Fork เกิน 470 ครั้ง การแสดงผลบนช่อง YouTube ของ Better Stack ยืนยันว่าโมเดลทำงานได้อย่างเต็มที่แม้ในขีดจำกัดของฮาร์ดแวร์

นักพัฒนาชี้ให้เห็นว่าการฝึกโมเดลใช้ชุดข้อมูล TinyStories จาก Microsoft Research ซึ่งเน้นการสร้างเรื่องสั้น ๆ ที่มีความยาวและโครงสร้างง่าย โมเดลนี้ถูกปรับขนาดจากเวอร์ชันเต็มเพื่อให้เข้ากับหน่วยความจำของ ESP32‑S3 ซึ่งมี 512 KB SRAM, 8 MB PSRAM และ 16 MB flash

Technical Approach

การลดขนาดโมเดลทำได้โดยใช้เทคนิค quantization ไปยังความแม่นยำระดับสี่บิต ซึ่งช่วยลดปริมาณหน่วยความจำที่ต้องใช้จากประมาณ 60 MB (สำหรับ 16‑bit) เหลือเพียง ≈ 14.9 MB การจัดเก็บส่วนใหญ่ของพารามิเตอร์ใน flash storage ทำให้สามารถเก็บ ≈ 25 ล้านพารามิเตอร์** (ประมาณ 12 MB ที่สี่บิต) ได้โดยไม่ทำให้แบนด์วิธของ flash กลายเป็นคอขวด

  • พารามิเตอร์ฝังตัว (embedding tables) ถูกย้ายไปยัง flash
  • หน่วยความจำทำงานระดับหลายชั้น: flash สำหรับพารามิเตอร์ที่อ่านน้อย, PSRAM เก็บ core โมเดลและ output head, SRAM ใช้เก็บ activation และ norm weights

โครงสร้างการเข้าถึงแบบนี้เรียกว่า **Per‑Layer Embeddings (PLE) ซึ่งอ่านค่าจาก flash เพียงประมาณ 450 ไบต์ต่อ token ทำให้กระบวนการคำนวณยังคงอยู่ในระดับที่สามารถทำได้เร็วพอบน ESP32‑S3

Performance & Benchmarks

ผลลัพธ์ของโครงการคือ 9.88 token ต่อวินาที ซึ่งเทียบกับความเร็วในการอ่านปกติของมนุษย์ การแสดงผลนี้ถือว่าพอเพียงสำหรับการสร้างเรื่องสั้น ๆ ในบริบทที่ไม่ต้องการตอบสนองแบบเรียลไทม์ โมเดลยังคงทำงานได้อย่างสมบูรณ์โดยไม่มีข้อมูลออกจากชิป ทำให้เหมาะกับการใช้งานในระบบที่ต้องการความเป็นส่วนตัวสูง

แม้ว่าการย้ายพารามิเตอร์ไปเก็บใน flash จะลดความหน่วงของการเข้าถึง แต่ยังคงมีข้อจำกัดด้านแบนด์วิธเมื่ออ่านบรรทัดต่อบรรทัดอย่างต่อเนื่อง อย่างไรก็ตาม การออกแบบ PLE ช่วยให้การอ่านจาก flash เกิดขึ้นเพียงครั้งเดียวต่อ token ทำให้ไม่เป็นอุปสรรคสำคัญต่ออัตราการประมวลผล

Limitations

โมเดลนี้มีขอบเขตการทำงานที่จำกัดอย่างชัดเจน ไม่สามารถตอบคำถามเชิงข้อมูล, ปฏิบัติตามคำสั่ง, เขียนโค้ด หรือให้ข้อมูลความจริงได้ ความจำกัดส่วนใหญ่เกิดจาก ≈ 4 ล้านพารามิเตอร์** ที่รับผิดชอบด้านการให้เหตุผล ซึ่งยังคงอยู่ใน SRAM/PSRAM ทำให้ความสามารถของโมเดลไม่เปลี่ยนแปลงแม้จะใช้เทคนิค PLE

ในที่เดียวกัน นักพัฒนายังปล่อย Barista, โมเดลย่อยที่ออกแบบมาเพื่อให้ข้อมูลเกี่ยวกับกาแฟเอสเปรสโซ่เท่านั้น ซึ่งเป็นการเน้นความเชี่ยวชาญเฉพาะด้าน แม้ว่าวิธีนี้จะไม่ได้ทำให้โมเดลขนาดเล็กมี “สมอง” ที่ฉลาดขึ้น แต่แสดงให้เห็นว่าการจัดสรรหน่วยความจำอย่างเหมาะสมสามารถเปิดโอกาสให้โมเดลที่เคยเป็นไปไม่ได้บนฮาร์ดแวร์ระดับต่ำทำงานได้

Implications

การสำเร็จของ esp32‑ai แสดงให้เห็นว่า LLM สามารถถูกรวมเข้าไปในอุปกรณ์ฝังตัวที่มีต้นทุนต่ำและใช้พลังงานจำกัด ทำให้เกิดโอกาสใหม่ ๆ ในการประยุกต์เช่นระบบเซนเซอร์อัจฉริยะ, ปลั๊กไฟอัจฉริยะ หรือผลิตภัณฑ์ IoT ที่ต้องการประมวลผลข้อความแบบออฟไลน์ อย่างไรก็ตาม การใช้โมเดลที่มีขนาดเล็กและความสามารถจำกัดหมายความว่าการนำไปใช้งานจริงยังคงต้องพิจารณาเรื่องคุณภาพของผลลัพธ์และความเหมาะสมกับงาน

การทดลองนี้อาจกระตุ้นให้ผู้ผลิตชิปพัฒนาหน่วยความจำที่เร็วกว่า flash หรือเพิ่มขนาด SRAM/PSRAM เพื่อสนับสนุนโมเดล LLM ขนาดใหญ่ขึ้นโดยไม่ต้องเสียค่าใช้จ่ายสูง นอกจากนี้ การเผยแพร่โค้ดแบบเปิดยังเป็นแรงผลักดันให้ชุมชนทำการต่อยอดและปรับปรุงเทคนิค PLE ให้มีประสิทธิภาพมากยิ่งขึ้น

Summary

slvDev แสดงว่าโมเดลภาษา 28.9 ล้านพารามิเตอร์ สามารถทำงานได้บน ESP32‑S3 ราคาเพียง $10 ด้วยอัตรา 9.88 token ต่อวินาที ผ่านเทคนิคการจัดเก็บพารามิเตอร์ใน flash และ quantization แม้ว่าจะมีข้อจำกัดด้านความสามารถ การทดลองนี้เปิดมิติใหม่ให้กับการนำ LLM ไปใช้บนอุปกรณ์ฝังตัวระดับต้นทุนต่ำ.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
The next age of LLMs? Dev gets a small LLM running at 10 tokens a second locally on a $10 microcontroller
ผู้เขียน
Rahim Amir
แหล่ง
TechRadar
วันที่เผยแพร่
8 สิงหาคม 2569 เวลา 02:35

Related

บทความที่เกี่ยวข้อง

Gemma 4 E2B ทำงานบน Raspberry Pi แสดงว่า LLM ขนาดเล็กไม่ต้องแย่AI
5 สิงหาคม 2569 เวลา 01:00

Gemma 4 E2B ทำงานบน Raspberry Pi แสดงว่า LLM ขนาดเล็กไม่ต้องแย่

โมเดล Gemma 4 E2B รันได้บน Raspberry Pi 4 ด้วยการบีบอัด 2‑bit ใช้ RAM ไม่เกิน 2 GB และตอบสนองภายใน 1‑2 วินาที การทดลองแสดงว่า LLM…

XDA Developers6 นาที
โมเดล AI ขนาดเล็กที่สุดชนะการทดสอบเขียนโค้ดบนเครื่องAI
28 กรกฎาคม 2569 เวลา 05:00

โมเดล AI ขนาดเล็กที่สุดชนะการทดสอบเขียนโค้ดบนเครื่อง

การทดสอบสามโมเดล AI ภายในเครื่องพบว่าโมเดลไฟล์เล็กสุดให้ผลลัพธ์เร็วและแม่นยำสูง จึงกลายเป็นตัวเลือกถาวรสำหรับงานเขียนโค้ดประจำวัน

XDA Developers5 นาที
เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพAI
22 มิถุนายน 2569 เวลา 02:00

เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพ

ผู้เขียนทดสอบ LM Studio, Ollama, Text Generation WebUI และ llama.cpp บนคอมพิวเตอร์ระดับกลาง ผลการทดสอบพบว่า Ollama สามารถดึงศักยภาพของโมเดลได้เต็มที่ ทั้งด้าน…

XDA Developers7 นาที
โฟโตทรานซิสเตอร์จำแสงแบบสมอง ลดพลังงานระบบ AI VisionAI
19 มิถุนายน 2569 เวลา 21:00

โฟโตทรานซิสเตอร์จำแสงแบบสมอง ลดพลังงานระบบ AI Vision

นักวิจัยมหาวิทยาลัย Oregon State พัฒนาฟโโตทรานซิสเตอร์ที่รวมการตรวจจับแสง, หน่วยความจำแบบแสงและการประมวลผลในชิ้นเดียว…

Tom's Hardware7 นาที
คัดลอกลิงก์แล้ว!