ช่องโหว่ Grok ให้แชทบอททำตามคำสั่งฉีดเข้ามา

ที่มาภาพ: The Register

Security-อ่าน 8 นาทีThe Register

ช่องโหว่ Grok ให้แชทบอททำตามคำสั่งฉีดเข้ามา

⚡ สรุป 30 วิ

นักวิจัยจาก Adversa AI พบว่าช่องโหว่ cryptographic context injection ทำให้โมเดล Grok ของ xAI ปฏิบัติตามคำสั่งที่ถูกฝังใน ciphertext ได้ แม้ระบบ guardrails…

Lead paragraph ผู้วิจัยด้านความปลอดภัยของบริษัท Adversa AI เปิดเผยว่าตัวแชทบอทเว็บของ xAI ชื่อ Grok ยังคงมีช่องโหว่ต่อการโจมตีรูปแบบใหม่ที่เรียกว่า *cryptographic context injection* ซึ่งทำให้ผู้ไม่ประสงค์ดีสามารถสั่งงานโมเดล AI ให้ดำเนินการตามคำสั่งอันเป็นอันตรายได้ การค้นพบนี้สำคัญเพราะมันชี้ให้เห็นข้อจำกัดของระบบกรอง (guardrails) ที่มักพึ่งพาการตรวจสอบข้อความอย่างเดียว

Overview

ในบทความบล็อกของหัวหน้าทีมวิจัย Rony Utevsky ที่บริษัท Adversa AI, รายงานได้อธิบายว่าผู้โจมตีสามารถฝัง “cipher‑text” พร้อมคีย์การถอดรหัสบนหน้าเว็บที่ถูกออกแบบให้ดูเหมือนธรรมดา เมื่อผู้ใช้เปิดหน้าเว็บนั้นและส่งข้อความไปยัง Grok โมเดลจะรับข้อมูลเหล่านั้นผ่านระบบกรองซึ่งไม่สามารถอ่านข้อความเข้ารหัสได้

แต่เนื่องจากคีย์การถอดรหัสอยู่บนหน้าเดียวกัน, โมเดลจึงสามารถทำงานฟังก์ชันการถอดรหัส (PBKDF2 + AES‑256‑GCM) ภายใน sandbox ของตนเองได้ หลังจากนั้นข้อความที่ถูกถอดรหัสจะกลายเป็น “prompt” ที่โมเดลยอมปฏิบัติตามเช่นเดียวกับการโจมตี *indirect prompt injection* แบบดั้งเดิม

แม้ว่าโมเดล AI สมัยใหม่อาจมี guardrails ที่แข็งแรงขึ้น, การใช้การเข้ารหัสแบบสมบูรณ์ทำให้ระบบกรองไม่สามารถตรวจจับได้ในขั้นตอนการสแกนเนื้อหา ทำให้ช่องโหว่นี้ยังคงเป็นปัญหาที่ต้องรับมือต่อไป

Attack Technique

เทคนิค *cryptographic context injection* ของ Adversa AI มีความแตกต่างจากวิธีที่เคยพบเช่น การเข้ารหัสด้วย base64 ซึ่งโมเดลสามารถถอดรหัสได้เองจากข้อมูลการฝึกฝน แต่การใช้การเข้ารหัสระดับสูงทำให้ต้องอาศัย runtime ของโมเดลเพื่อดำเนินการถอดรหัสจริง

กระบวนการโจมตีสรุปได้ดังนี้

  • ผู้โจมตีวาง cipher‑text และคีย์บนหน้าเว็บเดียวกัน
  • ระบบกรองตรวจสอบข้อความธรรมดาแล้วส่งต่อให้โมเดลโดยไม่อ่านข้อความเข้ารหัส
  • โมเดลใช้ฟังก์ชันถอดรหัสใน sandbox เพื่อเปิดเผยคำสั่งอันเป็นอันตราย
  • คำสั่งที่ถูกถอดรหัสจะถูกประมวลผลเหมือนกับ prompt ปกติ

การทำเช่นนี้ทำให้ guardrail ไม่สามารถ “ดู” เข้าไปในขั้นตอน runtime ได้, ทำให้ความหมายที่แท้จริงของข้อความปรากฏขึ้นหลังจากกระบวนการถอดรหัสเสร็จสิ้นเท่านั้น

Demonstration & Impact

ทีม Adversa AI แสดงหลักฐานแบบ proof‑of‑concept ที่ใช้เทคนิคนี้เพื่อดึงข้อมูลประวัติแชทของผู้ใช้บน Grok.com โดยข้อมูลที่ถูกส่งออกมาผ่าน URL มีดังต่อไปนี้

  • ชื่อผู้ใช้
  • พิกัดตำแหน่งโดยประมาณ
  • ระดับการสมัครสมาชิก (subscription tier)
  • รายละเอียดทั้งหมดของ prompt ที่เคยถามในบทสนทนา

ข้อมูลเหล่านี้ถูกรวมเป็นพารามิเตอร์ใน URL แล้วส่งไปยังเซิร์ฟเวอร์ที่ผู้โจมตีควบคุม ทำให้สามารถเก็บรวบรวมประวัติการใช้งานของหลายพันผู้ใช้ได้อย่างง่ายดาย

นอกจากนี้ ทีมงานทดลองใช้เทคนิคเดียวกันกับ Google Gemini (gemini.google.com) พบว่าการโจมตีไม่สำเร็จในขั้นตอนการดึงข้อมูล เนื่องจาก Gemini ไม่อนุญาตให้ Python เข้าถึงเว็บไซต์ภายนอก อย่างไรก็ตาม พวกเขาสามารถทำให้โมเดลสร้างเนื้อหาที่ปกติจะถูกกรองออกได้ เช่น คำแนะนำในการผลิตอาวุธชนิดติดไฟ

Responses from Companies

ตามรายงานของ Adversa AI, บริษัท xAI ได้รับแจ้งเกี่ยวกับช่องโหว่นี้เมื่อวันที่ 3 มิถุนายน 2026 ผ่านการติดต่อโดยตรงและผ่านโปรแกรม Bug Bounty ของ HackerOne การตอบสนองของ xAI เพียงบ่งชี้ว่าตระหนักถึงรายงานแต่ไม่ได้ให้กรอบเวลาแก้ไข

ต่อมามีความพยายามเพิ่มเติมในการแจ้งปัญหาในวันที่ 4 และ 10 สิงหาคม 2026 อย่างไรก็ตาม, ณ วันที่ 19 สิงหาคม 2026 เทคนิค *cryptographic context injection* ยังทำงานได้บน Grok.com ได้รับการยืนยันจากแหล่งข้อมูล

บริษัท SpaceX, ผู้ที่เข้าซื้อกิจการ xAI เมื่อเร็ว ๆ นี้ ไม่ได้ให้ความคิดเห็นต่อเหตุการณ์นี้ ส่วน Google ยังคงไม่ได้รับแจ้งเกี่ยวกับการโจมตี เนื่องจากพวกเขาพิจารณาว่า jailbreak อยู่เหนือขอบเขตของโปรแกรมเปิดเผยช่องโหว่

Broader Implications

การเปรียบเทียบระหว่าง *cryptographic context injection* กับ **return‑oriented programming (ROP) ที่นักวิจัยกล่าวถึงแสดงให้เห็นว่าการรวมชิ้นส่วนที่ปลอดภัยแต่เป็นอันตรายเมื่อทำงานร่วมกันเป็นแนวคิดใหม่ในวงการ AI security การที่โมเดลทำหน้าที่เป็น interpreter ทั้งหมดทำให้ “หน่วยตรวจสอบ” เพียงข้อความ (string) ไม่เพียงพอต่อการป้องกัน

ผลกระทบสำคัญคือ ระบบ guardrail ต้องขยายการมองเห็นของตนเข้าสู่ runtime หรือพิจารณาเพิ่มขั้นตอนตรวจสอบเชิงโครงสร้างของคำสั่งที่อาจถูกประกอบขึ้นจากหลายแหล่งข้อมูล แม้ว่าการทำเช่นนั้นจะเพิ่มความซับซ้อนและค่าใช้จ่าย แต่เป็นสิ่งจำเป็นเพื่อรับมือกับวิธีการโจมตีที่พัฒนาขึ้นอย่างต่อเนื่อง

ในขณะเดียวกัน ผู้ให้บริการ AI จำเป็นต้องปรับกระบวนการตอบสนองต่อรายงานช่องโหว่ (vulnerability disclosure) ให้ครอบคลุมถึงรูปแบบ jailbreak ด้วย เพื่อสร้างความเชื่อมั่นและลดระยะเวลาที่ผู้โจมตีอาจใช้ประโยชน์จากช่องโหว่

Mitigation Outlook

การแก้ไขที่เป็นไปได้สำหรับ Grok รวมถึง:

  • ปรับปรุงระบบกรองให้สามารถตรวจจับข้อความเข้ารหัสโดยการวิเคราะห์รูปแบบของ ciphertext และคีย์ที่แนบมาด้วย
  • จำกัดความสามารถของโมเดลในการเรียกใช้ฟังก์ชันถอดรหัสภายใน sandbox หรือกำหนดให้ต้องผ่านกระบวนการตรวจสอบเพิ่มเติมก่อนทำงาน
  • ปรับปรุงการอัปเดต guardrails อย่างต่อเนื่องเพื่อให้รองรับเทคนิคใหม่ ๆ ที่อาจเกิดขึ้น

โดยคาดว่าการเปลี่ยนแปลงเหล่านี้จะใช้เวลาหลายเดือน เนื่องจากต้องทดสอบความปลอดภัยอย่างละเอียดและตรวจสอบผลกระทบต่อประสิทธิภาพการทำงานของโมเดล AI

Summary

ช่องโหว่ *cryptographic context injection* ที่พบใน Grok แสดงให้เห็นข้อจำกัดของระบบกรองที่พึ่งพาการตรวจสอบข้อความเพียงอย่างเดียว การตอบสนองจาก xAI ยังคงช้าและยังไม่มีการแก้ไขที่แน่นอน ผู้ให้บริการ AI จำเป็นต้องเร่งปรับ guardrails ให้ครอบคลุมขั้นตอน runtime เพื่อป้องกันการโจมตีรูปแบบใหม่ในอนาคต.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
Grok chat duped into swallowing injected instructions
ผู้เขียน
Unknown
แหล่ง
The Register
วันที่เผยแพร่
20 สิงหาคม 2569 เวลา 20:00

Related

บทความที่เกี่ยวข้อง

Ghostcommit ฝัง Prompt ในไฟล์ PNG เพื่อดึงข้อมูลลับจาก .env ผ่าน AI agentsSecurity
13 กรกฎาคม 2569 เวลา 16:00

Ghostcommit ฝัง Prompt ในไฟล์ PNG เพื่อดึงข้อมูลลับจาก .env ผ่าน AI agents

นักวิจัยเผยเทคนิค Ghostcommit ใช้ steganography ซ่อน prompt ลงในเมตาดาต้า PNG ทำให้ AI agents เช่น CodeRabbit อ่านค่า .env แล้วสั่งให้ส่งออกเป็นตัวเลข…

BleepingComputer7 นาที
นักวิจัยแสดงให้โมเดลภาษาใหญ่เปิดสูตรสังเคราะห์โคเคนด้วยการหลอกแบบ role confusionSecurity
2 กรกฎาคม 2569 เวลา 06:30

นักวิจัยแสดงให้โมเดลภาษาใหญ่เปิดสูตรสังเคราะห์โคเคนด้วยการหลอกแบบ role confusion

งานวิจัยของ Charles Ye, Jasmine Cui และ Dylan Hadfield‑Menell แสดงว่า LLM สามารถถูกหลอกให้ให้สูตรโคเคนได้โดยใช้เทคนิค role confusion ผ่านการโจมตีแบบ prompt…

The Register7 นาที
Microsoft Copilot เปิดเผยพารามิเตอร์ผ่าน URL ด้วยช่องโหว่ CoSnitch.Security
-

Microsoft Copilot เปิดเผยพารามิเตอร์ผ่าน URL ด้วยช่องโหว่ CoSnitch.

นักวิจัย Varonis พบว่า Copilot สามารถเปิดเผยพารามิเตอร์ภายในผ่าน URL ที่มี ?q= และ autorun=1 ทำให้ผู้โจมตีสร้างลิงก์อัตโนมัติและดึงข้อมูลส่วนบุคคลได้.…

The Register7 นาที
จีนใช้โครงการอวกาศบนดินของนิวซีแลนด์เป็นเครื่อมือสอดแนมข้อมูลทางทหารSecurity
16 สิงหาคม 2569 เวลา 10:00

จีนใช้โครงการอวกาศบนดินของนิวซีแลนด์เป็นเครื่อมือสอดแนมข้อมูลทางทหาร

หน่วยข่าวกรอง NZSIS รายงานว่าจีนพยายามติดตั้งโครงสร้างพื้นฐานด้านอวกาศในประเทศนิวซีแลนด์เพื่อเก็บข้อมูลทางทหาร…

The Register8 นาที
คัดลอกลิงก์แล้ว!