
ที่มาภาพ: VentureBeat
Evals กลายเป็น PRD ใหม่ของผลิตภัณฑ์ AI ตามที่หัวหน้าฝ่าย AI ของ Expedia
⚡ สรุป 30 วิ
ในงาน VB Transform 2026 Xavi Amatriain ผู้อำนวยการ AI ของ Expedia กล่าวว่าการประเมินผล (evals) จะทำให้เป็น PRD ใหม่ของผลิตภัณฑ์ AI รวมถึง red‑teaming evals…
**Lead: ที่การประชุม VB Transform 2026 ในเมนโล พาร์ก Xavi Amatriain – ประธานเจ้าหน้าที่ AI และข้อมูลแห่ง Expedia Group คนแรก – ได้ชี้ให้เห็นว่าการประเมินผล (evaluation) กำลังกลายเป็น “PRD ใหม่” ของผลิตภัณฑ์ AI ทั้งหลาย การเปลี่ยนแปลงนี้มีผลต่อกระบวนการออกแบบ ระบบกำกับดูแล และความปลอดภัยของเอเจนต์อัจฉริยะในระดับองค์กร
Overview
Amatriain อธิบายว่า “the new PRD are the evals” หมายถึง การเขียนสเปคของผลิตภัณฑ์ผ่านการกำหนดชุดประเมินที่ครอบคลุม ทั้งการทดสอบทั่วไปและ red‑teaming evals ที่มาพร้อมข้อกำหนดด้านความปลอดภัยตั้งแต่ขั้นตอนออกแบบก่อนเริ่มโค้ดดิ้ง นอกจากนี้เขายังบอกว่า ในยุคของ AI‑assisted หรือ AI‑generated code การทำงานทั้งหมดจะถูกสั่งผ่าน evals มากกว่าการกำหนดฟีเจอร์โดยตรง
ก่อนมารับตำแหน่งใน Expedia เขาเคยเป็น VP of AI and Compute Enablement ที่ Google ดูแลแพลตฟอร์มที่ขับเคลื่อน Gemini และ Google Search ตั้งแต่ธันวาคม 2025 จนถึงปัจจุบัน Amatriain ยังเป็นผู้ให้คำแนะนำกับทีมงานหลายคนที่ต่อมาก่อตั้งบริษัทเทคโนโลยีระดับโลกเช่น Perplexity และ Scale AI
Evaluation as PRD
แนวคิดของการใช้ evals แทนเอกสาร PRD ปกติ ทำให้ทีมพัฒนาต้องกำหนดเกณฑ์ความสำเร็จและข้อจำกัดล่วงหน้าอย่างชัดเจน เช่น ความแม่นยำของโมเดล, การตอบสนองต่อข้อมูลที่เป็นอันตราย, หรือการปฏิบัติตามข้อกำหนดด้านกฎระเบียบ Amatriain ย้ำว่า “คุณต้องเข้ารหัสสิ่งที่ผลิตภัณฑ์ควรทำผ่าน evals” ก่อนที่นักพัฒนาจะเริ่มเขียนโค้ดจริง
ในมุมของการรักษาความปลอดภัย การผสาน red‑teaming evals เข้าไปใน PRD ช่วยให้ความเสี่ยงจากช่องโหว่หรือการโจมตีโดย AI อื่น ๆ ถูกตรวจจับได้เร็วขึ้น แม้ว่าองค์กรต้องเผชิญกับข้อจำกัดด้านทรัพยากรในการจัดทำชุดประเมินที่ครอบคลุมหลายระดับ
Governance Framework
Expedia ใช้กรอบการกำกับดูแล AI สามขั้นตอน: Principles Processes/Tools Automation โดย Amatriain ให้ความสำคัญกับ “principles” เป็นชั้นแรก เน้นการสื่อสารอย่างกว้างขวางและบันทึกเป็นแนวทางที่ควรปฏิบัติในระดับองค์กร แม้ว่าในหลายกรณีหลักการเหล่านี้อาจยังไม่ได้ฝังลึกลงในวัฒนธรรมบริษัท
ต่อมาคือ “processes and tools” ที่ทำให้ principle มี “teeth” หรือความแข็งแกร่ง การใช้ agent release toll gates เป็นจุดตรวจสอบที่ปรับตามระดับความเสี่ยงของเอเจนต์แต่ละตัว ทำให้การประเมิน, red‑teaming, และรีวิวด้านความปลอดภัยถูกบังคับใช้เป็นขั้นตอนบังคับหรือแนะนำตามสภาพ
ส่วน “automation” นั้นทำหน้าที่เชื่อมโยงระหว่างขั้นตอนทั้งหมด โดยอัตโนมัติปรับระดับการกำกับดูแลให้เหมาะสมกับ risk level หากความเสี่ยงต่ำ ระบบจะไม่บังคับใช้กระบวนการที่ซับซ้อนเกินไป แต่หากเป็นงานที่มีผลต่อผู้ใช้หรือข้อมูลสำคัญ การตรวจสอบจะถูกยกเป็นข้อบังคับ
Architecture & Agent Design
Amatriain ระบุว่าเขาไม่เชื่อว่า AGI จะปรากฏในรูปแบบ “singleton model” แต่ควรเป็นการ composition ของเอเจนต์ที่มีความเชี่ยวชาญเฉพาะด้าน โดย Expedia ได้วางโครงสร้างจากระดับคอมโพเนนท์ tools skills sub‑agents ระบบเอเจนต์เต็มรูปแบบ
ในขั้นตอนออกแบบ Amatriain เน้นการกำหนดหลักการร่วม เช่น โทนของการตอบสนอง, วิธีการสื่อสารกับผู้ใช้, การจัดเก็บบริบทและความจำ — ทั้งหมดต้องผ่านการวางแผนอย่างละเอียดก่อนนำไปประกอบเป็นระบบโดยรวม การทำเช่นนี้ไม่เพียงช่วยให้ระบบมีความสอดคล้องกัน แต่ยังลดพื้นที่ที่อาจเกิดช่องโหว่จากโมเดลเดียว
การกำหนดขอบเขตของเอเจนต์แต่ละตัวให้แคบลง ทำให้ทีมสามารถประเมินและล็อกดาวน์ฟังก์ชันเฉพาะได้ก่อนนำไปรวมเป็นระบบใหญ่ ซึ่งเป็นแนวทางที่ช่วยเพิ่มความปลอดภัยโดยไม่ต้องพึ่งพา guardrails จำนวนมากหลังการเปิดใช้
Industry Insights & Risks
ข้อมูลจาก VB Pulse research ของ VentureBeat แสดงให้เห็นภาพรวมของอุตสาหกรรมเทคโนโลยี AI ในระดับองค์กร:
- 66 % ของ 157 บริษัท surveyed ยอมรับหรือกำลังเตรียมปล่อยผลิตภัณฑ์ AI ไปยังการผลิตโดยไม่มีการตรวจสอบจากมนุษย์ในขั้นสุดท้ายภายใน 12 เดือนถัดไป
- เพียง **5 % ของบริษัทเหล่านั้นเชื่อมั่นอย่างเต็มที่ต่อการประเมินอัตโนมัติที่จะใช้เป็นเกณฑ์ตัดสินการเปิดตัว
- ครึ่งหนึ่งขององค์กรได้ปล่อยเอเจนต์ที่ผ่านการทดสอบภายในแต่กลับล้มเหลวเมื่อเจอลูกค้าจริง
ผลสำรวจชี้ให้เห็นว่ามี “evaluation gap” ระหว่างความต้องการเร่งรีบนำ AI ไปใช้กับระดับความเชื่อมั่นต่อกระบวนการประเมินอัตโนมัติ ซึ่งทำให้ความเสี่ยงต่อการเกิดเหตุการณ์ล้มเหลวหรือผลเสียต่อผู้ใช้อยู่ในระดับสูง
Amatriain ย้ำว่า guardrails แม้จะเป็น “necessary evil” แต่ก็อาจทำให้ระบบมีความบิดเบือนของ feedback loop เนื่องจากข้อจำกัดที่ตั้งไว้ก่อนอาจขัดกับพฤติกรรมจริงของผู้ใช้ ทำให้การเรียนรู้ของโมเดลไปในทิศทางที่ไม่สอดคล้อง
Impact
การเปลี่ยนแปลงวิธีกำหนด PRD ผ่าน evals จะส่งผลต่อหลายระดับ: ทีมพัฒนาจะต้องมุ่งเน้นการออกแบบชุดประเมินตั้งแต่ต้นขั้นตอน การตรวจสอบความปลอดภัยและการจัดการความเสี่ยงจะถูกผสานเข้ากับกระบวนการอัตโนมัติอย่างเป็นระบบ นอกจากนี้แนวคิดของ specialized agents จะทำให้ตลาด AI มีการแบ่งแยกฟังก์ชันที่ชัดเจน ส่งผลให้ผู้ใช้ได้รับประสบการณ์ที่มีความแม่นยำและปลอดภัยมากขึ้น
ในมุมของอุตสาหกรรม การกำหนดมาตรฐานใหม่เช่นนี้อาจกระตุ้นให้ผู้ประกอบการอื่น ๆ ปรับแนวทางการพัฒนา AI ให้สอดคล้องกับหลักการ “evaluate‑first” เพื่อหลีกเลี่ยงความล่าช้าในการปรับแก้หลังจากเหตุการณ์ที่เกิดขึ้นจริง
Summary
Amatriain ยืนยันว่า evaluation จะเป็นหัวใจของ PRD ใหม่ในยุค AI ที่สร้างและโค้ดโดยเครื่องจักร การนำ evals, risk‑based toll gates, และการออกแบบเอเจนต์เชิงสเปเชียลไลซ์เข้ามาเป็นหลักการพื้นฐานจะช่วยลดช่องว่างระหว่างความเร็วในการเปิดตัวกับระดับความปลอดภัยและความเชื่อมั่นของผู้ใช้.
แชร์บทความนี้:
ชอบบทความแบบนี้?
สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม
แหล่งข่าวต้นฉบับ
- ชื่อต้นฉบับ
- Evals are the new PRD, Expedia’s AI chief tells VB Transform 2026
- ผู้เขียน
- [email protected] (Louis Columbus)
- แหล่ง
- VentureBeat
- วันที่เผยแพร่
- 22 กรกฎาคม 2569 เวลา 01:15



