Evals กลายเป็น PRD ใหม่ของผลิตภัณฑ์ AI ตามที่หัวหน้าฝ่าย AI ของ Expedia

ที่มาภาพ: VentureBeat

AI-อ่าน 8 นาทีVentureBeat

Evals กลายเป็น PRD ใหม่ของผลิตภัณฑ์ AI ตามที่หัวหน้าฝ่าย AI ของ Expedia

⚡ สรุป 30 วิ

ในงาน VB Transform 2026 Xavi Amatriain ผู้อำนวยการ AI ของ Expedia กล่าวว่าการประเมินผล (evals) จะทำให้เป็น PRD ใหม่ของผลิตภัณฑ์ AI รวมถึง red‑team­ing evals…

**Lead: ที่การประชุม VB Transform 2026 ในเมนโล พาร์ก Xavi Amatriain – ประธานเจ้าหน้าที่ AI และข้อมูลแห่ง Expedia Group คนแรก – ได้ชี้ให้เห็นว่าการประเมินผล (evaluation) กำลังกลายเป็น “PRD ใหม่” ของผลิตภัณฑ์ AI ทั้งหลาย การเปลี่ยนแปลงนี้มีผลต่อกระบวนการออกแบบ ระบบกำกับดูแล และความปลอดภัยของเอเจนต์อัจฉริยะในระดับองค์กร

Overview

Amatriain อธิบายว่า “the new PRD are the evals” หมายถึง การเขียนสเปคของผลิตภัณฑ์ผ่านการกำหนดชุดประเมินที่ครอบคลุม ทั้งการทดสอบทั่วไปและ red‑team­ing evals ที่มาพร้อมข้อกำหนดด้านความปลอดภัยตั้งแต่ขั้นตอนออกแบบก่อนเริ่มโค้ดดิ้ง นอกจากนี้เขายังบอกว่า ในยุคของ AI‑assisted หรือ AI‑generated code การทำงานทั้งหมดจะถูกสั่งผ่าน evals มากกว่าการกำหนดฟีเจอร์โดยตรง

ก่อนมารับตำแหน่งใน Expedia เขาเคยเป็น VP of AI and Compute Enablement ที่ Google ดูแลแพลตฟอร์มที่ขับเคลื่อน Gemini และ Google Search ตั้งแต่ธันวาคม 2025 จนถึงปัจจุบัน Amatriain ยังเป็นผู้ให้คำแนะนำกับทีมงานหลายคนที่ต่อมาก่อตั้งบริษัทเทคโนโลยีระดับโลกเช่น Perplexity และ Scale AI

Evaluation as PRD

แนวคิดของการใช้ evals แทนเอกสาร PRD ปกติ ทำให้ทีมพัฒนาต้องกำหนดเกณฑ์ความสำเร็จและข้อจำกัดล่วงหน้าอย่างชัดเจน เช่น ความแม่นยำของโมเดล, การตอบสนองต่อข้อมูลที่เป็นอันตราย, หรือการปฏิบัติตามข้อกำหนดด้านกฎระเบียบ Amatriain ย้ำว่า “คุณต้องเข้ารหัสสิ่งที่ผลิตภัณฑ์ควรทำผ่าน evals” ก่อนที่นักพัฒนาจะเริ่มเขียนโค้ดจริง

ในมุมของการรักษาความปลอดภัย การผสาน red‑team­ing evals เข้าไปใน PRD ช่วยให้ความเสี่ยงจากช่องโหว่หรือการโจมตีโดย AI อื่น ๆ ถูกตรวจจับได้เร็วขึ้น แม้ว่าองค์กรต้องเผชิญกับข้อจำกัดด้านทรัพยากรในการจัดทำชุดประเมินที่ครอบคลุมหลายระดับ

Governance Framework

Expedia ใช้กรอบการกำกับดูแล AI สามขั้นตอน: Principles Processes/Tools Automation โดย Amatriain ให้ความสำคัญกับ “principles” เป็นชั้นแรก เน้นการสื่อสารอย่างกว้างขวางและบันทึกเป็นแนวทางที่ควรปฏิบัติในระดับองค์กร แม้ว่าในหลายกรณีหลักการเหล่านี้อาจยังไม่ได้ฝังลึกลงในวัฒนธรรมบริษัท

ต่อมาคือ “processes and tools” ที่ทำให้ principle มี “teeth” หรือความแข็งแกร่ง การใช้ agent release toll gates เป็นจุดตรวจสอบที่ปรับตามระดับความเสี่ยงของเอเจนต์แต่ละตัว ทำให้การประเมิน, red‑team­ing, และรีวิวด้านความปลอดภัยถูกบังคับใช้เป็นขั้นตอนบังคับหรือแนะนำตามสภาพ

ส่วน “automation” นั้นทำหน้าที่เชื่อมโยงระหว่างขั้นตอนทั้งหมด โดยอัตโนมัติปรับระดับการกำกับดูแลให้เหมาะสมกับ risk level หากความเสี่ยงต่ำ ระบบจะไม่บังคับใช้กระบวนการที่ซับซ้อนเกินไป แต่หากเป็นงานที่มีผลต่อผู้ใช้หรือข้อมูลสำคัญ การตรวจสอบจะถูกยกเป็นข้อบังคับ

Architecture & Agent Design

Amatriain ระบุว่าเขาไม่เชื่อว่า AGI จะปรากฏในรูปแบบ “singleton model” แต่ควรเป็นการ composition ของเอเจนต์ที่มีความเชี่ยวชาญเฉพาะด้าน โดย Expedia ได้วางโครงสร้างจากระดับคอมโพเนนท์ tools skills sub‑agents ระบบเอเจนต์เต็มรูปแบบ

ในขั้นตอนออกแบบ Amatriain เน้นการกำหนดหลักการร่วม เช่น โทนของการตอบสนอง, วิธีการสื่อสารกับผู้ใช้, การจัดเก็บบริบทและความจำ — ทั้งหมดต้องผ่านการวางแผนอย่างละเอียดก่อนนำไปประกอบเป็นระบบโดยรวม การทำเช่นนี้ไม่เพียงช่วยให้ระบบมีความสอดคล้องกัน แต่ยังลดพื้นที่ที่อาจเกิดช่องโหว่จากโมเดลเดียว

การกำหนดขอบเขตของเอเจนต์แต่ละตัวให้แคบลง ทำให้ทีมสามารถประเมินและล็อกดาวน์ฟังก์ชันเฉพาะได้ก่อนนำไปรวมเป็นระบบใหญ่ ซึ่งเป็นแนวทางที่ช่วยเพิ่มความปลอดภัยโดยไม่ต้องพึ่งพา guardrails จำนวนมากหลังการเปิดใช้

Industry Insights & Risks

ข้อมูลจาก VB Pulse research ของ VentureBeat แสดงให้เห็นภาพรวมของอุตสาหกรรมเทคโนโลยี AI ในระดับองค์กร:

  • 66 % ของ 157 บริษัท surveyed ยอมรับหรือกำลังเตรียมปล่อยผลิตภัณฑ์ AI ไปยังการผลิตโดยไม่มีการตรวจสอบจากมนุษย์ในขั้นสุดท้ายภายใน 12 เดือนถัดไป
  • เพียง **5 % ของบริษัทเหล่านั้นเชื่อมั่นอย่างเต็มที่ต่อการประเมินอัตโนมัติที่จะใช้เป็นเกณฑ์ตัดสินการเปิดตัว
  • ครึ่งหนึ่งขององค์กรได้ปล่อยเอเจนต์ที่ผ่านการทดสอบภายในแต่กลับล้มเหลวเมื่อเจอลูกค้าจริง

ผลสำรวจชี้ให้เห็นว่ามี “evaluation gap” ระหว่างความต้องการเร่งรีบนำ AI ไปใช้กับระดับความเชื่อมั่นต่อกระบวนการประเมินอัตโนมัติ ซึ่งทำให้ความเสี่ยงต่อการเกิดเหตุการณ์ล้มเหลวหรือผลเสียต่อผู้ใช้อยู่ในระดับสูง

Amatriain ย้ำว่า guardrails แม้จะเป็น “necessary evil” แต่ก็อาจทำให้ระบบมีความบิดเบือนของ feedback loop เนื่องจากข้อจำกัดที่ตั้งไว้ก่อนอาจขัดกับพฤติกรรมจริงของผู้ใช้ ทำให้การเรียนรู้ของโมเดลไปในทิศทางที่ไม่สอดคล้อง

Impact

การเปลี่ยนแปลงวิธีกำหนด PRD ผ่าน evals จะส่งผลต่อหลายระดับ: ทีมพัฒนาจะต้องมุ่งเน้นการออกแบบชุดประเมินตั้งแต่ต้นขั้นตอน การตรวจสอบความปลอดภัยและการจัดการความเสี่ยงจะถูกผสานเข้ากับกระบวนการอัตโนมัติอย่างเป็นระบบ นอกจากนี้แนวคิดของ specialized agents จะทำให้ตลาด AI มีการแบ่งแยกฟังก์ชันที่ชัดเจน ส่งผลให้ผู้ใช้ได้รับประสบการณ์ที่มีความแม่นยำและปลอดภัยมากขึ้น

ในมุมของอุตสาหกรรม การกำหนดมาตรฐานใหม่เช่นนี้อาจกระตุ้นให้ผู้ประกอบการอื่น ๆ ปรับแนวทางการพัฒนา AI ให้สอดคล้องกับหลักการ “evaluate‑first” เพื่อหลีกเลี่ยงความล่าช้าในการปรับแก้หลังจากเหตุการณ์ที่เกิดขึ้นจริง

Summary

Amatriain ยืนยันว่า evaluation จะเป็นหัวใจของ PRD ใหม่ในยุค AI ที่สร้างและโค้ดโดยเครื่องจักร การนำ evals, risk‑based toll gates, และการออกแบบเอเจนต์เชิงสเปเชียลไลซ์เข้ามาเป็นหลักการพื้นฐานจะช่วยลดช่องว่างระหว่างความเร็วในการเปิดตัวกับระดับความปลอดภัยและความเชื่อมั่นของผู้ใช้.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
Evals are the new PRD, Expedia’s AI chief tells VB Transform 2026
ผู้เขียน
[email protected] (Louis Columbus)
แหล่ง
VentureBeat
วันที่เผยแพร่
22 กรกฎาคม 2569 เวลา 01:15

Related

บทความที่เกี่ยวข้อง

เพิ่มบรรทัดสรุปใน Prompt ทำให้ NotebookLM ตอบแม่นยำและเป็นระบบมากขึ้นAI
22 กรกฎาคม 2569 เวลา 03:30

เพิ่มบรรทัดสรุปใน Prompt ทำให้ NotebookLM ตอบแม่นยำและเป็นระบบมากขึ้น

ผู้ใช้เพิ่มประโยคสรุปหนึ่งบรรทัดลงท้าย Prompt ของ NotebookLM ทำให้ผลลัพธ์มีความแม่นยำและโฟกัสตามต้องการ การออกแบบ Prompt จึงกลายเป็นทักษะสำคัญในยุค AI.

XDA Developers5 นาที
PotPlayer เปิดฟีเจอร์สร้างและแปลซับไตเติ้ลอัตโนมัติแบบเรียลไทม์AI
21 กรกฎาคม 2569 เวลา 21:30

PotPlayer เปิดฟีเจอร์สร้างและแปลซับไตเติ้ลอัตโนมัติแบบเรียลไทม์

PotPlayer เพิ่มความสามารถในการสร้างซับไตเติ้ลจากเสียงวิดีโอและแปลหลายภาษาแบบเรียลไทม์ ทำให้ผู้ชมไม่ต้องค้นหาไฟล์ SRT อีกต่อไป การใช้งานง่ายผ่านเมนู Subtitle บน…

XDA Developers6 นาที
ChatGPT วิเคราะห์ประวัติการรับชมและแนะนำซีรีส์ ภาพยนตร์ อนิเมะตามรสนิยมของผู้ใช้AI
21 กรกฎาคม 2569 เวลา 14:00

ChatGPT วิเคราะห์ประวัติการรับชมและแนะนำซีรีส์ ภาพยนตร์ อนิเมะตามรสนิยมของผู้ใช้

ChatGPT วิเคราะห์ข้อมูลการรับชมจาก Netflix, Amazon Prime Video และ Crunchyroll จับรูปแบบความชอบของผู้ใช้ได้แม่นยำและเสนอรายการที่ตรงกับรสนิยม…

Tom's Guide7 นาที
หลบ "Cleanup Trap": อย่าปล่อยให้ RAG แก้ไขข้อมูลเสียAI
21 กรกฎาคม 2569 เวลา 09:30

หลบ "Cleanup Trap": อย่าปล่อยให้ RAG แก้ไขข้อมูลเสีย

RAG มักเผชิญกับ “Cleanup Trap” เมื่อข้อมูลต้นทางมี noise หรือ schema drift ทำให้ผลลัพธ์บิดเบี้ยว การแก้ไขต้องเริ่มจากการตรวจสอบและทำความสะอาด pipeline…

VentureBeat5 นาที
คัดลอกลิงก์แล้ว!