เกิดอะไรขึ้น

งาน World Robot Conference 2026 ที่กรุงปักกิ่ง เขตอี้จวง มีบริษัทเข้าร่วมกว่า 300 แห่งและจัดแสดงผลงานกว่า 3,000 ชิ้น แต่ประเด็นที่ร้อนแรงที่สุดไม่ใช่ความคล่องแคล่วทางกายภาพของหุ่นยนต์ หากแต่เป็นคำถามว่า 'สมอง' แบบไหนที่ควรใช้ควบคุมหุ่นยนต์เหล่านี้ ผู้ปฏิบัติงานในวงการถกเถียงกันว่าโมเดล VLA, world model หรือสถาปัตยกรรมแบบรวมศูนย์บางรูปแบบ จะเป็นรูปแบบสุดท้ายของ embodied intelligence

บรรยากาศการถกเถียงในปีนี้เย็นลงเมื่อเทียบกับปีก่อน ๆ แบรนด์ VLA ปรากฏให้เห็นน้อยลง และแนวคิด 'end-to-end' ก็ไม่ถูกมองว่าเป็นคำตอบสากลอีกต่อไป แทนที่ด้วย 'world model' ที่กลายเป็นคำฮิตใหม่ แม้ว่าแต่ละบริษัทจะให้นิยามแตกต่างกันไป ตั้งแต่การสร้างสถานะในอนาคต การทำนายห่วงโซ่เหตุและผล ไปจนถึงการให้เหตุผลในปริภูมิแฝง (latent space) ซูหาง (Su Hang) นักวิจัยจากมหาวิทยาลัยชิงหัว ระบุว่า VLA และ world model ไม่ได้ขัดแย้งกัน ขณะที่ซีอีโอของ Xinghaitu กล่าวว่าทั้งสองแนวทางมีแกนกลางที่อิงกับ Transformer เหมือนกัน และในที่สุดจะบรรจบกัน หลายบริษัท รวมถึง Qinglang Intelligent, Zhicheng AI, Wudong Power และ Unitree ต่างนำเสนอการประยุกต์ใช้ world model ในรูปแบบที่แตกต่างกัน

ผู้เล่นรายอื่นเดินหน้าไปไกลกว่านั้น โดย Beijing Humanoid Robot Innovation Center เปิดตัว Pelican-Unify ซึ่งเป็น embodied world model แบบรวมการแสดงผล ที่ผสานการเข้าใจภาพ การควบคุมการเคลื่อนไหว และการทำนายสภาพแวดล้อมเข้าไว้ด้วยกัน ส่วน Zhipingfang เปิดซอร์สโมเดลที่จำลองแนวคิดจากสมองซีกนอก (cortex) สมองน้อย (cerebellum) และไขสันหลัง ขณะที่ Shenyi Robot นำเสนอ 'โมเดลผู้เชี่ยวชาญทางกายภาพแบบผสม' ที่สามารถพัฒนาตนเองได้ ผู้สังเกตการณ์มองว่าข้อสรุปที่ชัดเจนที่สุดจากงานนี้คือ ยังไม่มีแนวทางใดที่ชนะเบ็ดเสร็จ แต่ทิศทางเริ่มชัดเจนขึ้นเรื่อย ๆ โดยข้อมูล (data) กำลังกลายเป็นประเด็นหลักของอุตสาหกรรม

เหตุใดจึงสำคัญ

การที่บทสนทนาเปลี่ยนจากแขนขาไปสู่สมองของหุ่นยนต์ เป็นสัญญาณว่า embodied intelligence กำลังก้าวเข้าสู่ยุคที่ขับเคลื่อนด้วยซอฟต์แวร์และข้อมูล หากฮาร์ดแวร์ถูกพัฒนาจนถึงขีดจำกัดแล้ว สนามแข่งขันถัดไปจะอยู่ที่วิธีที่หุ่นยนต์รับรู้ ให้เหตุผล และลงมือปฏิบัติในโลกกายภาพ ซึ่งจะถูกกำหนดโดยสถาปัตยกรรมอัลกอริทึมร่วมกับข้อมูลจากโลกจริง

การที่นิยามของ world model กระจัดกระจายและมีหลายแนวทางอยู่ร่วมกัน สร้างความไม่แน่นอนอย่างมากสำหรับนักลงทุนและนักพัฒนา บริษัทต่าง ๆ กำลังเดิมพันกับแนวทางเทคนิคที่ต่างกัน บ้างผสาน VLA เข้ากับ world model บ้างมุ่งไปที่การแสดงผลแบบรวมศูนย์ และบ้างหันไปหาโครงสร้างที่ได้แรงบันดาลใจจากสมอง เดิมพันนี้สูงมากเพราะสถาปัตยกรรมที่ชนะอาจกลายเป็นแพลตฟอร์มมาตรฐานสำหรับหุ่นยนต์ฮิวแมนอยด์ทั้งในบ้านและโรงงาน

แม้ผู้บริหารหลายคนจะแสดงวิสัยทัศน์อันยิ่งใหญ่ ตั้งแต่การปลดปล่อยผู้คนนับพันล้านจากงานซ้ำซาก ไปจนถึงการบรรลุ AI แบบรวมศูนย์ แต่อุตสาหกรรมยังขาดนิยามร่วมและมาตรฐานการประเมินผลที่เป็นหนึ่งเดียว การแข่งขันที่แท้จริง ตามที่ผู้บรรยายหลายคนย้ำ คือใครที่สามารถเก็บและใช้ข้อมูลได้อย่างมีประสิทธิภาพ เพื่อปิดวงจรตั้งแต่การรับรู้ไปจนถึงการลงมือปฏิบัติในสภาพแวดล้อมจริง

ข้อเท็จจริงสำคัญ

ในงาน WRC 2026 มีบริษัทเข้าร่วมกว่า 300 แห่ง และจัดแสดงผลงานกว่า 3,000 ชิ้น ที่กรุงปักกิ่ง เขตอี้จวง

Qinglang Intelligent เปิดตัว KOM 3.0 ซึ่งอธิบายว่าเป็นสถาปัตยกรรม VLA แรกของโลกสำหรับอุตสาหกรรมบริการ ที่ผสานรวม world model ในปริภูมิแฝง

Zhicheng AI กำลังพัฒนา world model ทางกายภาพที่อิงกับ JEPA สำหรับ 'การจำลองทางจิต' ก่อนลงมือทำภารกิจจริง

Pelican-Unify ของ Beijing Humanoid Robot Innovation Center ขึ้นแท่นอันดับหนึ่งในตารางประเมินระดับโลก WorldArena เมื่อเดือนพฤษภาคม 2026

Zhipingfang เปิดซอร์ส NeuroVLA ซึ่งเป็นสถาปัตยกรรมคล้ายสมองที่จำลองแบบจากสมองซีกนอก สมองน้อย และไขสันหลัง

ฉันทามติของอุตสาหกรรมกำลังมุ่งไปสู่ความท้าทายเชิงปฏิบัติที่เน้นข้อมูลเป็นศูนย์กลาง มากกว่าการถกเถียงเชิงอุดมการณ์เรื่องแนวทาง

สิ่งที่ต้องจับตาต่อไป

มาตรฐานการประเมิน world model จะถูกรวมเป็นหนึ่งเดียวหรือไม่ เพราะหากไม่มีมาตรฐานร่วม การเปรียบเทียบระหว่างระบบต่าง ๆ จะยังคงคลุมเครือและฉุดรั้งความก้าวหน้าของอุตสาหกรรม

บริษัทใดจะสามารถพิสูจน์ได้ว่าสถาปัตยกรรมของตนใช้งานได้จริงในบ้านและโรงงานจริง ไม่ใช่แค่ในงานแสดงหรือสนามทดสอบ โดยสามารถหมุนวงจรข้อมูลได้อย่างราบรื่นในการใช้งานประจำวัน

ความเป็นไปได้ที่จะเกิดการออกแบบแบบผสมผสาน โดยผู้เชี่ยวชาญในอุตสาหกรรมหลายคนคาดการณ์ว่าสมองหุ่นยนต์ในรูปแบบสุดท้ายอาจผสานการสร้างการกระทำแบบ VLA เข้ากับการทำนายและแก้ไขแบบ world model แทนที่จะเลือกใช้โมเดลใดโมเดลหนึ่งเพียงอย่างเดียว

แหล่งที่มา