เกิดอะไรขึ้น
ทีม Apple Machine Learning เปิดตัว Luce ซึ่งเป็นรูปแบบการแสดงผลข้อมูล 3 มิติที่ออกแบบมาสำหรับการสร้างโมเดล 3 มิติจากภาพ (image-to-3D) ที่มีความละเอียดสูง โดยสามารถจับทั้งรูปทรงเรขาคณิตและลักษณะพื้นผิวได้พร้อมกัน
รูปแบบนี้ผสานรูปทรงเรขาคณิตเข้ากับวัสดุแบบ physically based rendering (PBR) ซึ่งรวมถึงค่า albedo, metallic-roughness และ surface normals เพื่อรองรับการปรับแสงใหม่ (relighting) และการนำไปใช้งานร่วมกับ pipeline การเรนเดอร์มาตรฐานทั่วไป
Luce จัดเรียงข้อมูลรูปทรงเรขาคณิตและวัสดุ PBR ไว้ในรูปแบบ voxelized multimodal Gaussian cloud โดยแต่ละโมดัลิตี้จะมี Gaussian primitives เฉพาะของตัวเอง และใช้ variational autoencoder ในการบีบอัดข้อมูลทั้งหมดให้อยู่ใน material-aware latent space แบบรวมศูนย์เดียว
เหตุใดจึงสำคัญ
ด้วยการนำวัสดุ PBR เข้ามาไว้ในรูปแบบการแสดงผล 3 มิติโดยตรง Luce มุ่งหวังที่จะทำให้ asset ที่สร้างขึ้นสามารถใช้งานร่วมกับ pipeline การเรนเดอร์มาตรฐานได้ ซึ่งอาจช่วยให้ผลลัพธ์จาก image-to-3D นำไปใช้งานจริงได้มากขึ้นในกระบวนการทำงานที่ต้องการการปรับแสงใหม่
material-aware latent space แบบรวมศูนย์นี้ชี้ให้เห็นแนวทางที่จะสร้างรูปทรงเรขาคณิตและลักษณะพื้นผิวไปพร้อมกัน แทนที่จะแยกเป็นส่วนประกอบที่ไม่ค่อยสอดคล้องกัน
การใช้ multimodal Gaussian primitives ถือเป็นก้าวหนึ่งไปสู่รูปแบบการแสดงผลที่มีความสามารถเพียงพอสำหรับ asset ที่มีรายละเอียดสูง และในขณะเดียวกันก็มีโครงสร้างที่เอื้อต่อการสร้างโมเดลอย่างมีประสิทธิภาพ
ข้อเท็จจริงสำคัญ
Luce เป็นรูปแบบการแสดงผล 3 มิติที่รวมรูปทรงเรขาคณิตและวัสดุ PBR เข้าไว้ด้วยกันในรูปแบบ voxelized multimodal Gaussian cloud
มีการใช้ Gaussian primitives เฉพาะสำหรับแต่ละโมดัลิตี้ ซึ่งรวมถึง albedo, metallic-roughness และ surface normals
variational autoencoder จะบีบอัดรูปแบบการแสดงผลนี้ให้อยู่ใน material-aware latent space แบบรวมศูนย์เดียว
สิ่งที่ต้องจับตาดูต่อไป
รายละเอียดในเปเปอร์ยังมีเพียงบางส่วน ดังนั้นข้อมูลเพิ่มเติมที่จะตามมาอาจช่วยอธิบายให้ชัดเจนขึ้นว่า Luce ถูกนำไปใช้จริงอย่างไรในการสร้างโมเดล 3 มิติจากภาพและการเรนเดอร์
ควรติดตามผลงานตีพิมพ์ด้าน machine learning ของ Apple อย่างต่อเนื่อง เพื่อดูผลการทดลองและการเปรียบเทียบกับวิธีการสร้างโมเดล 3 มิติแบบอื่น ๆ
