무슨 일이 있었나
멀티모달 대규모 언어 모델은 공간적, 시간적, 체화된(embodied) 작업을 처리하기 위해 중간 추론 이미지를 생성하는 visual chain-of-thought(Visual CoT)에 의존하는 경우가 많습니다.
Visual CoT는 시각적 예측을 돕지만, 특히 능동적 비디오 추론의 경우 상당한 추론 오버헤드를 추가합니다.
Apple의 새로운 프레임워크인 Internalized Visual Thinking(IVT)은 시각적 추론을 훈련 시간으로 옮겨, 중간 이미지 생성 없이 추론 시 직접 추론할 수 있게 합니다.
왜 중요한가
이 접근 방식은 비디오 추론을 더 효율적으로 만들고 실시간 애플리케이션에 실용적으로 만들어 계산 부담을 줄일 수 있습니다.
시각적 사고를 내재화함으로써 모델은 추론 품질을 희생하지 않고 더 빠른 추론을 달성할 수 있으며, 잠재적으로 더 광범위한 배포를 가능하게 할 수 있습니다.
주요 사실
Visual CoT는 공간적, 시간적, 체화된 추론을 위해 중간 추론 이미지를 생성합니다.
Visual CoT는 상당한 추론 오버헤드를 발생시킵니다.
IVT는 텍스트 예측과 시각적 사고를 공동으로 최적화하는 사후 훈련 프레임워크입니다.
IVT는 훈련 중에 시각적 사고를 학습하고 추론 시 직접 추론하는 것을 목표로 합니다.
다음에 주목할 점
IVT가 실제 비디오 작업에서 Visual CoT와 비교하여 추론 정확도를 유지하거나 향상시킬 수 있는지.
대규모 배포에서 IVT의 훈련 효율성과 확장성이 기존 방법과 어떻게 비교되는지.
