何が起きたか
マルチモーダル大規模言語モデルは、空間・時間・身体に関するタスクを処理するため、中間推論画像を生成するビジュアル・チェーン・オブ・ソート(Visual CoT)に依存することが多い。
Visual CoTは視覚的な先見性を高める一方で、特にプロアクティブなビデオ推論において、重大な推論オーバーヘッドをもたらす。
Appleの新しいフレームワークであるInternalized Visual Thinking(IVT)は、視覚的推論をトレーニング時に移行し、中間画像を生成せずに推論時に直接推論することを可能にする。
重要性
このアプローチは、ビデオ推論をより効率的にし、リアルタイムアプリケーションにとって実用的なものにし、計算負荷を軽減する可能性がある。
視覚的思考を内面化することで、モデルは推論品質を犠牲にすることなく高速な推論を達成でき、より幅広い展開を可能にする可能性がある。
主要な事実
Visual CoTは、空間・時間・身体に関する推論のために中間推論画像を生成する。
Visual CoTは、多大な推論オーバーヘッドをもたらす。
IVTは、テキスト予測と視覚的思考を共同で最適化するポストトレーニングフレームワークである。
IVTは、トレーニング中に視覚的思考を学習し、推論時に直接推論することを目指す。
今後の注目点
実世界のビデオタスクにおいて、IVTがVisual CoTと比較して推論精度を維持または向上できるかどうか。
大規模展開において、IVTのトレーニング効率とスケーラビリティが既存手法と比較してどうか。
