何が起きたか

マルチモーダル大規模言語モデルは、空間・時間・身体に関するタスクを処理するため、中間推論画像を生成するビジュアル・チェーン・オブ・ソート(Visual CoT)に依存することが多い。

Visual CoTは視覚的な先見性を高める一方で、特にプロアクティブなビデオ推論において、重大な推論オーバーヘッドをもたらす。

Appleの新しいフレームワークであるInternalized Visual Thinking(IVT)は、視覚的推論をトレーニング時に移行し、中間画像を生成せずに推論時に直接推論することを可能にする。

重要性

このアプローチは、ビデオ推論をより効率的にし、リアルタイムアプリケーションにとって実用的なものにし、計算負荷を軽減する可能性がある。

視覚的思考を内面化することで、モデルは推論品質を犠牲にすることなく高速な推論を達成でき、より幅広い展開を可能にする可能性がある。

主要な事実

Visual CoTは、空間・時間・身体に関する推論のために中間推論画像を生成する。

Visual CoTは、多大な推論オーバーヘッドをもたらす。

IVTは、テキスト予測と視覚的思考を共同で最適化するポストトレーニングフレームワークである。

IVTは、トレーニング中に視覚的思考を学習し、推論時に直接推論することを目指す。

今後の注目点

実世界のビデオタスクにおいて、IVTがVisual CoTと比較して推論精度を維持または向上できるかどうか。

大規模展開において、IVTのトレーニング効率とスケーラビリティが既存手法と比較してどうか。

出典