Qué ocurrió

Los modelos multimodales de gran tamaño (LLM) suelen apoyarse en el razonamiento visual en cadena (Visual CoT), que genera imágenes de razonamiento intermedias para abordar tareas espaciales, temporales y de tipo embodied.

Aunque el Visual CoT ayuda a la anticipación visual, añade una sobrecarga de inferencia considerable, especialmente en el razonamiento de video proactivo.

El nuevo marco de Apple, Internalized Visual Thinking (IVT), traslada el razonamiento visual a la fase de entrenamiento, permitiendo razonar directamente en la inferencia sin necesidad de generar imágenes intermedias.

Por qué importa

Este enfoque podría hacer que el razonamiento de video fuera más eficiente y práctico para aplicaciones en tiempo real, reduciendo la carga computacional.

Al internalizar el pensamiento visual, los modelos podrían lograr una inferencia más rápida sin sacrificar la calidad del razonamiento, lo que potencialmente permitiría un despliegue más amplio.

Datos clave

El Visual CoT genera imágenes de razonamiento intermedias para el razonamiento espacial, temporal y embodied.

El Visual CoT introduce una sobrecarga de inferencia sustancial.

IVT es un marco de post-entrenamiento que optimiza conjuntamente la predicción textual y el pensamiento visual.

IVT busca aprender el pensamiento visual durante el entrenamiento y razonar directamente en la inferencia.

Qué observar a continuación

Si IVT puede mantener o mejorar la precisión del razonamiento frente al Visual CoT en tareas de video del mundo real.

Cómo se comparan la eficiencia de entrenamiento y la escalabilidad de IVT con los métodos existentes en despliegues a gran escala.

Fuentes