Multimodal CoT Prompting (ES)
El prompting multimodal de cadena de pensamiento (Multimodal Chain-of-Thought Prompting, MCoT) es una extensión del método de cadena de pensamiento (CoT) a tareas que involucran múltiples tipos de datos (modalidades). En los modelos MCoT, el lenguaje y otras modalidades, como la visión o el análisis de datos tabulares, participan en un proceso unificado de inferencia paso a paso para resolver tareas complejas[1].
Este enfoque surgió con el desarrollo de los grandes modelos de lenguaje multimodales (MLLM), capaces de procesar simultáneamente texto, imágenes, audio y video. El MCoT permite a los modelos generar explicaciones interpretables y paso a paso que combinan información de diferentes fuentes, lo que aumenta la precisión y la transparencia de su funcionamiento.
Antecedentes: del CoT textual al multimodal
Cadena de Pensamiento (Chain-of-Thought) en texto
Inicialmente, el método de Cadena de Pensamiento (Chain-of-Thought, CoT) fue propuesto por investigadores de Google en 2022 para grandes modelos de lenguaje (LLM) textuales[2]. La idea consiste en entrenar al modelo para que genere una secuencia de pasos de razonamiento intermedios antes de dar la respuesta final. Añadir ejemplos de soluciones paso a paso en el prompt (few-shot prompting) mejoró notablemente la capacidad de los LLM para resolver problemas que requieren razonamiento aritmético, lógico y de sentido común, y aumentó la precisión y fiabilidad general de los modelos[2].
Transición a la multimodalidad
El éxito del CoT textual impulsó los intentos de extenderlo a escenarios multimodales. Con la aparición de los MLLM, como Kosmos-1 de Microsoft, que se entrenan simultáneamente con texto e imágenes, surgió la posibilidad de integrar la lógica del CoT con la percepción multimodal[3]. Los experimentos demostraron que dichos modelos pueden utilizar razonamientos paso a paso, teniendo en cuenta tanto las entradas textuales como las visuales, lo que demostró la viabilidad fundamental de combinar la lógica y la percepción[3].
Enfoques y metodologías principales
A partir de 2023, se han propuesto varios métodos para implementar el CoT multimodal.
Multimodal-CoT en dos etapas (Zhang et al.)
Uno de los primeros métodos, propuesto en 2023, utiliza un esquema de dos etapas[4]:
- Generación de la justificación: En el primer paso, el modelo genera una cadena de pensamiento textual (rationale) basada en información multimodal (por ejemplo, texto e imagen).
- Formulación de la respuesta: En el segundo paso, el modelo proporciona la respuesta final basándose en la justificación generada.
Este enfoque dividido permitió que un modelo con menos de mil millones de parámetros alcanzara una calidad récord en el conjunto de datos científico ScienceQA, superando incluso al gran modelo GPT-3.5. También se observó una reducción de las alucinaciones[4].
CoT Composicional (Compositional CoT)
Presentado en la conferencia CVPR 2024, este método se centra en tareas visuales-textuales y propone generar una representación estructurada de la imagen como paso intermedio[5]. Primero, el MLLM genera una descripción de la escena en forma de un grafo de escena, indicando los objetos y las relaciones entre ellos. Luego, esta descripción estructurada se incluye en el prompt para la respuesta final. Este enfoque permite al LLM considerar más profundamente las relaciones composicionales entre los objetos y mejora los resultados en tareas de descripción de escenas complejas y de respuesta a preguntas visuales[5].
CoT con separación de responsabilidades (Duty-Distinct CoT)
Este método, presentado en NeurIPS 2023, propone dividir la responsabilidad entre diferentes componentes del sistema[6]:
- El modelo de lenguaje es responsable del razonamiento lógico y la integración de la información.
- El subsistema visual (modelo de visión por computadora) se encarga de reconocer el contenido de la imagen.
Este "prompting binario" permite el "pensamiento crítico": el LLM evalúa y utiliza la información visual obtenida de un módulo visual especializado. El enfoque DDCoT permitió generar razonamientos más generales y explicables, y aumentó significativamente la precisión en tareas de QA científico multimodal[6].
Otras variantes de MCoT
También se están desarrollando activamente otros enfoques adaptados a modalidades específicas:
- Dual CoT: Un esquema de razonamiento paralelo bidireccional.
- Audio-CoT: Una adaptación de la cadena de pensamiento para tareas relacionadas con audio y habla.
- Video-of-Thought: Una técnica para el análisis paso a paso de datos de video[1].
Aplicaciones y resultados
El prompting CoT multimodal ha demostrado ser eficaz en numerosas áreas donde se requiere la combinación de información diversa.
- Educación y QA científico: Permite a los sistemas responder preguntas con diagramas e ilustraciones, proporcionando una explicación detallada de la solución (por ejemplo, en el conjunto de datos ScienceQA)[4].
- Conducción autónoma y robótica: Ayuda a interpretar secuencialmente los datos de lidares, sensores y cámaras, mejorando la comprensión de la escena y la toma de decisiones por parte de los agentes.
- IA corpórea (Embodied AI): Proporciona una planificación de acciones más fiable para los sistemas que interactúan con el mundo físico, basándose en pistas visuales y textuales.
- Medicina y atención sanitaria: La combinación de imágenes médicas (por ejemplo, radiografías) con descripciones textuales aumenta la precisión del diagnóstico y la explicabilidad de las conclusiones de la IA[1].
Desafíos y perspectivas
A pesar del progreso significativo, el uso multimodal del CoT sigue siendo un problema de investigación complejo.
- Escasez de datos etiquetados: Para entrenar a los modelos a generar razonamientos multimodales correctos se necesitan grandes conjuntos de datos con explicaciones detalladas, cuya obtención es laboriosa.
- Flexibilidad y capacidad de generalización: Los métodos ajustados para un tipo de tarea (por ejemplo, texto + imagen) pueden no transferirse bien a otras combinaciones de modalidades.
- Integración óptima: Sigue siendo una pregunta abierta cómo integrar de la mejor manera las diferentes modalidades en un proceso de razonamiento unificado para que realmente mejore la comprensión del modelo, en lugar de simplemente alargar la respuesta.
- Estandarización y evaluación: Existe la necesidad de desarrollar benchmarks estandarizados para la evaluación objetiva y la comparación de diferentes enfoques de MCoT[6].
Para lograr una IA multimodal cercana a las capacidades de inteligencia general, se requieren más innovaciones en los métodos de MCoT que tengan en cuenta las especificidades de la percepción del mundo por parte de diferentes sensores[1].
Enlaces externos
- Resumen de Multimodal CoT en la Prompting Guide
- "Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey" — una revisión científica detallada
Bibliografía
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Referencias
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. "Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey". arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. "Language Is Not All You Need: Aligning Perception with Language Models". arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. "Multimodal Chain-of-Thought Reasoning in Language Models". arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. "Compositional Chain-of-Thought Prompting for Large Multimodal Models". CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. "DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models". OpenReview, 2023. [6]