LoT mejora la precisión en KB-VQA sin entrenar el modelo
El método en tiempo de inferencia destaca evidencias visuales y textuales antes de generar respuestas multimodales.
Por qué importa
Los resultados apuntan a la selección de evidencias en tiempo de inferencia como una vía práctica para mejorar sistemas multimodales aumentados con recuperación sin reentrenar ni cambiar la arquitectura del modelo. Esto es relevante para equipos que construyen sistemas de QA visual, donde la recuperación ruidosa y las regiones de imagen distractoras pueden deteriorar la calidad de las respuestas.
Puntos clave
- 1.LoT usa la atención interna para seleccionar evidencias visuales y textuales.
- 2.El método no requiere actualizar parámetros ni usar modelos auxiliares.
- 3.Las ganancias reportadas alcanzaron hasta 12,5 puntos de precisión en los MLLMs evaluados.
Investigadores presentaron Look Twice, o LoT, un marco en tiempo de inferencia que no requiere entrenamiento para la respuesta visual a preguntas basada en conocimiento (KB-VQA). LoT utiliza los propios patrones de atención de un modelo multimodal para seleccionar regiones de imagen relevantes para la consulta y frases de texto recuperadas, filtrar contenido distractor y reformular la entrada con evidencias destacadas antes de generar la respuesta. En cuatro benchmarks de KB-VQA y 10 modelos multimodales listos para usar, de 2B a 38B parámetros, el artículo reporta mejoras en todos los backbones evaluados, con ganancias promedio de hasta 12,5 puntos de precisión.
⚡ Pruébalo hoy
Prueba el resaltado de evidencias o la reformulación de entradas basada en atención antes de ajustar finamente una canalización de KB-VQA.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AILook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLLook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLUniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question AnsweringAug 6, 12:00 PM↗
- arXiv cs.CLRepresenting Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native ModelingAug 6, 12:00 PM↗
- arXiv cs.AIPerception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question AnsweringAug 6, 12:00 PM↗
- HF Daily PapersChronoVision: Temporal Reasoning via Latent State ReconstructionAug 6, 4:00 AM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AICURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.CLCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGBayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question AnsweringAug 5, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.