AAI News Hub
InvestigaciónFri, August 7, 2026·6d ago2 sources corroborating

LoT mejora la precisión en KB-VQA sin entrenar el modelo

El método en tiempo de inferencia destaca evidencias visuales y textuales antes de generar respuestas multimodales.

Por qué importa

Los resultados apuntan a la selección de evidencias en tiempo de inferencia como una vía práctica para mejorar sistemas multimodales aumentados con recuperación sin reentrenar ni cambiar la arquitectura del modelo. Esto es relevante para equipos que construyen sistemas de QA visual, donde la recuperación ruidosa y las regiones de imagen distractoras pueden deteriorar la calidad de las respuestas.

Puntos clave

  • 1.LoT usa la atención interna para seleccionar evidencias visuales y textuales.
  • 2.El método no requiere actualizar parámetros ni usar modelos auxiliares.
  • 3.Las ganancias reportadas alcanzaron hasta 12,5 puntos de precisión en los MLLMs evaluados.

Investigadores presentaron Look Twice, o LoT, un marco en tiempo de inferencia que no requiere entrenamiento para la respuesta visual a preguntas basada en conocimiento (KB-VQA). LoT utiliza los propios patrones de atención de un modelo multimodal para seleccionar regiones de imagen relevantes para la consulta y frases de texto recuperadas, filtrar contenido distractor y reformular la entrada con evidencias destacadas antes de generar la respuesta. En cuatro benchmarks de KB-VQA y 10 modelos multimodales listos para usar, de 2B a 38B parámetros, el artículo reporta mejoras en todos los backbones evaluados, con ganancias promedio de hasta 12,5 puntos de precisión.

Pruébalo hoy

Prueba el resaltado de evidencias o la reformulación de entradas basada en atención antes de ajustar finamente una canalización de KB-VQA.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación