LoT améliore la précision en KB-VQA sans entraîner le modèle
Cette méthode à l’inférence met en avant les preuves visuelles et textuelles avant la génération de réponses multimodales.
Pourquoi c'est important
Ces résultats indiquent que la sélection de preuves au moment de l’inférence peut être un moyen pratique d’améliorer les systèmes multimodaux augmentés par récupération, sans réentraînement ni modification de l’architecture du modèle. C’est pertinent pour les équipes qui développent des systèmes de QA visuelle, où une récupération bruitée et des zones d’image distractrices peuvent nuire à la qualité des réponses.
Points clés
- 1.LoT utilise l’attention interne pour sélectionner les preuves visuelles et textuelles.
- 2.La méthode ne nécessite ni mise à jour des paramètres ni modèles auxiliaires.
- 3.Les gains rapportés ont atteint jusqu’à 12,5 points de précision sur les MLLM évalués.
Des chercheurs ont présenté Look Twice, ou LoT, un cadre d’inférence sans entraînement pour la réponse visuelle à des questions fondée sur les connaissances. LoT s’appuie sur les schémas d’attention propres à un modèle multimodal pour sélectionner les zones d’image pertinentes pour la requête et les phrases récupérées, filtrer les contenus distracteurs et reformuler l’entrée avec les preuves mises en évidence avant la génération de la réponse. Sur quatre benchmarks KB-VQA et 10 modèles multimodaux prêts à l’emploi allant de 2B à 38B paramètres, l’article fait état d’améliorations pour chaque backbone évalué, avec des gains moyens allant jusqu’à 12,5 points de précision.
⚡ À tester aujourd'hui
Testez la mise en évidence des preuves ou la reformulation de l’entrée fondée sur l’attention avant de fine-tuner un pipeline KB-VQA.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AILook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLLook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLUniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question AnsweringAug 6, 12:00 PM↗
- arXiv cs.CLRepresenting Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native ModelingAug 6, 12:00 PM↗
- arXiv cs.AIPerception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question AnsweringAug 6, 12:00 PM↗
- HF Daily PapersChronoVision: Temporal Reasoning via Latent State ReconstructionAug 6, 4:00 AM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AICURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.CLCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGBayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question AnsweringAug 5, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.