IAR vise la QA documentaire sans retrieval
Cette méthode de post-entraînement par étapes aide les modèles à internaliser des collections de documents fixes sans retrieval au moment de l’inférence.
Pourquoi c'est important
Ces travaux répondent aux cas où le retrieval est indisponible ou indésirable en convertissant des corpus fixes en connaissances paramétriques. Ils suggèrent qu’un post-entraînement par étapes peut améliorer la QA propre à des documents tout en limitant les pertes de capacités générales.
Points clés
- 1.Trois étapes injectent, alignent et restaurent les connaissances documentaires.
- 2.IAR a surpassé la Vanilla SFT sur les quatre métriques dans 7 configurations sur 8.
- 3.Les tests couvraient les familles de modèles Llama, Phi, Qwen et SmolLM.
Des chercheurs ont proposé IAR, un cadre de post-entraînement en trois étapes pour répondre à des questions sans retrieval sur une collection documentaire délimitée. La méthode distingue l’injection de connaissances issues des documents, l’alignement du comportement en QA et la récupération des capacités générales, en combinant des objectifs de type reconstruction, une supervision de QA limitée aux réponses et une fusion avec le modèle d’instruction de base. Dans des tests Common Corpus et CCI menés sur les familles Llama, Phi, Qwen et SmolLM, IAR a amélioré le compromis entre performance principale dans le domaine et généralisation au domaine par rapport au continued pretraining classique et à la Vanilla SFT.
⚡ À tester aujourd'hui
Lisez l’article avant de remplacer le RAG par du fine-tuning pour des tâches de QA sur corpus délimité.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.
De nouveaux articles ciblent l’attention éparse pour l’IA à long contexte
Des chercheurs proposent des méthodes pour rendre moins coûteuses l’inférence à long contexte, le serving, la génération vidéo et la mémoire.