Une étude sur Wnuan teste un post-entraînement par étapes pour le question-réponse en entreprise
Une voie en 32B a relevé le taux de réponses acceptables sur WnuanBench, tout en réduisant les scores aux benchmarks généraux.
Pourquoi c'est important
Ces résultats montrent qu’un post-entraînement par étapes peut améliorer nettement les performances de question-réponse dans un domaine donné, mais au prix de compromis mesurables sur les capacités générales. L’évaluation des gains sur les tâches d’entreprise comme des régressions plus larges devient donc centrale dans les décisions de déploiement.
Points clés
- 1.Wnuan cible le question-réponse propriétaire en entreprise au moyen d’un post-entraînement par étapes.
- 2.Une voie en 32B a atteint 91,51 % de réponses acceptables après RL.
- 3.La moyenne sur les benchmarks généraux a reculé de 5,17 points sur l’ensemble de la voie.
Un nouvel article publié sur arXiv présente Wnuan, un pipeline en trois étapes pour le question-réponse en entreprise à partir de connaissances propriétaires. La méthode construit une supervision orientée tâche à partir de documents, applique un fine-tuning supervisé avec réinjection de données générales, puis utilise l’apprentissage par renforcement sur les erreurs résiduelles. Sur WnuanBench, qui compte 707 questions, la principale voie en 32B a fait passer le taux de réponses acceptables de 52,76 % avant adaptation à 80,06 % après SFT, puis à 91,51 % après RL, tandis que la moyenne sur les benchmarks généraux reculait de 5,17 points.
⚡ À tester aujourd'hui
Auditer les adaptations de question-réponse en entreprise à la fois sur des benchmarks de domaine et sur des tests généraux de suivi d’instructions avant le déploiement.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.
De nouveaux articles s’attaquent au raisonnement des VLM sur les longs documents
InSight-doc, DocAtlas et DocMemo proposent des approches agentiques pour retrouver des preuves dans des documents complexes.