Des articles sur la recherche d’information juridique ciblent les fuites et la recherche au niveau du paragraphe
Deux nouveaux rapports signalent des risques de fuite dans les benchmarks et ajoutent un jeu de données de la CJUE pour la recherche juridique multi-niveaux.
Pourquoi c'est important
Ces rapports mettent en évidence un problème d’évaluation commun dans l’IA juridique : les fuites et les corpus trop simplifiés peuvent gonfler les performances de recherche. De meilleurs contrôles temporels et des benchmarks au niveau du paragraphe pourraient rendre les systèmes de recherche juridique plus fiables pour des tâches orientées vers la pratique.
Points clés
- 1.L’encadrement temporel limite le contexte des citations aux informations disponibles avant l’affaire requête.
- 2.LegalPincite ajoute une vérité terrain des citations de la CJUE aux niveaux de l’affaire et du paragraphe.
- 3.Les deux rapports visent les évaluations de recherche juridique aux performances artificiellement gonflées.
Deux rapports sur la recherche d’information juridique cherchent à rendre l’évaluation de la recherche dans la jurisprudence plus réaliste. Un article publié sur arXiv présente un moteur de recherche sans paramètres, encadré temporellement, qui limite le contexte des citations entrantes aux citations antérieures à l’affaire requête, et indique que 14,9 % du gain lié à un contexte de citation non encadré sur la validation ECtHR-PCR provenait de citations dont il n’était pas établi qu’elles précédaient la requête. Un rapport distinct sur LegalPincite présente un jeu de données de jugements de la CJUE avec des requêtes masquées par affaire et par paragraphe, tous les paragraphes du corpus, ainsi que des citations de référence aux niveaux de l’affaire et du paragraphe, partiellement validées par des experts humains.
⚡ À tester aujourd'hui
Auditer les expériences de recherche d’information juridique pour détecter les fuites temporelles et tester les méthodes dans des configurations de recherche masquée au niveau du paragraphe avant de se fier aux gains observés sur les benchmarks.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.