Artigos de IR jurídico miram vazamento e recuperação em nível de parágrafo
Dois novos relatórios alertam para riscos de vazamento em benchmarks e acrescentam um conjunto de dados do CJEU para recuperação jurídica em múltiplos níveis.
Por que importa
Os relatórios apontam para um problema comum de avaliação em IA jurídica: vazamentos e corpora simplificados demais podem inflar o desempenho de recuperação. Controles temporais melhores e benchmarks em nível de parágrafo podem tornar sistemas de recuperação jurídica mais confiáveis para tarefas voltadas à prática.
Pontos-chave
- 1.A barreira temporal limita o contexto de citações às informações disponíveis antes do caso consultado.
- 2.O LegalPincite acrescenta ground truth de citações do CJEU em nível de caso e de parágrafo.
- 3.Ambos os relatórios miram avaliações infladas de recuperação jurídica.
Dois relatórios sobre recuperação de informação jurídica se concentram em tornar mais realista a avaliação da recuperação de jurisprudência. Um artigo no arXiv apresenta um recuperador sem parâmetros e com barreira temporal, que limita o contexto de citações de entrada às citações anteriores ao caso consultado, e relata que 14,9% do ganho sem essa barreira no contexto de citações na validação do ECtHR-PCR veio de citações que não se sabia serem anteriores à consulta. Um relatório separado do LegalPincite apresenta um conjunto de dados de decisões do CJEU com consultas mascaradas por caso e por parágrafo, todos os parágrafos no corpus e citações de referência em nível de caso e de parágrafo, com validação parcial por especialistas humanos.
⚡ Experimente hoje
Audite experimentos de IR jurídico em busca de vazamento temporal e teste métodos em cenários de recuperação mascarada em nível de parágrafo antes de confiar em ganhos de benchmark.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.