CALVER cuestiona la votación para el razonamiento causal de los LLM
El verificador simbólico superó a la selección al estilo de autoconsistencia en tareas de razonamiento causal con múltiples respuestas.
Por qué importa
El trabajo sugiere que la votación por frecuencia de respuesta es una regla de selección débil para tareas de razonamiento causal con múltiples salidas válidas. Apunta a la verificación específica del dominio, más que solo a jueces más grandes, como vía para mejorar la fiabilidad.
Puntos clave
- 1.CALVER puntúa las trazas frente a criterios causales al estilo de Pearl.
- 2.La votación puede favorecer errores de confusión repetidos frente a trazas válidas minoritarias.
- 3.Un juez de 72B no cerró la brecha reportada.
Un nuevo artículo en arXiv presenta CALVER, un verificador simbólico sin entrenamiento para seleccionar entre trazas de razonamiento causal de LLM. Los autores señalan que la autoconsistencia puede fallar cuando hay muchas respuestas válidas, porque los errores de confusión repetidos y las respuestas válidas fragmentadas pueden hacer que gane una respuesta inválida. En consultas CLEAR de encontrar una respuesta válida, CALVER alcanzó el 42,1%, mientras que la pluralidad, un modelo de recompensa, un juez LLM y la confianza del modelo se mantuvieron cerca del 30% sobre los mismos conjuntos congelados.
⚡ Pruébalo hoy
Para flujos de trabajo de razonamiento causal, evalúa la verificación simbólica o basada en reglas antes de depender de la votación por autoconsistencia.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AICan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.LGCan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.AIWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 5, 12:00 PM↗
- arXiv cs.CLLanguage Models Encode the Contextual Truth of PropositionsAug 5, 12:00 PM↗
- HF Daily PapersWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.
Google dice que está haciendo práctica la IA privada
Una publicación de Google Security generó debate en Hacker News junto con críticas más amplias a la IA.
Investigadores lanzan LittleLearner para estudiar los LLM en un entorno controlado
El modelo de 5.000 millones de parámetros se entrena con un corpus curricular de 88.000 millones de tokens de nivel quinto grado o inferior.