AAI News Hub
InvestigaciónWed, August 5, 2026·Aug 52 sources corroborating

Investigadores proponen Skill Entropy para evaluar el razonamiento de los LLM

Skill^2-Bench pone a prueba cómo los modelos alternan entre habilidades en tareas de largo alcance.

Por qué importa

El trabajo apunta a una brecha en la evaluación del razonamiento de largo alcance: si los modelos pueden combinar de forma fiable distintas habilidades en cadenas dependientes. Sugiere que el cambio entre habilidades es una debilidad medible incluso en los modelos actuales más sólidos.

Puntos clave

  • 1.Skill Entropy mide la dificultad de cambiar entre habilidades de razonamiento.
  • 2.Skill^2-Bench cubre 558 habilidades en nueve dominios.
  • 3.Los modelos evaluados perdieron precisión en tareas de mayor entropía.

Un nuevo artículo presenta Skill Entropy, una métrica para evaluar la dificultad de cambiar entre habilidades de razonamiento dentro de tareas de LLM de varios pasos. Los autores también proponen Skill^2-Bench, un benchmark que abarca 558 habilidades en nueve dominios verificables y abiertos, e informan que ocho modelos de frontera y cuatro modelos open-source pierden precisión en tareas de mayor entropía. El artículo además propone Skill-Entropy RL, que usa la entropía de habilidades como señal de entrenamiento.

Pruébalo hoy

Usa Skill^2-Bench para someter a pruebas exigentes a agentes o sistemas de razonamiento que deban combinar múltiples habilidades a través de pasos dependientes.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación