Investigadores proponen Skill Entropy para evaluar el razonamiento de los LLM
Skill^2-Bench pone a prueba cómo los modelos alternan entre habilidades en tareas de largo alcance.
Por qué importa
El trabajo apunta a una brecha en la evaluación del razonamiento de largo alcance: si los modelos pueden combinar de forma fiable distintas habilidades en cadenas dependientes. Sugiere que el cambio entre habilidades es una debilidad medible incluso en los modelos actuales más sólidos.
Puntos clave
- 1.Skill Entropy mide la dificultad de cambiar entre habilidades de razonamiento.
- 2.Skill^2-Bench cubre 558 habilidades en nueve dominios.
- 3.Los modelos evaluados perdieron precisión en tareas de mayor entropía.
Un nuevo artículo presenta Skill Entropy, una métrica para evaluar la dificultad de cambiar entre habilidades de razonamiento dentro de tareas de LLM de varios pasos. Los autores también proponen Skill^2-Bench, un benchmark que abarca 558 habilidades en nueve dominios verificables y abiertos, e informan que ocho modelos de frontera y cuatro modelos open-source pierden precisión en tareas de mayor entropía. El artículo además propone Skill-Entropy RL, que usa la entropía de habilidades como señal de entrenamiento.
⚡ Pruébalo hoy
Usa Skill^2-Bench para someter a pruebas exigentes a agentes o sistemas de razonamiento que deban combinar múltiples habilidades a través de pasos dependientes.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- arXiv cs.LGToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- HF Daily PapersToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 5, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.
Las herramientas y prácticas de IA para desarrolladores generan debate en Hacker News
Publicaciones sobre MathCode, hábitos de programación con IA, Cloudflare y HEIR de Google impulsaron la discusión.
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.