SkillGate apunta a la selección de habilidades en agentes de largo horizonte
El paper propone canales de crédito separados para elegir y ejecutar habilidades de agentes.
Por qué importa
A medida que los sistemas de agentes dependen de bibliotecas de habilidades más grandes, elegir la habilidad adecuada se convierte en una decisión de política, no en un paso fijo de orquestación. El trabajo señala un modo de fallo de entrenamiento que podría afectar la fiabilidad de los agentes de largo horizonte.
Puntos clave
- 1.La selección de habilidades se plantea como una decisión dentro de la política durante los episodios del agente.
- 2.El RL recompensado por resultados puede asignar mal el crédito a los tokens de elección de habilidades.
- 3.SkillGate separa el crédito por elegir habilidades y por ejecutarlas.
Un nuevo paper, "SkillGate", sostiene que los marcos de agentes de largo horizonte carecen de una señal de entrenamiento para decidir qué archivo de habilidad procedimental leer durante un episodio. Los autores identifican la "inanición de crédito del selector", un fenómeno en el que el aprendizaje por refuerzo recompensado por resultados asigna a los tokens de selección de habilidades demasiado poco crédito, y cada vez más desviado, a medida que las trayectorias se alargan. SkillGate lo aborda separando el crédito por resultado para los tokens de ejecución de una ventaja local a la acción para los tokens que nombran habilidades.
⚡ Pruébalo hoy
Lee el paper antes de entrenar agentes que seleccionen entre grandes bibliotecas de habilidades con recompensas de RL a nivel de secuencia.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Las soluciones matemáticas de OpenAI avivan el debate entre los matemáticos
The Verge informa que el trabajo de OpenAI sobre antiguos problemas matemáticos ha abierto interrogantes en toda la disciplina.
Un preprint propone una neurona espectral para ML interpretable
El modelo usa matrices simétricas aprendidas y valores propios para equilibrar expresividad y transparencia.
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.