Investigadores proponen RST para tareas de agentes en terminal
Recursive Synthetic Terminal Tasks generó 37.484 tareas verificadas a partir de tareas semilla.
Por qué importa
El trabajo aborda un cuello de botella en el entrenamiento de agentes en terminal: producir tareas coherentes de largo horizonte con instrucciones, entornos, soluciones y verificadores alineados. Si es reproducible, la síntesis recursiva verificada podría reducir el costo de crear conjuntos de entrenamiento para agentes y suites de evaluación más difíciles.
Puntos clave
- 1.RST generó 37.484 tareas sintetizadas para agentes en terminal.
- 2.El costo reportado fue de aproximadamente 0,05 dólares por tarea.
- 3.El pass@4 de DeepSeek-V4-Pro cayó del 90% al 2,5% a lo largo de las rondas.
Un paper destacado por HF Daily Papers presenta Recursive Synthetic Terminal Tasks, un marco para generar tareas de entrenamiento de largo horizonte para agentes en terminal. A partir de tareas semilla verificadas, RST amplía las soluciones de referencia, realinea verificadores e instrucciones, valida las tareas en sandboxes nuevos y reutiliza las tareas aceptadas en rondas posteriores. En 15 rondas recursivas, produjo 37.484 tareas sintetizadas a un costo aproximado de 0,05 dólares por tarea, con una dificultad que aumentó ronda tras ronda.
⚡ Pruébalo hoy
Lee el paper antes de construir benchmarks para agentes en terminal o pipelines de entrenamiento sintético.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.
Google dice que está haciendo práctica la IA privada
Una publicación de Google Security generó debate en Hacker News junto con críticas más amplias a la IA.
Investigadores lanzan LittleLearner para estudiar los LLM en un entorno controlado
El modelo de 5.000 millones de parámetros se entrena con un corpus curricular de 88.000 millones de tokens de nivel quinto grado o inferior.