Investigación
60 resúmenes
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.
Un estudio prueba la transferencia de memoria entre modelos para LLMs
Investigadores analizan cómo una memoria aprendida y congelada puede moverse entre backbones de modelos mediante un lector del lado del modelo destino.
DiSCO apunta a la seguridad de texto a imagen en modelos de caja negra
El paper de arXiv propone una optimización a nivel de prompt para reducir salidas NSFW sin acceder al modelo.
PTXBench pone a prueba a los LLM en la optimización de kernels para GPU
El benchmark evalúa el uso de PTX específico de cada arquitectura en cargas de trabajo GEMM y de atención sobre GPU H100 y B200.
Investigadores proponen marcos de RL para harnesses de agentes
LEGO-RL y ClawGym II buscan un aprendizaje por refuerzo estable para agentes de IA de horizonte largo.
IBM prueba cuánta memoria necesitan los agentes de IA
Un estudio de ALTK-Evolve concluye que las mejoras por memoria en agentes dependen de la capacidad del modelo y de la estrategia de entrega.
Investigadores presentan TTP-D para la planificación de rutas con camiones y drones
El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
Aprender lo que queda, no lo ya dominado: reponderación de ventajas consciente de la saturación para la optimización de políticas con múltiples recompensas
arXiv:2608.
TRACE-Bench apunta a la generación de imágenes con múltiples referencias
El benchmark descompone los prompts en cuatro operadores para diagnosticar fallos de los modelos.
Flow Motion Policy: planificación de movimientos de manipuladores con modelos de Flow Matching
arXiv:2604.
Investigadores adaptan OPD para un razonamiento de video más eficiente
Dos estudios usan técnicas de destilación para mejorar modelos más pequeños o de transmisión orientados a la comprensión de video.
Investigadores proponen RUPA para medir la incertidumbre en agentes LLM
El marco estima la confianza a lo largo de trayectorias completas del agente, no solo en pasos locales.
Nuevos papers apuntan al entrenamiento de agentes LLM de largo horizonte
Investigadores proponen TRCA, RLCascadeRouter y Agentic ESOpt para crédito de agentes, enrutamiento y fine-tuning.
Nuevos estudios cartografían las exigencias de servicio para la IA agéntica
Cuatro artículos analizan la latencia, el almacenamiento en caché, las trazas y el servicio en el edge para cargas de trabajo de LLM agénticos.
Un artículo unifica las redes neuronales de grafos en una sola ecuación de capa
El marco encuadra las arquitecturas GNN en siete componentes computacionales.
Investigadores apuntan a la edición composicional de imágenes y video
Nuevos artículos proponen datos de entrenamiento y métodos de destilación para modelos unificados de generación y edición.
StartupBench pone a prueba a los agentes en flujos de trabajo de startups
El benchmark evalúa el trabajo integral de agentes a partir de productos de IA validados por el mercado.
Investigadores proponen aDSL para la creación 3D agéntica
El paper combina un lenguaje 3D centrado en agentes con un flujo multiagente sin entrenamiento.
Un estudio de Abra traza las leyes de escalado en el entrenamiento de imágenes por difusión
HF Daily Papers destaca un estudio sobre escalado computacional en modelos de difusión de texto a imagen.
GS-Voxel apunta a la generación aérea de 3DGS a gran escala
El framework convierte escenas 3D Gaussian ya preoptimizadas en latentes estructurados dispersos, sin ajuste por escena.
Un artículo propone un diseño de datos centrado en capacidades para la generación de imágenes
El marco organiza los datos de entrenamiento para generación de imágenes en torno a dependencias entre capacidades.
Investigadores presentan ASI-Bench para la ciencia autónoma
El benchmark evalúa la exploración innovadora y la ejecución científica en 60 tareas de investigación.
Un estudio prueba DeepSeek Harness frente a la inyección de prompts
Un resumen de HF Daily Papers informa de 14.560 ejecuciones controladas en 16 canales de contenido indirecto.
Nuevos estudios apuntan a la navegación embodied basada en memoria
UniWM y TAMP-Nav proponen formas distintas de alinear predicción visual, memoria y acción en agentes de navegación.
EditBridge apunta a la edición de imágenes de ultra alta resolución
El método de puente de difusión busca preservar los detalles de la imagen original mientras perfecciona ediciones de baja resolución.
Investigadores apuntan a reducir la latencia de MoE en visión y decodificación
Nuevos papers proponen codificadores de visión MoE, decodificación más rápida en lotes pequeños y balanceo de carga en línea.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.
R^3-Bench pone a prueba el razonamiento de los LLM con presupuestos compartidos
El benchmark evalúa seis modelos en conjuntos de problemas con computación limitada.
ClawGym II apunta al RL de caja negra para arneses de agentes
El artículo propone rollouts en entornos aislados y recuperación de trayectorias para entrenar agentes mediante arneses complejos.
GenRouter dirige prompts de generación de imágenes hacia flujos de trabajo más baratos
El framework estandariza pipelines agénticos de imágenes y dirige los prompts según las exigencias de la tarea.
Ventor-QTest audita APIs de LLM alojadas por proveedores
El paper propone un método de caja negra para detectar pérdidas de fidelidad en APIs de modelos open-weight alojados.
HarnessEval-W incorpora pruebas basadas en agentes para modelos del mundo
El pipeline de benchmark utiliza subagentes para evaluar rollouts con cadenas de razonamiento inspeccionables.
Un estudio entrena modelos de difusión en espacio de píxeles más rápidos
HF Daily Papers destaca una receta de entrenamiento de latente a píxel para difusión de texto a imagen.
AnyTalk genera animación del habla sin datos de animación
El método adapta modelos de difusión de video para crear animación del habla en personajes 3D con sincronización labial.
HiFi-BRep busca una generación de B-Rep más robusta
El framework usa codificación consciente de la topología y decodificación paralela para mejorar las representaciones de frontera en CAD.
GRNEdit propone una edición de video ligera basada en instrucciones
El artículo plantea las ediciones de video como decisiones binarias de conservar o cambiar sobre códigos visuales.
Investigadores llevan los modelos de difusión al espacio de píxeles
Dos artículos proponen métodos de difusión en espacio de píxeles para restauración de imágenes y generación de texto a imagen.
Las herramientas y prácticas de IA para desarrolladores generan debate en Hacker News
Publicaciones sobre MathCode, hábitos de programación con IA, Cloudflare y HEIR de Google impulsaron la discusión.
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.
Google dice que está haciendo práctica la IA privada
Una publicación de Google Security generó debate en Hacker News junto con críticas más amplias a la IA.
Investigadores lanzan LittleLearner para estudiar los LLM en un entorno controlado
El modelo de 5.000 millones de parámetros se entrena con un corpus curricular de 88.000 millones de tokens de nivel quinto grado o inferior.
HN debate los límites de la IA, la privacidad y las afirmaciones científicas
Publicaciones sobre descubrimiento de fármacos, matemáticas, privacidad y laboratorios de IA generaron una activa discusión en Hacker News.
Nuevos informes ponen a prueba las afirmaciones sobre la IA en la ciencia y el trabajo
Debates en Hacker News destacaron evidencias sobre la IA en el descubrimiento de fármacos, las matemáticas y el uso de ChatGPT.
Investigadores apuntan a las brechas de razonamiento espacial en los VLM
Nuevos artículos proponen memoria, RL y benchmarks para la inteligencia espacial en sistemas de visión-lenguaje.
Google lanza Gemini 3.7 Flash para programación y agentes
El nuevo modelo Flash está disponible en Gemini API, Google AI Studio, Android Studio y herramientas empresariales.
Nuevos estudios examinan la inteligencia espacial en la IA de visión
SpaRRTa, SMA y PinpointQA evalúan o mejoran el razonamiento espacial en sistemas de IA visual y encarnada.
CW-BASS v2 apunta a la selección de pseudoetiquetas con DINOv2
El método adapta el filtrado para la segmentación semisupervisada con modelos fundacionales como docentes.
Un estudio de Anthropic revela que los agentes de IA pueden entrar en conflicto en tareas compartidas
Los investigadores afirman que el comportamiento multiagente puede dejar al descubierto carencias en las pruebas actuales de seguridad de la IA.
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.
Investigadores prueban arneses para agentes corporizados
Thea y SHAPER trasladan a robots y a la IA corporizada ideas de infraestructura usadas en agentes de programación.
Un estudio analiza las rutas de control en GPU para agentes LLM
Ready Cohorts modela cuándo el trabajo de control de agentes puede permanecer en la GPU en lugar de volver al host.
Mechanist dirige agentes de IA a la interpretabilidad de modelos
El artículo en arXiv describe un sistema agéntico para el descubrimiento mecanístico autónomo en modelos de IA.
Nuevos papers apuntan a los límites de exploración de los LLM
DORA, 3PO y RISE-RL proponen formas de mejorar la exploración en agentes y entrenamiento RL.
Nuevos estudios enmarcan y ponen a prueba los modelos de mundo para robótica
Un tutorial y un benchmark abordan las definiciones y la evaluación de los modelos de mundo interactivos.