AAI News Hub

Investigación

60 resúmenes

Investigación

HarnessRisk evalúa fallos de seguridad en arneses de agentes

El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.

arXiv cs.AI+1 outlet·19h ago
Investigación

Agent Lightning v1.0 apunta al RL agéntico con harness

El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.

arXiv cs.AI+1 outlet·19h ago
Investigación

Un estudio prueba la transferencia de memoria entre modelos para LLMs

Investigadores analizan cómo una memoria aprendida y congelada puede moverse entre backbones de modelos mediante un lector del lado del modelo destino.

arXiv cs.AI+1 outlet·19h ago
Investigación

DiSCO apunta a la seguridad de texto a imagen en modelos de caja negra

El paper de arXiv propone una optimización a nivel de prompt para reducir salidas NSFW sin acceder al modelo.

arXiv cs.AI+1 outlet·19h ago
Investigación

PTXBench pone a prueba a los LLM en la optimización de kernels para GPU

El benchmark evalúa el uso de PTX específico de cada arquitectura en cargas de trabajo GEMM y de atención sobre GPU H100 y B200.

arXiv cs.AI+1 outlet·19h ago
Investigación

Investigadores proponen marcos de RL para harnesses de agentes

LEGO-RL y ClawGym II buscan un aprendizaje por refuerzo estable para agentes de IA de horizonte largo.

arXiv cs.AI+1 outlet·19h ago
Investigación

IBM prueba cuánta memoria necesitan los agentes de IA

Un estudio de ALTK-Evolve concluye que las mejoras por memoria en agentes dependen de la capacidad del modelo y de la estrategia de entrega.

Hugging Face·1d ago
Investigación

Investigadores presentan TTP-D para la planificación de rutas con camiones y drones

El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.

arXiv cs.AI+1 outlet·1d ago
Investigación

Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM

El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.

arXiv cs.AI+1 outlet·1d ago
Investigación

AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices

Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.

arXiv cs.AI+1 outlet·1d ago
Investigación

Aprender lo que queda, no lo ya dominado: reponderación de ventajas consciente de la saturación para la optimización de políticas con múltiples recompensas

arXiv:2608.

arXiv cs.AI+1 outlet·1d ago
Investigación

TRACE-Bench apunta a la generación de imágenes con múltiples referencias

El benchmark descompone los prompts en cuatro operadores para diagnosticar fallos de los modelos.

arXiv cs.AI+1 outlet·1d ago
Investigación

Flow Motion Policy: planificación de movimientos de manipuladores con modelos de Flow Matching

arXiv:2604.

arXiv cs.AI+1 outlet·1d ago
Investigación

Investigadores adaptan OPD para un razonamiento de video más eficiente

Dos estudios usan técnicas de destilación para mejorar modelos más pequeños o de transmisión orientados a la comprensión de video.

arXiv cs.AI+1 outlet·1d ago
Investigación

Investigadores proponen RUPA para medir la incertidumbre en agentes LLM

El marco estima la confianza a lo largo de trayectorias completas del agente, no solo en pasos locales.

arXiv cs.CL+1 outlet·1d ago
Investigación

Nuevos papers apuntan al entrenamiento de agentes LLM de largo horizonte

Investigadores proponen TRCA, RLCascadeRouter y Agentic ESOpt para crédito de agentes, enrutamiento y fine-tuning.

arXiv cs.AI+1 outlet·1d ago
Investigación

Nuevos estudios cartografían las exigencias de servicio para la IA agéntica

Cuatro artículos analizan la latencia, el almacenamiento en caché, las trazas y el servicio en el edge para cargas de trabajo de LLM agénticos.

arXiv cs.AI+1 outlet·1d ago
Investigación

Un artículo unifica las redes neuronales de grafos en una sola ecuación de capa

El marco encuadra las arquitecturas GNN en siete componentes computacionales.

arXiv cs.LG+1 outlet·1d ago
Investigación

Investigadores apuntan a la edición composicional de imágenes y video

Nuevos artículos proponen datos de entrenamiento y métodos de destilación para modelos unificados de generación y edición.

arXiv cs.CL+1 outlet·1d ago
Investigación

StartupBench pone a prueba a los agentes en flujos de trabajo de startups

El benchmark evalúa el trabajo integral de agentes a partir de productos de IA validados por el mercado.

HF Daily Papers+1 outlet·2d ago
Investigación

Investigadores proponen aDSL para la creación 3D agéntica

El paper combina un lenguaje 3D centrado en agentes con un flujo multiagente sin entrenamiento.

HF Daily Papers·2d ago
Investigación

Un estudio de Abra traza las leyes de escalado en el entrenamiento de imágenes por difusión

HF Daily Papers destaca un estudio sobre escalado computacional en modelos de difusión de texto a imagen.

HF Daily Papers·2d ago
Investigación

GS-Voxel apunta a la generación aérea de 3DGS a gran escala

El framework convierte escenas 3D Gaussian ya preoptimizadas en latentes estructurados dispersos, sin ajuste por escena.

HF Daily Papers·2d ago
Investigación

Un artículo propone un diseño de datos centrado en capacidades para la generación de imágenes

El marco organiza los datos de entrenamiento para generación de imágenes en torno a dependencias entre capacidades.

HF Daily Papers+1 outlet·2d ago
Investigación

Investigadores presentan ASI-Bench para la ciencia autónoma

El benchmark evalúa la exploración innovadora y la ejecución científica en 60 tareas de investigación.

HF Daily Papers+1 outlet·2d ago
Investigación

Un estudio prueba DeepSeek Harness frente a la inyección de prompts

Un resumen de HF Daily Papers informa de 14.560 ejecuciones controladas en 16 canales de contenido indirecto.

HF Daily Papers·2d ago
Investigación

Nuevos estudios apuntan a la navegación embodied basada en memoria

UniWM y TAMP-Nav proponen formas distintas de alinear predicción visual, memoria y acción en agentes de navegación.

HF Daily Papers+1 outlet·2d ago
Investigación

EditBridge apunta a la edición de imágenes de ultra alta resolución

El método de puente de difusión busca preservar los detalles de la imagen original mientras perfecciona ediciones de baja resolución.

HF Daily Papers·2d ago
Investigación

Investigadores apuntan a reducir la latencia de MoE en visión y decodificación

Nuevos papers proponen codificadores de visión MoE, decodificación más rápida en lotes pequeños y balanceo de carga en línea.

HF Daily Papers+1 outlet·2d ago
Investigación

InternLM propone la arquitectura de modelo Mobius

El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.

r/LocalLLaMA+1 outlet·2d ago
Investigación

R^3-Bench pone a prueba el razonamiento de los LLM con presupuestos compartidos

El benchmark evalúa seis modelos en conjuntos de problemas con computación limitada.

HF Daily Papers+1 outlet·3d ago
Investigación

ClawGym II apunta al RL de caja negra para arneses de agentes

El artículo propone rollouts en entornos aislados y recuperación de trayectorias para entrenar agentes mediante arneses complejos.

HF Daily Papers+1 outlet·3d ago
Investigación

GenRouter dirige prompts de generación de imágenes hacia flujos de trabajo más baratos

El framework estandariza pipelines agénticos de imágenes y dirige los prompts según las exigencias de la tarea.

HF Daily Papers·3d ago
Investigación

Ventor-QTest audita APIs de LLM alojadas por proveedores

El paper propone un método de caja negra para detectar pérdidas de fidelidad en APIs de modelos open-weight alojados.

HF Daily Papers+1 outlet·3d ago
Investigación

HarnessEval-W incorpora pruebas basadas en agentes para modelos del mundo

El pipeline de benchmark utiliza subagentes para evaluar rollouts con cadenas de razonamiento inspeccionables.

HF Daily Papers·3d ago
Investigación

Un estudio entrena modelos de difusión en espacio de píxeles más rápidos

HF Daily Papers destaca una receta de entrenamiento de latente a píxel para difusión de texto a imagen.

HF Daily Papers·3d ago
Investigación

AnyTalk genera animación del habla sin datos de animación

El método adapta modelos de difusión de video para crear animación del habla en personajes 3D con sincronización labial.

HF Daily Papers·3d ago
Investigación

HiFi-BRep busca una generación de B-Rep más robusta

El framework usa codificación consciente de la topología y decodificación paralela para mejorar las representaciones de frontera en CAD.

HF Daily Papers·3d ago
Investigación

GRNEdit propone una edición de video ligera basada en instrucciones

El artículo plantea las ediciones de video como decisiones binarias de conservar o cambiar sobre códigos visuales.

HF Daily Papers+1 outlet·3d ago
Investigación

Investigadores llevan los modelos de difusión al espacio de píxeles

Dos artículos proponen métodos de difusión en espacio de píxeles para restauración de imágenes y generación de texto a imagen.

HF Daily Papers·3d ago
Investigación

Las herramientas y prácticas de IA para desarrolladores generan debate en Hacker News

Publicaciones sobre MathCode, hábitos de programación con IA, Cloudflare y HEIR de Google impulsaron la discusión.

Hacker News+5 outlets·3d ago
Investigación

Google avanza en la IA privada con cifrado homomórfico

Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.

Hacker News+8 outlets·3d ago
Investigación

Google dice que está haciendo práctica la IA privada

Una publicación de Google Security generó debate en Hacker News junto con críticas más amplias a la IA.

Hacker News+5 outlets·3d ago
Investigación

Investigadores lanzan LittleLearner para estudiar los LLM en un entorno controlado

El modelo de 5.000 millones de parámetros se entrena con un corpus curricular de 88.000 millones de tokens de nivel quinto grado o inferior.

r/LocalLLaMA+1 outlet·3d ago
Investigación

HN debate los límites de la IA, la privacidad y las afirmaciones científicas

Publicaciones sobre descubrimiento de fármacos, matemáticas, privacidad y laboratorios de IA generaron una activa discusión en Hacker News.

Hacker News+11 outlets·4d ago
Investigación

Nuevos informes ponen a prueba las afirmaciones sobre la IA en la ciencia y el trabajo

Debates en Hacker News destacaron evidencias sobre la IA en el descubrimiento de fármacos, las matemáticas y el uso de ChatGPT.

Hacker News+2 outlets·4d ago
Investigación

Investigadores apuntan a las brechas de razonamiento espacial en los VLM

Nuevos artículos proponen memoria, RL y benchmarks para la inteligencia espacial en sistemas de visión-lenguaje.

arXiv cs.AI+1 outlet·4d ago
Investigación

Google lanza Gemini 3.7 Flash para programación y agentes

El nuevo modelo Flash está disponible en Gemini API, Google AI Studio, Android Studio y herramientas empresariales.

Hacker News+13 outlets·5d ago
Investigación

Nuevos estudios examinan la inteligencia espacial en la IA de visión

SpaRRTa, SMA y PinpointQA evalúan o mejoran el razonamiento espacial en sistemas de IA visual y encarnada.

arXiv cs.LG+1 outlet·5d ago
Investigación

CW-BASS v2 apunta a la selección de pseudoetiquetas con DINOv2

El método adapta el filtrado para la segmentación semisupervisada con modelos fundacionales como docentes.

arXiv cs.LG+1 outlet·5d ago
Investigación

Un estudio de Anthropic revela que los agentes de IA pueden entrar en conflicto en tareas compartidas

Los investigadores afirman que el comportamiento multiagente puede dejar al descubierto carencias en las pruebas actuales de seguridad de la IA.

TechCrunch AI·6d ago
Investigación

Investigadores proponen un modelo de difusión para eliminar reflejos en video

S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.

arXiv cs.AI+1 outlet·6d ago
Investigación

Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución

El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.

arXiv cs.AI+1 outlet·6d ago
Investigación

Investigadores prueban arneses creados por IA para modelos más débiles

Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.

arXiv cs.AI+1 outlet·6d ago
Investigación

Investigadores prueban arneses para agentes corporizados

Thea y SHAPER trasladan a robots y a la IA corporizada ideas de infraestructura usadas en agentes de programación.

arXiv cs.AI+1 outlet·6d ago
Investigación

Un estudio analiza las rutas de control en GPU para agentes LLM

Ready Cohorts modela cuándo el trabajo de control de agentes puede permanecer en la GPU en lugar de volver al host.

arXiv cs.AI+1 outlet·6d ago
Investigación

Mechanist dirige agentes de IA a la interpretabilidad de modelos

El artículo en arXiv describe un sistema agéntico para el descubrimiento mecanístico autónomo en modelos de IA.

arXiv cs.AI+1 outlet·6d ago
Investigación

Nuevos papers apuntan a los límites de exploración de los LLM

DORA, 3PO y RISE-RL proponen formas de mejorar la exploración en agentes y entrenamiento RL.

arXiv cs.AI+1 outlet·6d ago
Investigación

Nuevos estudios enmarcan y ponen a prueba los modelos de mundo para robótica

Un tutorial y un benchmark abordan las definiciones y la evaluación de los modelos de mundo interactivos.

arXiv cs.AI+1 outlet·6d ago