Recherche
60 briefs
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.
Une étude teste le transfert de mémoire entre modèles pour les LLM
Des chercheurs examinent comment une mémoire apprise figée peut passer d’une architecture de modèle à une autre grâce à un lecteur côté cible.
DiSCO cible la sécurité des générateurs texte-image en boîte noire
L’article publié sur arXiv propose une optimisation au niveau du prompt pour réduire les sorties NSFW sans accès au modèle.
Des chercheurs proposent des cadres RL pour les harnais d’agents
LEGO-RL et ClawGym II visent un apprentissage par renforcement plus stable pour les agents IA sur des tâches de longue durée.
IBM teste la quantité de mémoire nécessaire aux agents d’IA
Une étude sur ALTK-Evolve montre que les gains liés à la mémoire des agents dépendent des capacités du modèle et de la stratégie de diffusion.
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
Apprendre ce qui reste à acquérir, pas ce qui est déjà maîtrisé : rééquilibrage des avantages sensible à la saturation pour l’optimisation de politiques à récompenses multiples
arXiv:2608.
TRACE-Bench cible la génération d’images à références multiples
Ce benchmark décompose les prompts en quatre opérateurs afin de diagnostiquer les défaillances des modèles.
Flow Motion Policy : planification de mouvement pour manipulateurs avec des modèles de flow matching
arXiv:2604.
Des chercheurs adaptent l’OPD pour un raisonnement vidéo plus efficace
Deux articles utilisent des techniques de distillation pour améliorer des modèles plus petits ou en streaming de compréhension vidéo.
Des chercheurs proposent RUPA pour évaluer l’incertitude des agents LLM
Ce cadre estime la confiance à l’échelle de trajectoires complètes d’agents, et pas seulement d’étapes locales.
De nouveaux articles ciblent l’entraînement des agents LLM à long horizon
Des chercheurs proposent TRCA, RLCascadeRouter et Agentic ESOpt pour le crédit des agents, le routage et le fine-tuning.
De nouvelles études cartographient les exigences de service pour l’IA agentique
Quatre articles examinent la latence, la mise en cache, les traces et le service en périphérie pour les charges de travail de LLM agentiques.
Un article unifie les réseaux neuronaux de graphes dans une seule équation de couche
Le cadre ramène les architectures de GNN à sept composantes de calcul.
Des chercheurs ciblent l’édition compositionnelle d’images et de vidéos
De nouveaux articles proposent des données d’entraînement et des méthodes de distillation pour des modèles unifiés de génération et d’édition.
StartupBench teste les agents sur des workflows de startup
Ce benchmark évalue le travail agentique de bout en bout à partir de produits d’IA validés par le marché.
Des chercheurs proposent aDSL pour la création 3D agentique
L’article associe un langage 3D centré sur les agents à un workflow multi-agent sans entraînement.
L’étude Abra cartographie les lois de passage à l’échelle pour l’entraînement d’images par diffusion
HF Daily Papers met en avant une étude sur le passage à l’échelle du calcul pour les modèles de diffusion texte-image.
GS-Voxel vise la génération 3DGS aérienne à grande échelle
Le framework convertit des scènes 3D Gaussian pré-optimisées en latents structurés clairsemés, sans ajustement scène par scène.
Un article propose une conception des données centrée sur les capacités pour la génération d’images
Ce cadre organise les données d’entraînement pour la génération d’images autour des dépendances entre capacités.
Des chercheurs présentent ASI-Bench pour la science autonome
Ce benchmark évalue l’exploration innovante et l’exécution scientifique à travers 60 tâches de recherche.
Une étude teste DeepSeek Harness face aux injections de prompt
Le résumé de HF Daily Papers fait état de 14 560 exécutions contrôlées sur 16 canaux de contenu indirect.
De nouveaux articles ciblent la navigation incarnée fondée sur la mémoire
UniWM et TAMP-Nav proposent deux façons distinctes d’aligner prédiction visuelle, mémoire et action chez les agents de navigation.
EditBridge vise l’édition d’images en très haute résolution
Cette méthode de pont de diffusion cherche à préserver les détails de la source tout en affinant des retouches en basse résolution.
Des chercheurs s’attaquent à la latence des MoE en vision et en décodage
De nouveaux articles proposent des encodeurs visuels MoE, un décodage plus rapide en petits lots et un équilibrage de charge en ligne.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.
R^3-Bench teste le raisonnement des LLM sous budgets partagés
Le benchmark évalue six modèles sur des séries de problèmes avec une puissance de calcul limitée.
ClawGym II cible le RL en boîte noire pour les harnais d’agents
L’article propose des déploiements en bac à sable et une récupération des trajectoires pour entraîner des agents au sein de harnais complexes.
GenRouter oriente les prompts de génération d’images vers des workflows moins coûteux
Le framework standardise les pipelines agentiques de génération d’images et dirige les prompts selon les exigences de chaque tâche.
Ventor-QTest audite les API LLM hébergées par des fournisseurs
L’article propose une méthode en boîte noire pour tester la perte de fidélité dans les API de modèles open-weight hébergés.
HarnessEval-W ajoute des tests à base d’agents pour les modèles du monde
Le pipeline de benchmark utilise des sous-agents pour évaluer les rollouts à l’aide de chaînes de raisonnement inspectables.
Une étude entraîne plus vite des modèles de diffusion en espace pixel
HF Daily Papers met en avant une recette latent-vers-pixel pour l’entraînement de la diffusion texte-image.
AnyTalk génère une animation de parole sans données d’animation
La méthode adapte des modèles de diffusion vidéo pour créer des animations de parole 3D synchronisées sur les lèvres.
HiFi-BRep vise une génération de B-Rep plus robuste
Le framework s’appuie sur un encodage sensible à la topologie et un décodage parallèle pour améliorer les représentations de frontière en CAD.
GRNEdit propose un montage vidéo léger piloté par instructions
L’article présente les modifications vidéo comme des décisions de conservation ou d’inversion appliquées à des codes visuels binaires.
Des chercheurs poussent les modèles de diffusion dans l’espace des pixels
Deux articles proposent des méthodes de diffusion dans l’espace des pixels pour la restauration d’images et la génération texte-image.
Les outils et pratiques de développement IA suscitent le débat sur Hacker News
Des publications sur MathCode, les habitudes de codage avec l’IA, Cloudflare et HEIR de Google ont alimenté les discussions.
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.
HN débat des limites de l’IA, de la vie privée et des affirmations scientifiques
Des publications sur la découverte de médicaments, les mathématiques, la vie privée et les laboratoires d’IA ont suscité de vifs échanges sur Hacker News.
De nouveaux rapports mettent à l’épreuve les promesses de l’IA dans la science et le travail
Des discussions sur Hacker News ont mis en avant les preuves disponibles sur l’IA dans la découverte de médicaments, les mathématiques et l’usage de ChatGPT.
Des chercheurs ciblent les lacunes du raisonnement spatial des VLM
De nouveaux articles proposent mémoire, RL et benchmarks pour renforcer l’intelligence spatiale des systèmes vision-langage.
Google lance Gemini 3.7 Flash pour le code et les agents
Le nouveau modèle Flash est disponible dans Gemini API, Google AI Studio, Android Studio et les outils d’entreprise.
De nouvelles études explorent l’intelligence spatiale dans l’IA visuelle
SpaRRTa, SMA et PinpointQA testent ou améliorent le raisonnement spatial des systèmes d’IA visuelle et incarnée.
CW-BASS v2 cible la sélection de pseudo-étiquettes avec DINOv2
La méthode adapte le filtrage pour la segmentation semi-supervisée sous l’égide de modèles de fondation enseignants.
Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées
Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.
Des chercheurs testent des harnesses pour agents incarnés
Thea et SHAPER appliquent aux robots et à l’IA incarnée des idées d’infrastructure issues des agents de codage.
Une étude examine les chemins de contrôle GPU pour les agents LLM
Ready Cohorts modélise les situations où le travail de contrôle des agents peut rester sur GPU au lieu de revenir vers l’hôte.
Mechanist met les agents IA au service de l’interprétabilité des modèles
L’article publié sur arXiv décrit un système agentique destiné à la découverte mécaniste autonome dans les modèles d’IA.
De nouveaux articles ciblent les limites de l’exploration des LLM
DORA, 3PO et RISE-RL proposent des pistes pour améliorer l’exploration dans les agents et l’entraînement RL.
De nouveaux articles définissent et testent les modèles du monde pour la robotique
Un tutoriel et un benchmark s’attaquent aux définitions et à l’évaluation des modèles du monde interactifs.
Des chercheurs s’attaquent aux défaillances de mémoire des agents IA de long terme
De nouveaux articles proposent des méthodes par graphes, par segments et contre les interférences pour préserver la mémoire des agents.