AAI News Hub

Recherche

60 briefs

Recherche

HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents

Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.

arXiv cs.AI+1 outlet·20h ago
Recherche

Agent Lightning v1.0 cible le RL agentique avec harnais

Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.

arXiv cs.AI+1 outlet·20h ago
Recherche

Une étude teste le transfert de mémoire entre modèles pour les LLM

Des chercheurs examinent comment une mémoire apprise figée peut passer d’une architecture de modèle à une autre grâce à un lecteur côté cible.

arXiv cs.AI+1 outlet·20h ago
Recherche

DiSCO cible la sécurité des générateurs texte-image en boîte noire

L’article publié sur arXiv propose une optimisation au niveau du prompt pour réduire les sorties NSFW sans accès au modèle.

arXiv cs.AI+1 outlet·20h ago
Recherche

Des chercheurs proposent des cadres RL pour les harnais d’agents

LEGO-RL et ClawGym II visent un apprentissage par renforcement plus stable pour les agents IA sur des tâches de longue durée.

arXiv cs.AI+1 outlet·20h ago
Recherche

IBM teste la quantité de mémoire nécessaire aux agents d’IA

Une étude sur ALTK-Evolve montre que les gains liés à la mémoire des agents dépendent des capacités du modèle et de la stratégie de diffusion.

Hugging Face·1d ago
Recherche

Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone

Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.

arXiv cs.AI+1 outlet·1d ago
Recherche

Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents

L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.

arXiv cs.AI+1 outlet·1d ago
Recherche

AlphaEvolve contribue à abaisser la borne de la multiplication matricielle

Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.

arXiv cs.AI+1 outlet·1d ago
Recherche

Apprendre ce qui reste à acquérir, pas ce qui est déjà maîtrisé : rééquilibrage des avantages sensible à la saturation pour l’optimisation de politiques à récompenses multiples

arXiv:2608.

arXiv cs.AI+1 outlet·1d ago
Recherche

TRACE-Bench cible la génération d’images à références multiples

Ce benchmark décompose les prompts en quatre opérateurs afin de diagnostiquer les défaillances des modèles.

arXiv cs.AI+1 outlet·1d ago
Recherche

Flow Motion Policy : planification de mouvement pour manipulateurs avec des modèles de flow matching

arXiv:2604.

arXiv cs.AI+1 outlet·1d ago
Recherche

Des chercheurs adaptent l’OPD pour un raisonnement vidéo plus efficace

Deux articles utilisent des techniques de distillation pour améliorer des modèles plus petits ou en streaming de compréhension vidéo.

arXiv cs.AI+1 outlet·1d ago
Recherche

Des chercheurs proposent RUPA pour évaluer l’incertitude des agents LLM

Ce cadre estime la confiance à l’échelle de trajectoires complètes d’agents, et pas seulement d’étapes locales.

arXiv cs.CL+1 outlet·1d ago
Recherche

De nouveaux articles ciblent l’entraînement des agents LLM à long horizon

Des chercheurs proposent TRCA, RLCascadeRouter et Agentic ESOpt pour le crédit des agents, le routage et le fine-tuning.

arXiv cs.AI+1 outlet·1d ago
Recherche

De nouvelles études cartographient les exigences de service pour l’IA agentique

Quatre articles examinent la latence, la mise en cache, les traces et le service en périphérie pour les charges de travail de LLM agentiques.

arXiv cs.AI+1 outlet·1d ago
Recherche

Un article unifie les réseaux neuronaux de graphes dans une seule équation de couche

Le cadre ramène les architectures de GNN à sept composantes de calcul.

arXiv cs.LG+1 outlet·1d ago
Recherche

Des chercheurs ciblent l’édition compositionnelle d’images et de vidéos

De nouveaux articles proposent des données d’entraînement et des méthodes de distillation pour des modèles unifiés de génération et d’édition.

arXiv cs.CL+1 outlet·1d ago
Recherche

StartupBench teste les agents sur des workflows de startup

Ce benchmark évalue le travail agentique de bout en bout à partir de produits d’IA validés par le marché.

HF Daily Papers+1 outlet·2d ago
Recherche

Des chercheurs proposent aDSL pour la création 3D agentique

L’article associe un langage 3D centré sur les agents à un workflow multi-agent sans entraînement.

HF Daily Papers·2d ago
Recherche

L’étude Abra cartographie les lois de passage à l’échelle pour l’entraînement d’images par diffusion

HF Daily Papers met en avant une étude sur le passage à l’échelle du calcul pour les modèles de diffusion texte-image.

HF Daily Papers·2d ago
Recherche

GS-Voxel vise la génération 3DGS aérienne à grande échelle

Le framework convertit des scènes 3D Gaussian pré-optimisées en latents structurés clairsemés, sans ajustement scène par scène.

HF Daily Papers·2d ago
Recherche

Un article propose une conception des données centrée sur les capacités pour la génération d’images

Ce cadre organise les données d’entraînement pour la génération d’images autour des dépendances entre capacités.

HF Daily Papers+1 outlet·2d ago
Recherche

Des chercheurs présentent ASI-Bench pour la science autonome

Ce benchmark évalue l’exploration innovante et l’exécution scientifique à travers 60 tâches de recherche.

HF Daily Papers+1 outlet·2d ago
Recherche

Une étude teste DeepSeek Harness face aux injections de prompt

Le résumé de HF Daily Papers fait état de 14 560 exécutions contrôlées sur 16 canaux de contenu indirect.

HF Daily Papers·2d ago
Recherche

De nouveaux articles ciblent la navigation incarnée fondée sur la mémoire

UniWM et TAMP-Nav proposent deux façons distinctes d’aligner prédiction visuelle, mémoire et action chez les agents de navigation.

HF Daily Papers+1 outlet·2d ago
Recherche

EditBridge vise l’édition d’images en très haute résolution

Cette méthode de pont de diffusion cherche à préserver les détails de la source tout en affinant des retouches en basse résolution.

HF Daily Papers·2d ago
Recherche

Des chercheurs s’attaquent à la latence des MoE en vision et en décodage

De nouveaux articles proposent des encodeurs visuels MoE, un décodage plus rapide en petits lots et un équilibrage de charge en ligne.

HF Daily Papers+1 outlet·2d ago
Recherche

InternLM propose l’architecture de modèle Mobius

L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.

r/LocalLLaMA+1 outlet·2d ago
Recherche

R^3-Bench teste le raisonnement des LLM sous budgets partagés

Le benchmark évalue six modèles sur des séries de problèmes avec une puissance de calcul limitée.

HF Daily Papers+1 outlet·3d ago
Recherche

ClawGym II cible le RL en boîte noire pour les harnais d’agents

L’article propose des déploiements en bac à sable et une récupération des trajectoires pour entraîner des agents au sein de harnais complexes.

HF Daily Papers+1 outlet·3d ago
Recherche

GenRouter oriente les prompts de génération d’images vers des workflows moins coûteux

Le framework standardise les pipelines agentiques de génération d’images et dirige les prompts selon les exigences de chaque tâche.

HF Daily Papers·3d ago
Recherche

Ventor-QTest audite les API LLM hébergées par des fournisseurs

L’article propose une méthode en boîte noire pour tester la perte de fidélité dans les API de modèles open-weight hébergés.

HF Daily Papers+1 outlet·3d ago
Recherche

HarnessEval-W ajoute des tests à base d’agents pour les modèles du monde

Le pipeline de benchmark utilise des sous-agents pour évaluer les rollouts à l’aide de chaînes de raisonnement inspectables.

HF Daily Papers·3d ago
Recherche

Une étude entraîne plus vite des modèles de diffusion en espace pixel

HF Daily Papers met en avant une recette latent-vers-pixel pour l’entraînement de la diffusion texte-image.

HF Daily Papers·3d ago
Recherche

AnyTalk génère une animation de parole sans données d’animation

La méthode adapte des modèles de diffusion vidéo pour créer des animations de parole 3D synchronisées sur les lèvres.

HF Daily Papers·3d ago
Recherche

HiFi-BRep vise une génération de B-Rep plus robuste

Le framework s’appuie sur un encodage sensible à la topologie et un décodage parallèle pour améliorer les représentations de frontière en CAD.

HF Daily Papers·3d ago
Recherche

GRNEdit propose un montage vidéo léger piloté par instructions

L’article présente les modifications vidéo comme des décisions de conservation ou d’inversion appliquées à des codes visuels binaires.

HF Daily Papers+1 outlet·3d ago
Recherche

Des chercheurs poussent les modèles de diffusion dans l’espace des pixels

Deux articles proposent des méthodes de diffusion dans l’espace des pixels pour la restauration d’images et la génération texte-image.

HF Daily Papers·3d ago
Recherche

Les outils et pratiques de développement IA suscitent le débat sur Hacker News

Des publications sur MathCode, les habitudes de codage avec l’IA, Cloudflare et HEIR de Google ont alimenté les discussions.

Hacker News+5 outlets·3d ago
Recherche

Google fait progresser l’IA privée grâce au chiffrement homomorphe

Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.

Hacker News+8 outlets·3d ago
Recherche

Google affirme rendre l’IA privée praticable

Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.

Hacker News+5 outlets·3d ago
Recherche

Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé

Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.

r/LocalLLaMA+1 outlet·3d ago
Recherche

HN débat des limites de l’IA, de la vie privée et des affirmations scientifiques

Des publications sur la découverte de médicaments, les mathématiques, la vie privée et les laboratoires d’IA ont suscité de vifs échanges sur Hacker News.

Hacker News+11 outlets·4d ago
Recherche

De nouveaux rapports mettent à l’épreuve les promesses de l’IA dans la science et le travail

Des discussions sur Hacker News ont mis en avant les preuves disponibles sur l’IA dans la découverte de médicaments, les mathématiques et l’usage de ChatGPT.

Hacker News+2 outlets·4d ago
Recherche

Des chercheurs ciblent les lacunes du raisonnement spatial des VLM

De nouveaux articles proposent mémoire, RL et benchmarks pour renforcer l’intelligence spatiale des systèmes vision-langage.

arXiv cs.AI+1 outlet·4d ago
Recherche

Google lance Gemini 3.7 Flash pour le code et les agents

Le nouveau modèle Flash est disponible dans Gemini API, Google AI Studio, Android Studio et les outils d’entreprise.

Hacker News+13 outlets·5d ago
Recherche

De nouvelles études explorent l’intelligence spatiale dans l’IA visuelle

SpaRRTa, SMA et PinpointQA testent ou améliorent le raisonnement spatial des systèmes d’IA visuelle et incarnée.

arXiv cs.LG+1 outlet·5d ago
Recherche

CW-BASS v2 cible la sélection de pseudo-étiquettes avec DINOv2

La méthode adapte le filtrage pour la segmentation semi-supervisée sous l’égide de modèles de fondation enseignants.

arXiv cs.LG+1 outlet·5d ago
Recherche

Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées

Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.

TechCrunch AI·6d ago
Recherche

Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos

S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.

arXiv cs.AI+1 outlet·6d ago
Recherche

Un article estime que la sécurité des agents exige des contrats d’exécution

L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.

arXiv cs.AI+1 outlet·6d ago
Recherche

Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles

Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.

arXiv cs.AI+1 outlet·6d ago
Recherche

Des chercheurs testent des harnesses pour agents incarnés

Thea et SHAPER appliquent aux robots et à l’IA incarnée des idées d’infrastructure issues des agents de codage.

arXiv cs.AI+1 outlet·6d ago
Recherche

Une étude examine les chemins de contrôle GPU pour les agents LLM

Ready Cohorts modélise les situations où le travail de contrôle des agents peut rester sur GPU au lieu de revenir vers l’hôte.

arXiv cs.AI+1 outlet·6d ago
Recherche

Mechanist met les agents IA au service de l’interprétabilité des modèles

L’article publié sur arXiv décrit un système agentique destiné à la découverte mécaniste autonome dans les modèles d’IA.

arXiv cs.AI+1 outlet·6d ago
Recherche

De nouveaux articles ciblent les limites de l’exploration des LLM

DORA, 3PO et RISE-RL proposent des pistes pour améliorer l’exploration dans les agents et l’entraînement RL.

arXiv cs.AI+1 outlet·6d ago
Recherche

De nouveaux articles définissent et testent les modèles du monde pour la robotique

Un tutoriel et un benchmark s’attaquent aux définitions et à l’évaluation des modèles du monde interactifs.

arXiv cs.AI+1 outlet·6d ago
Recherche

Des chercheurs s’attaquent aux défaillances de mémoire des agents IA de long terme

De nouveaux articles proposent des méthodes par graphes, par segments et contre les interférences pour préserver la mémoire des agents.

arXiv cs.AI+1 outlet·6d ago