AAI News Hub

Pesquisa

60 resumos

Pesquisa

HarnessRisk mede falhas de segurança em harnesses de agentes

O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

Agent Lightning v1.0 mira RL agêntico com harness

O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

Artigo testa transferência de memória entre modelos para LLMs

Pesquisadores estudam como uma memória aprendida congelada pode ser transferida entre backbones de modelos usando um leitor no lado do destino.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

DiSCO mira a segurança de geração de texto para imagem em modelos de caixa-preta

O artigo no arXiv propõe otimização no nível do prompt para reduzir saídas NSFW sem acesso ao modelo.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

PTXBench testa LLMs em otimização de kernels de GPU

O benchmark avalia o uso de PTX específico por arquitetura em cargas de trabalho de GEMM e atenção em GPUs H100 e B200.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

Pesquisadores propõem frameworks de RL para harnesses de agentes

LEGO-RL e ClawGym II miram aprendizado por reforço estável para agentes de IA em tarefas de longo horizonte.

arXiv cs.AI+1 outlet·22h ago
Pesquisa

FACET mira a consistência na síntese de tarefas de terminal

O framework cria e corrige ambientes executáveis para treinar agentes de terminal.

HF Daily Papers·1d ago
Pesquisa

SkillForge treina agentes em habilidades específicas de repositórios

O framework sintetiza issues de projetos para extrair conhecimento reutilizável em futuras correções de software.

HF Daily Papers·1d ago
Pesquisa

IBM testa quanta memória agentes de IA precisam

Estudo ALTK-Evolve mostra que ganhos com memória em agentes dependem da capacidade do modelo e da estratégia de entrega.

Hugging Face·1d ago
Pesquisa

Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones

O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes

O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes

Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Aprenda o que falta, não o que já foi dominado: reponderação de vantagem sensível à saturação para otimização de políticas com múltiplas recompensas

arXiv:2608.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

TRACE-Bench mira a geração de imagens com múltiplas referências

O benchmark decompõe prompts em quatro operadores para diagnosticar falhas dos modelos.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Flow Motion Policy: planejamento de movimento de manipuladores com modelos de Flow Matching

arXiv:2604.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Pesquisadores adaptam OPD para tornar o raciocínio em vídeo mais eficiente

Dois artigos usam técnicas de destilação para melhorar modelos menores ou de streaming voltados à compreensão de vídeo.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Pesquisadores propõem RUPA para lidar com incerteza em agentes de LLM

O framework estima a confiança ao longo de trajetórias completas dos agentes, não apenas em etapas locais.

arXiv cs.CL+1 outlet·1d ago
Pesquisa

Novos artigos miram o treinamento de agentes LLM de longo horizonte

Pesquisadores propõem TRCA, RLCascadeRouter e Agentic ESOpt para crédito em agentes, roteamento e ajuste fino.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Novos estudos mapeiam as demandas de serving para IA agêntica

Quatro artigos examinam latência, caching, rastros de execução e serving na borda para cargas de trabalho agênticas com LLMs.

arXiv cs.AI+1 outlet·1d ago
Pesquisa

Artigo unifica redes neurais de grafos em uma única equação de camada

O framework mapeia arquiteturas de GNN em sete componentes computacionais.

arXiv cs.LG+1 outlet·1d ago
Pesquisa

Pesquisadores miram edição composicional de imagens e vídeos

Novos papers propõem dados de treinamento e métodos de destilação para modelos unificados de geração e edição.

arXiv cs.CL+1 outlet·1d ago
Pesquisa

StartupBench testa agentes em fluxos de trabalho de startups

O benchmark avalia o trabalho de agentes de ponta a ponta a partir de produtos de IA validados pelo mercado.

HF Daily Papers+1 outlet·2d ago
Pesquisa

Pesquisadores propõem aDSL para criação 3D agêntica

O artigo combina uma linguagem 3D voltada a agentes com um fluxo multiagente sem treinamento.

HF Daily Papers·2d ago
Pesquisa

Estudo Abra mapeia leis de escala no treinamento de difusão de imagens

O HF Daily Papers destaca um estudo sobre escalonamento computacional para modelos de difusão texto-para-imagem.

HF Daily Papers·2d ago
Pesquisa

GS-Voxel mira geração aérea de 3DGS em larga escala

O framework converte cenas 3D Gaussian pré-otimizadas em latentes estruturados esparsos sem ajuste por cena.

HF Daily Papers·2d ago
Pesquisa

Artigo propõe desenho de dados centrado em capacidades para geração de imagens

O framework organiza dados de treinamento para geração de imagens em torno de dependências entre capacidades.

HF Daily Papers+1 outlet·2d ago
Pesquisa

Pesquisadores apresentam o ASI-Bench para ciência autônoma

O benchmark testa exploração inovadora e execução científica em 60 tarefas de pesquisa.

HF Daily Papers+1 outlet·2d ago
Pesquisa

Estudo testa o DeepSeek Harness contra injeção de prompt

Resumo do HF Daily Papers relata 14.560 execuções controladas em 16 canais de conteúdo indireto.

HF Daily Papers·2d ago
Pesquisa

Novos artigos miram navegação incorporada baseada em memória

UniWM e TAMP-Nav propõem caminhos diferentes para alinhar previsão visual, memória e ação em agentes de navegação.

HF Daily Papers+1 outlet·2d ago
Pesquisa

EditBridge mira edição de imagens em resolução ultra-alta

O método de ponte de difusão busca preservar os detalhes da fonte enquanto refina edições em baixa resolução.

HF Daily Papers·2d ago
Pesquisa

Pesquisadores miram a latência de MoE em visão e decodificação

Novos artigos propõem codificadores de visão com MoE, decodificação mais rápida em lotes pequenos e balanceamento de carga online.

HF Daily Papers+1 outlet·2d ago
Pesquisa

InternLM propõe a arquitetura de modelo Mobius

O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.

r/LocalLLaMA+1 outlet·2d ago
Pesquisa

R^3-Bench testa o raciocínio de LLMs sob orçamentos compartilhados

O benchmark avalia seis modelos em conjuntos de problemas com computação limitada.

HF Daily Papers+1 outlet·3d ago
Pesquisa

ClawGym II mira RL black-box para harnesses de agentes

O artigo propõe rollouts em sandbox e recuperação de trajetórias para treinar agentes por meio de harnesses complexos.

HF Daily Papers+1 outlet·3d ago
Pesquisa

GenRouter direciona prompts de geração de imagens para fluxos de trabalho mais baratos

O framework padroniza pipelines agênticos de imagem e encaminha prompts conforme as demandas da tarefa.

HF Daily Papers·3d ago
Pesquisa

Ventor-QTest audita APIs de LLM hospedadas por fornecedores

O artigo propõe um método de caixa-preta para testar perda de fidelidade em APIs hospedadas de modelos open-weight.

HF Daily Papers+1 outlet·3d ago
Pesquisa

HarnessEval-W adiciona testes baseados em agentes para modelos de mundo

O pipeline de benchmark usa subagentes para avaliar rollouts com cadeias de raciocínio inspecionáveis.

HF Daily Papers·3d ago
Pesquisa

Estudo treina modelos de difusão em espaço de pixels mais rápidos

O HF Daily Papers destaca uma receita latente-para-pixel para treinar difusão texto-para-imagem.

HF Daily Papers·3d ago
Pesquisa

AnyTalk gera animação de fala sem dados de animação

O método adapta modelos de difusão de vídeo para criar animações de fala em personagens 3D com sincronização labial.

HF Daily Papers·3d ago
Pesquisa

HiFi-BRep busca tornar a geração de B-Rep mais robusta

O framework usa codificação consciente da topologia e decodificação paralela para aprimorar representações de fronteira em CAD.

HF Daily Papers·3d ago
Pesquisa

GRNEdit propõe edição de vídeo leve baseada em instruções

O artigo formula as edições de vídeo como decisões binárias de manter ou inverter códigos visuais.

HF Daily Papers+1 outlet·3d ago
Pesquisa

Pesquisadores levam modelos de difusão para o espaço de pixels

Dois artigos propõem métodos de difusão no espaço de pixels para restauração de imagens e geração de texto para imagem.

HF Daily Papers·3d ago
Pesquisa

Ferramentas e práticas de IA para desenvolvedores geram debate no Hacker News

Posts sobre MathCode, hábitos de programação com IA, Cloudflare e o HEIR do Google puxaram a discussão.

Hacker News+5 outlets·3d ago
Pesquisa

Google avança em IA privada com criptografia homomórfica

O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.

Hacker News+8 outlets·3d ago
Pesquisa

Google diz que está tornando a IA privada viável

Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.

Hacker News+5 outlets·3d ago
Pesquisa

Pesquisadores lançam LittleLearner para estudo controlado de LLMs

O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.

r/LocalLLaMA+1 outlet·3d ago
Pesquisa

HN debate limites da IA, privacidade e alegações científicas

Posts sobre descoberta de medicamentos, matemática, privacidade e laboratórios de IA geraram discussões ativas no Hacker News.

Hacker News+11 outlets·4d ago
Pesquisa

Novos relatórios colocam à prova alegações sobre IA na ciência e no trabalho

Discussões no Hacker News destacaram evidências sobre IA na descoberta de medicamentos, na matemática e no uso do ChatGPT.

Hacker News+2 outlets·4d ago
Pesquisa

Pesquisadores miram lacunas de raciocínio espacial em VLMs

Novos artigos propõem memória, RL e benchmarks para inteligência espacial em sistemas de visão-linguagem.

arXiv cs.AI+1 outlet·4d ago
Pesquisa

Google lança Gemini 3.7 Flash para programação e agentes

O novo modelo Flash está disponível na Gemini API, no Google AI Studio, no Android Studio e em ferramentas empresariais.

Hacker News+13 outlets·5d ago
Pesquisa

Novos estudos investigam inteligência espacial em IA de visão

SpaRRTa, SMA e PinpointQA testam ou aprimoram o raciocínio espacial em sistemas de IA visual e incorporada.

arXiv cs.LG+1 outlet·5d ago
Pesquisa

CW-BASS v2 mira a seleção de pseudo-rótulos com DINOv2

O método adapta a filtragem para segmentação semissupervisionada com professores baseados em modelos de fundação.

arXiv cs.LG+1 outlet·5d ago
Pesquisa

Estudo da Anthropic mostra que agentes de IA podem entrar em conflito em tarefas compartilhadas

Pesquisadores dizem que o comportamento multiagente pode expor lacunas nos testes atuais de segurança em IA.

TechCrunch AI·6d ago
Pesquisa

Pesquisadores propõem modelo de difusão para remover reflexos em vídeos

O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.

arXiv cs.AI+1 outlet·6d ago
Pesquisa

Artigo defende que a segurança de agentes precisa de contratos em tempo de execução

O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.

arXiv cs.AI+1 outlet·6d ago
Pesquisa

Pesquisadores testam estruturas criadas por IA para modelos mais fracos

Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.

arXiv cs.AI+1 outlet·6d ago
Pesquisa

Pesquisadores testam harnesses para agentes incorporados

Thea e SHAPER aplicam a robôs e IA incorporada ideias de infraestrutura usadas em agentes de programação.

arXiv cs.AI+1 outlet·6d ago
Pesquisa

Artigo estuda caminhos de controle em GPU para agentes de LLM

Ready Cohorts modela quando o trabalho de controle de agentes pode permanecer na GPU em vez de voltar ao host.

arXiv cs.AI+1 outlet·6d ago
Pesquisa

Mechanist mira agentes de IA na interpretabilidade de modelos

O artigo no arXiv descreve um sistema agêntico para descoberta mecanística autônoma em modelos de IA.

arXiv cs.AI+1 outlet·6d ago