Pesquisa
60 resumos
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.
Artigo testa transferência de memória entre modelos para LLMs
Pesquisadores estudam como uma memória aprendida congelada pode ser transferida entre backbones de modelos usando um leitor no lado do destino.
DiSCO mira a segurança de geração de texto para imagem em modelos de caixa-preta
O artigo no arXiv propõe otimização no nível do prompt para reduzir saídas NSFW sem acesso ao modelo.
PTXBench testa LLMs em otimização de kernels de GPU
O benchmark avalia o uso de PTX específico por arquitetura em cargas de trabalho de GEMM e atenção em GPUs H100 e B200.
Pesquisadores propõem frameworks de RL para harnesses de agentes
LEGO-RL e ClawGym II miram aprendizado por reforço estável para agentes de IA em tarefas de longo horizonte.
FACET mira a consistência na síntese de tarefas de terminal
O framework cria e corrige ambientes executáveis para treinar agentes de terminal.
SkillForge treina agentes em habilidades específicas de repositórios
O framework sintetiza issues de projetos para extrair conhecimento reutilizável em futuras correções de software.
IBM testa quanta memória agentes de IA precisam
Estudo ALTK-Evolve mostra que ganhos com memória em agentes dependem da capacidade do modelo e da estratégia de entrega.
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.
Aprenda o que falta, não o que já foi dominado: reponderação de vantagem sensível à saturação para otimização de políticas com múltiplas recompensas
arXiv:2608.
TRACE-Bench mira a geração de imagens com múltiplas referências
O benchmark decompõe prompts em quatro operadores para diagnosticar falhas dos modelos.
Flow Motion Policy: planejamento de movimento de manipuladores com modelos de Flow Matching
arXiv:2604.
Pesquisadores adaptam OPD para tornar o raciocínio em vídeo mais eficiente
Dois artigos usam técnicas de destilação para melhorar modelos menores ou de streaming voltados à compreensão de vídeo.
Pesquisadores propõem RUPA para lidar com incerteza em agentes de LLM
O framework estima a confiança ao longo de trajetórias completas dos agentes, não apenas em etapas locais.
Novos artigos miram o treinamento de agentes LLM de longo horizonte
Pesquisadores propõem TRCA, RLCascadeRouter e Agentic ESOpt para crédito em agentes, roteamento e ajuste fino.
Novos estudos mapeiam as demandas de serving para IA agêntica
Quatro artigos examinam latência, caching, rastros de execução e serving na borda para cargas de trabalho agênticas com LLMs.
Artigo unifica redes neurais de grafos em uma única equação de camada
O framework mapeia arquiteturas de GNN em sete componentes computacionais.
Pesquisadores miram edição composicional de imagens e vídeos
Novos papers propõem dados de treinamento e métodos de destilação para modelos unificados de geração e edição.
StartupBench testa agentes em fluxos de trabalho de startups
O benchmark avalia o trabalho de agentes de ponta a ponta a partir de produtos de IA validados pelo mercado.
Pesquisadores propõem aDSL para criação 3D agêntica
O artigo combina uma linguagem 3D voltada a agentes com um fluxo multiagente sem treinamento.
Estudo Abra mapeia leis de escala no treinamento de difusão de imagens
O HF Daily Papers destaca um estudo sobre escalonamento computacional para modelos de difusão texto-para-imagem.
GS-Voxel mira geração aérea de 3DGS em larga escala
O framework converte cenas 3D Gaussian pré-otimizadas em latentes estruturados esparsos sem ajuste por cena.
Artigo propõe desenho de dados centrado em capacidades para geração de imagens
O framework organiza dados de treinamento para geração de imagens em torno de dependências entre capacidades.
Pesquisadores apresentam o ASI-Bench para ciência autônoma
O benchmark testa exploração inovadora e execução científica em 60 tarefas de pesquisa.
Estudo testa o DeepSeek Harness contra injeção de prompt
Resumo do HF Daily Papers relata 14.560 execuções controladas em 16 canais de conteúdo indireto.
Novos artigos miram navegação incorporada baseada em memória
UniWM e TAMP-Nav propõem caminhos diferentes para alinhar previsão visual, memória e ação em agentes de navegação.
EditBridge mira edição de imagens em resolução ultra-alta
O método de ponte de difusão busca preservar os detalhes da fonte enquanto refina edições em baixa resolução.
Pesquisadores miram a latência de MoE em visão e decodificação
Novos artigos propõem codificadores de visão com MoE, decodificação mais rápida em lotes pequenos e balanceamento de carga online.
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.
R^3-Bench testa o raciocínio de LLMs sob orçamentos compartilhados
O benchmark avalia seis modelos em conjuntos de problemas com computação limitada.
ClawGym II mira RL black-box para harnesses de agentes
O artigo propõe rollouts em sandbox e recuperação de trajetórias para treinar agentes por meio de harnesses complexos.
GenRouter direciona prompts de geração de imagens para fluxos de trabalho mais baratos
O framework padroniza pipelines agênticos de imagem e encaminha prompts conforme as demandas da tarefa.
Ventor-QTest audita APIs de LLM hospedadas por fornecedores
O artigo propõe um método de caixa-preta para testar perda de fidelidade em APIs hospedadas de modelos open-weight.
HarnessEval-W adiciona testes baseados em agentes para modelos de mundo
O pipeline de benchmark usa subagentes para avaliar rollouts com cadeias de raciocínio inspecionáveis.
Estudo treina modelos de difusão em espaço de pixels mais rápidos
O HF Daily Papers destaca uma receita latente-para-pixel para treinar difusão texto-para-imagem.
AnyTalk gera animação de fala sem dados de animação
O método adapta modelos de difusão de vídeo para criar animações de fala em personagens 3D com sincronização labial.
HiFi-BRep busca tornar a geração de B-Rep mais robusta
O framework usa codificação consciente da topologia e decodificação paralela para aprimorar representações de fronteira em CAD.
GRNEdit propõe edição de vídeo leve baseada em instruções
O artigo formula as edições de vídeo como decisões binárias de manter ou inverter códigos visuais.
Pesquisadores levam modelos de difusão para o espaço de pixels
Dois artigos propõem métodos de difusão no espaço de pixels para restauração de imagens e geração de texto para imagem.
Ferramentas e práticas de IA para desenvolvedores geram debate no Hacker News
Posts sobre MathCode, hábitos de programação com IA, Cloudflare e o HEIR do Google puxaram a discussão.
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.
Google diz que está tornando a IA privada viável
Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.
Pesquisadores lançam LittleLearner para estudo controlado de LLMs
O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.
HN debate limites da IA, privacidade e alegações científicas
Posts sobre descoberta de medicamentos, matemática, privacidade e laboratórios de IA geraram discussões ativas no Hacker News.
Novos relatórios colocam à prova alegações sobre IA na ciência e no trabalho
Discussões no Hacker News destacaram evidências sobre IA na descoberta de medicamentos, na matemática e no uso do ChatGPT.
Pesquisadores miram lacunas de raciocínio espacial em VLMs
Novos artigos propõem memória, RL e benchmarks para inteligência espacial em sistemas de visão-linguagem.
Google lança Gemini 3.7 Flash para programação e agentes
O novo modelo Flash está disponível na Gemini API, no Google AI Studio, no Android Studio e em ferramentas empresariais.
Novos estudos investigam inteligência espacial em IA de visão
SpaRRTa, SMA e PinpointQA testam ou aprimoram o raciocínio espacial em sistemas de IA visual e incorporada.
CW-BASS v2 mira a seleção de pseudo-rótulos com DINOv2
O método adapta a filtragem para segmentação semissupervisionada com professores baseados em modelos de fundação.
Estudo da Anthropic mostra que agentes de IA podem entrar em conflito em tarefas compartilhadas
Pesquisadores dizem que o comportamento multiagente pode expor lacunas nos testes atuais de segurança em IA.
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.
Pesquisadores testam harnesses para agentes incorporados
Thea e SHAPER aplicam a robôs e IA incorporada ideias de infraestrutura usadas em agentes de programação.
Artigo estuda caminhos de controle em GPU para agentes de LLM
Ready Cohorts modela quando o trabalho de controle de agentes pode permanecer na GPU em vez de voltar ao host.
Mechanist mira agentes de IA na interpretabilidade de modelos
O artigo no arXiv descreve um sistema agêntico para descoberta mecanística autônoma em modelos de IA.