AAI News Hub

研究

60 条简报

研究

HarnessRisk 基准测试 agent harness 的安全失效

该基准在 agent harness 的各个阶段测试攻击,同时相关研究关注面向特定任务的资源配置。

arXiv cs.AI+1 家媒体·20h ago
研究

Agent Lightning v1.0 瞄准带框架托管的智能体强化学习

该框架把任意智能体 harness 接入强化学习后训练流程。

arXiv cs.AI+1 家媒体·20h ago
研究

论文测试 LLM 的跨模型记忆迁移

研究人员探讨如何通过目标侧读取器,让冻结的已学习记忆在不同模型骨干之间迁移。

arXiv cs.AI+1 家媒体·20h ago
研究

DiSCO 瞄准黑盒文生图安全问题

这篇 arXiv 论文提出在提示词层面进行优化,以在无法访问模型的情况下减少 NSFW 输出。

arXiv cs.AI+1 家媒体·20h ago
研究

研究人员提出面向 agent harness 的强化学习框架

LEGO-RL 和 ClawGym II 旨在为长程 AI agent 提供更稳定的强化学习训练。

arXiv cs.AI+1 家媒体·20h ago
研究

IBM 测试 AI 智能体究竟需要多少记忆

ALTK-Evolve 研究发现,智能体记忆带来的收益取决于模型能力和投放策略。

Hugging Face·1d ago
研究

研究人员提出用于卡车与无人机路径规划的 TTP-D

这一新基准将物品选择、载重相关路径规划与无人机同步结合起来。

arXiv cs.AI+1 家媒体·1d ago
研究

研究发现,审计-修复上下文会让 LLM 检查器更宽松

这篇 arXiv 论文称,在模型上下文中出现先前的审计-修复过程后,误报率会下降。

arXiv cs.AI+1 家媒体·1d ago
研究

AlphaEvolve 助力降低矩阵乘法上界

一篇新的 arXiv 论文报告称,矩阵乘法指数的上界得到改进。

arXiv cs.AI+1 家媒体·1d ago
研究

学习尚未掌握的部分,而不是已经掌握的内容:面向多奖励策略优化的饱和感知优势重加权

arXiv:2608。

arXiv cs.AI+1 家媒体·1d ago
研究

TRACE-Bench 瞄准多参考图像生成

该基准将提示词拆解为四类操作符,用于诊断模型失败原因。

arXiv cs.AI+1 家媒体·1d ago
研究

Flow Motion Policy:基于流匹配模型的机械臂运动规划

arXiv:2604。

arXiv cs.AI+1 家媒体·1d ago
研究

研究人员改造 OPD,提升视频推理效率

两篇论文利用蒸馏技术,改进更小型或流式视频理解模型的表现。

arXiv cs.AI+1 家媒体·1d ago
研究

研究人员提出 RUPA,用于评估 LLM 智能体的不确定性

该框架评估的是完整智能体轨迹的置信度,而不只是局部步骤。

arXiv cs.CL+1 家媒体·1d ago
研究

新论文聚焦长周期 LLM 智能体训练

研究人员提出 TRCA、RLCascadeRouter 和 Agentic ESOpt,用于改进智能体信用分配、模型路由和微调。

arXiv cs.AI+1 家媒体·1d ago
研究

新研究勾勒智能体 AI 的服务供给需求

四篇论文分别研究面向智能体 LLM 工作负载的延迟、缓存、轨迹和边缘侧服务。

arXiv cs.AI+1 家媒体·1d ago
研究

论文用一个层方程统一图神经网络

该框架将 GNN 架构映射为七个计算组件。

arXiv cs.LG+1 家媒体·1d ago
研究

研究人员瞄准组合式图像与视频编辑

新论文提出面向统一生成与编辑模型的训练数据和蒸馏方法。

arXiv cs.CL+1 家媒体·1d ago
研究

StartupBench 测试智能体处理创业公司工作流的能力

该基准评估源自经过市场验证的 AI 产品的端到端智能体任务。

HF Daily Papers+1 家媒体·2d ago
研究

研究人员提出用于智能体式 3D 创作的 aDSL

这篇论文将面向智能体的 3D 语言与无需训练的多智能体工作流结合起来。

HF Daily Papers·2d ago
研究

Abra 研究描绘扩散图像训练的缩放规律

HF Daily Papers 重点介绍了一项针对文本生成图像扩散模型的计算缩放研究。

HF Daily Papers·2d ago
研究

GS-Voxel 瞄准大规模航拍 3DGS 生成

该框架可将预优化的 3D Gaussian 场景转换为稀疏结构化潜变量,无需针对每个场景单独拟合。

HF Daily Papers·2d ago
研究

论文提出面向能力的图像生成数据设计方法

该框架围绕能力依赖关系来组织图像生成训练数据。

HF Daily Papers+1 家媒体·2d ago
研究

研究人员推出用于自主科学研究的 ASI-Bench

该基准通过 60 项研究任务,测试创新探索能力和科学执行能力。

HF Daily Papers+1 家媒体·2d ago
研究

研究测试 DeepSeek Harness 抵御提示注入的能力

HF Daily Papers 摘要称,研究在 16 个间接内容渠道中进行了 14,560 次受控执行。

HF Daily Papers·2d ago
研究

新论文聚焦基于记忆的具身导航

UniWM 和 TAMP-Nav 提出了不同路径,用于在导航智能体中对齐视觉预测、记忆与行动。

HF Daily Papers+1 家媒体·2d ago
研究

EditBridge 瞄准超高分辨率图像编辑

这种扩散桥方法旨在保留源图细节,同时细化低分辨率编辑结果。

HF Daily Papers·2d ago
研究

研究人员瞄准视觉与解码中的 MoE 延迟问题

新论文提出 MoE 视觉编码器、更快的小批量解码,以及在线负载均衡方案。

HF Daily Papers+1 家媒体·2d ago
研究

InternLM 提出 Mobius 模型架构

这篇 arXiv 论文通过分离记忆与推理来提升压缩能力和推理效率。

r/LocalLLaMA+1 家媒体·2d ago
研究

R^3-Bench 在共享预算下测试 LLM 推理能力

该基准在计算受限条件下,评估六个模型在多组问题套件中的表现。

HF Daily Papers+1 家媒体·3d ago
研究

ClawGym II 瞄准面向 agent harness 的黑箱强化学习

这篇论文提出通过沙盒化 rollout 和轨迹恢复,在复杂 harness 中训练 agent。

HF Daily Papers+1 家媒体·3d ago
研究

GenRouter 将图像生成提示词路由到成本更低的工作流

该框架统一了智能体式图像管线,并按任务需求为提示词匹配合适的流程。

HF Daily Papers·3d ago
研究

Ventor-QTest 审计供应商托管的 LLM API

这篇论文提出了一种黑盒方法,用于测试托管开放权重模型 API 中的保真度损失。

HF Daily Papers+1 家媒体·3d ago
研究

HarnessEval-W 为世界模型加入基于智能体的测试

这套基准测试流程使用子智能体评估 rollout,并提供可检查的推理链。

HF Daily Papers·3d ago
研究

研究训练出更快的像素空间扩散模型

HF Daily Papers 重点介绍了一种用于文本生成图像扩散训练的“潜空间到像素空间”方案。

HF Daily Papers·3d ago
研究

AnyTalk 无需动画数据即可生成语音动画

该方法通过改造视频扩散模型,生成口型同步的 3D 角色语音动画。

HF Daily Papers·3d ago
研究

HiFi-BRep 旨在提升 B-Rep 生成的稳健性

该框架通过拓扑感知编码和并行解码,改进 CAD 边界表示生成。

HF Daily Papers·3d ago
研究

GRNEdit 提出轻量级指令式视频编辑方法

这篇论文将视频编辑表述为对二值视觉编码的保留或翻转决策。

HF Daily Papers+1 家媒体·3d ago
研究

研究人员将扩散模型推进到像素空间

两篇论文提出了面向图像修复和文生图生成的像素空间扩散方法。

HF Daily Papers·3d ago
研究

AI 开发工具与实践引发 Hacker News 讨论

围绕 MathCode、AI 编程习惯、Cloudflare 以及 Google 的 HEIR 的帖子成为讨论焦点。

Hacker News+5 家媒体·3d ago
研究

Google 推进同态加密在私密 AI 中的应用

Google 表示,正通过同态加密让私密 AI 变得更具可行性。

Hacker News+8 家媒体·3d ago
研究

Google 称正让私密 AI 走向实用

一篇 Google Security 博客文章引发了 Hacker News 讨论,也伴随着更广泛的 AI 批评。

Hacker News+5 家媒体·3d ago
研究

研究人员发布 LittleLearner,用于受控研究 LLM

这款 5B 参数模型基于 88B token、面向五年级及以下水平的课程语料训练而成。

r/LocalLLaMA+1 家媒体·3d ago
研究

HN 热议 AI 的局限、隐私与科学主张

围绕药物发现、数学、隐私和 AI 实验室的帖子在 Hacker News 上引发了热烈讨论。

Hacker News+11 家媒体·4d ago
研究

新报告检验 AI 在科学与工作中的主张

Hacker News 讨论聚焦药物发现、数学和 ChatGPT 使用中的 AI 证据。

Hacker News+2 家媒体·4d ago
研究

研究人员聚焦 VLM 空间推理短板

多篇新论文为视觉语言系统的空间智能提出记忆机制、RL 方法和基准测试。

arXiv cs.AI+1 家媒体·4d ago
研究

Google 发布面向编程和智能体的 Gemini 3.7 Flash

这款新的 Flash 模型已登陆 Gemini API、Google AI Studio、Android Studio 和企业工具。

Hacker News+13 家媒体·5d ago
研究

新研究聚焦视觉 AI 的空间智能

SpaRRTa、SMA 和 PinpointQA 用于测试或提升视觉与具身 AI 系统的空间推理能力。

arXiv cs.LG+1 家媒体·5d ago
研究

CW-BASS v2 借助 DINOv2 改进伪标签筛选

该方法针对基础模型教师下的半监督分割,对筛选机制进行自适应调整。

arXiv cs.LG+1 家媒体·5d ago
研究

Anthropic 研究发现,AI agent 在共享任务中可能发生冲突

研究人员称,多 agent 行为可能暴露当前 AI 安全测试的不足。

TechCrunch AI·6d ago
研究

研究人员提出用于视频去反射的扩散模型

S2R 将基于物理的反射模拟与扩散式视频去除模型及基准测试相结合。

arXiv cs.AI+1 家媒体·6d ago
研究

论文主张智能体安全需要运行时契约

这篇 arXiv 论文称,对自主智能体而言,仅靠训练阶段的对齐并不足够。

arXiv cs.AI+1 家媒体·6d ago
研究

研究人员测试由 AI 构建的弱模型推理框架

一个更强模型构建了推理时脚手架,使弱模型在心理理论基准测试中的得分提高。

arXiv cs.AI+1 家媒体·6d ago
研究

研究人员测试具身智能体的执行框架

Thea 和 SHAPER 将 coding-agent 基础设施思路应用到机器人和具身 AI。

arXiv cs.AI+1 家媒体·6d ago
研究

论文研究 LLM Agent 的 GPU 控制路径

Ready Cohorts 建模了 Agent 控制工作何时可以留在 GPU 上,而不是返回主机端。

arXiv cs.AI+1 家媒体·6d ago
研究

Mechanist 将 AI Agent 用于模型可解释性研究

这篇 arXiv 论文介绍了一套用于在 AI 模型中自主发现机制的 agentic 系统。

arXiv cs.AI+1 家媒体·6d ago
研究

新论文聚焦 LLM 探索能力的边界

DORA、3PO 和 RISE-RL 提出多种方法,试图改进智能体探索与 RL 训练。

arXiv cs.AI+1 家媒体·6d ago
研究

新论文界定并测试面向机器人的世界模型

一篇教程和一个基准分别回应了交互式世界模型的定义与评测问题。

arXiv cs.AI+1 家媒体·6d ago
研究

研究人员聚焦长期 AI Agent 的记忆失效问题

多篇新论文提出用图结构、分段整合和干扰诊断等方法维护 Agent 记忆。

arXiv cs.AI+1 家媒体·6d ago