AAI News Hub

연구

60

연구

HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다

이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.

arXiv cs.AI+1 outlet·19h ago
연구

Agent Lightning v1.0, harness 기반 agentic RL 겨냥

이 프레임워크는 임의의 agent harness를 강화학습 기반 post-training에 연결한다.

arXiv cs.AI+1 outlet·19h ago
연구

논문, LLM 간 메모리 이전 가능성 시험

연구진은 타깃 측 리더를 활용해 고정된 학습 메모리가 서로 다른 모델 백본 사이에서 어떻게 이동할 수 있는지 분석했다.

arXiv cs.AI+1 outlet·19h ago
연구

DiSCO, 블랙박스 텍스트-이미지 안전성 겨냥

이 arXiv 논문은 모델 접근 없이 NSFW 출력을 줄이기 위한 프롬프트 수준 최적화 방식을 제안한다.

arXiv cs.AI+1 outlet·19h ago
연구

PTXBench, GPU 커널 최적화 능력으로 LLM 평가

이 벤치마크는 H100 및 B200 GPU의 GEMM과 어텐션 워크로드에서 아키텍처별 PTX 활용을 평가한다.

arXiv cs.AI+1 outlet·19h ago
연구

연구진, 에이전트 하네스를 위한 RL 프레임워크 제안

LEGO-RL과 ClawGym II는 장기 실행 AI 에이전트를 위한 안정적인 강화학습을 목표로 한다.

arXiv cs.AI+1 outlet·19h ago
연구

IBM, AI 에이전트에 필요한 메모리 규모를 실험하다

ALTK-Evolve 연구는 에이전트 메모리의 효과가 모델 역량과 제공 방식에 따라 달라진다고 분석했다.

Hugging Face·1d ago
연구

연구진, 트럭-드론 경로 최적화 위한 TTP-D 제안

새 벤치마크는 물품 선택, 적재량에 따른 경로 변화, 드론 동기화를 결합한다.

arXiv cs.AI+1 outlet·1d ago
연구

감사-수정 맥락이 LLM 검증기를 더 관대하게 만든다는 연구 결과

arXiv 논문은 모델 맥락에 앞선 감사-수정 사례가 있을 때 오탐이 줄어든다고 보고했다.

arXiv cs.AI+1 outlet·1d ago
연구

AlphaEvolve, 행렬 곱셈 상한 낮추는 데 기여

새 arXiv 노트가 행렬 곱셈 지수의 개선된 상한을 보고했다.

arXiv cs.AI+1 outlet·1d ago
연구

이미 익힌 것이 아니라 아직 남은 것을 학습하라: 다중 보상 정책 최적화를 위한 포화도 인식 어드밴티지 재가중

arXiv:2608.

arXiv cs.AI+1 outlet·1d ago
연구

TRACE-Bench, 다중 참조 이미지 생성을 겨냥하다

이 벤치마크는 프롬프트를 네 가지 연산자로 분해해 모델 실패를 진단한다.

arXiv cs.AI+1 outlet·1d ago
연구

Flow Motion Policy: 플로 매칭 모델을 활용한 매니퓰레이터 동작 계획

arXiv:2604.

arXiv cs.AI+1 outlet·1d ago
연구

연구진, 더 효율적인 비디오 추론을 위해 OPD를 적용

두 편의 논문이 증류 기법을 활용해 더 작은 모델이나 스트리밍 비디오 이해 모델의 성능을 개선했다.

arXiv cs.AI+1 outlet·1d ago
연구

연구진, LLM 에이전트 불확실성 평가 프레임워크 RUPA 제안

이 프레임워크는 개별 단계가 아니라 에이전트의 전체 실행 궤적 전반에서 신뢰도를 추정한다.

arXiv cs.CL+1 outlet·1d ago
연구

장기 과제 수행 LLM 에이전트 훈련을 겨냥한 새 논문들

연구진이 에이전트의 기여도 평가, 라우팅, 파인튜닝을 위한 TRCA, RLCascadeRouter, Agentic ESOpt를 제안했다.

arXiv cs.AI+1 outlet·1d ago
연구

새 연구들, 에이전트형 AI 서빙 요구사항을 짚다

네 편의 논문이 에이전트형 LLM 워크로드의 지연 시간, 캐싱, 트레이스, 엣지 서빙을 분석했다.

arXiv cs.AI+1 outlet·1d ago
연구

논문, 하나의 레이어 방정식으로 그래프 신경망 통합

이 프레임워크는 GNN 아키텍처를 일곱 가지 계산 구성요소로 매핑한다.

arXiv cs.LG+1 outlet·1d ago
연구

연구진, 구성적 이미지·비디오 편집에 주목

새 논문들이 통합 생성·편집 모델을 위한 학습 데이터와 증류 방법을 제안했다.

arXiv cs.CL+1 outlet·1d ago
연구

StartupBench, 스타트업 업무 흐름으로 에이전트 역량 시험

이 벤치마크는 시장에서 검증된 AI 제품에서 가져온 엔드투엔드 에이전트 업무를 평가한다.

HF Daily Papers+1 outlet·2d ago
연구

연구진, 에이전트형 3D 제작을 위한 aDSL 제안

이 논문은 에이전트 중심의 3D 언어와 학습이 필요 없는 멀티 에이전트 워크플로를 결합했다.

HF Daily Papers·2d ago
연구

Abra 연구, 확산 이미지 학습의 스케일링 법칙을 그리다

HF Daily Papers가 텍스트-투-이미지 확산 모델의 컴퓨트 스케일링 연구를 소개했다.

HF Daily Papers·2d ago
연구

GS-Voxel, 대규모 항공 3DGS 생성을 겨냥하다

이 프레임워크는 장면별 피팅 없이 사전 최적화된 3D Gaussian 장면을 희소 구조화 잠재 표현으로 변환한다.

HF Daily Papers·2d ago
연구

이미지 생성 위한 역량 중심 데이터 설계 제안한 논문

이 프레임워크는 이미지 생성 학습 데이터를 생성 역량 간 의존성을 중심으로 구성한다.

HF Daily Papers+1 outlet·2d ago
연구

연구진, 자율 과학 연구 평가를 위한 ASI-Bench 공개

이 벤치마크는 60개 연구 과제를 통해 혁신적 탐구와 과학적 실행 능력을 평가한다.

HF Daily Papers+1 outlet·2d ago
연구

연구진, 프롬프트 인젝션에 대한 DeepSeek Harness 내성 테스트

HF Daily Papers 요약에 따르면 16개 간접 콘텐츠 채널에서 14,560건의 통제 실행이 이뤄졌다.

HF Daily Papers·2d ago
연구

메모리 기반 체화 내비게이션을 겨냥한 새 논문들

UniWM과 TAMP-Nav는 내비게이션 에이전트에서 시각 예측, 메모리, 행동을 정렬하는 서로 다른 접근법을 제안한다.

HF Daily Papers+1 outlet·2d ago
연구

EditBridge, 초고해상도 이미지 편집 겨냥

확산 브리지 방식은 저해상도 편집 결과를 다듬는 과정에서 원본의 세부 정보를 보존하는 데 초점을 맞춘다.

HF Daily Papers·2d ago
연구

연구진, 비전과 디코딩에서 MoE 지연 시간 단축에 초점

새 논문들이 MoE 비전 인코더, 더 빠른 소규모 배치 디코딩, 온라인 부하 분산을 제안했다.

HF Daily Papers+1 outlet·2d ago
연구

InternLM, Mobius 모델 아키텍처 제안

arXiv 논문은 압축률과 추론 효율을 높이기 위해 메모리와 추론을 분리했다.

r/LocalLLaMA+1 outlet·2d ago
연구

R^3-Bench, 공유 예산에서 LLM 추론 능력 시험

이 벤치마크는 제한된 계산 자원 안에서 여섯 개 모델을 여러 문제 묶음으로 평가한다.

HF Daily Papers+1 outlet·3d ago
연구

ClawGym II, 에이전트 하네스를 위한 블랙박스 RL 겨냥

이 논문은 복잡한 하네스를 거쳐 에이전트를 학습시키기 위한 샌드박스 기반 롤아웃과 궤적 복원을 제안한다.

HF Daily Papers+1 outlet·3d ago
연구

GenRouter, 이미지 생성 프롬프트를 더 저렴한 워크플로로 라우팅

이 프레임워크는 에이전트형 이미지 파이프라인을 표준화하고, 작업 요구에 맞춰 프롬프트를 라우팅한다.

HF Daily Papers·3d ago
연구

Ventor-QTest, 벤더 호스팅 LLM API를 감사하다

이 논문은 호스팅된 오픈웨이트 모델 API의 충실도 손실을 테스트하는 블랙박스 방식을 제안한다.

HF Daily Papers+1 outlet·3d ago
연구

HarnessEval-W, 월드 모델 평가에 에이전트 기반 테스트 도입

이 벤치마크 파이프라인은 서브 에이전트를 활용해, 검토 가능한 추론 체인으로 롤아웃을 평가한다.

HF Daily Papers·3d ago
연구

더 빠른 픽셀 공간 diffusion 모델 학습 연구

HF Daily Papers가 텍스트-이미지 diffusion 학습을 위한 잠재 공간에서 픽셀 공간으로 이어지는 레시피를 소개했다.

HF Daily Papers·3d ago
연구

AnyTalk, 애니메이션 데이터 없이 음성 애니메이션 생성

이 방법은 비디오 확산 모델을 활용해 입 모양이 맞는 3D 캐릭터 음성 애니메이션을 만든다.

HF Daily Papers·3d ago
연구

HiFi-BRep, 더 견고한 B-Rep 생성을 겨냥하다

이 프레임워크는 topology-aware encoding과 parallel decoding으로 CAD boundary representation 개선을 노린다.

HF Daily Papers·3d ago
연구

GRNEdit, 가벼운 지시 기반 동영상 편집 방식 제안

이 논문은 동영상 편집을 이진 시각 코드에서 유지할지 전환할지를 결정하는 문제로 설정한다.

HF Daily Papers+1 outlet·3d ago
연구

연구진, diffusion model을 픽셀 공간으로 확장

두 편의 논문이 이미지 복원과 텍스트-이미지 생성에서 픽셀 공간 diffusion 기법을 제안했다.

HF Daily Papers·3d ago
연구

AI 개발자 도구와 활용 관행을 둘러싼 Hacker News 논쟁

MathCode, AI 코딩 습관, Cloudflare, Google의 HEIR 관련 게시물이 토론을 이끌었다.

Hacker News+5 outlets·3d ago
연구

Google, 동형암호로 프라이빗 AI 진전

Google은 동형암호를 활용해 프라이빗 AI를 더 실용적으로 만들고 있다고 밝혔다.

Hacker News+8 outlets·3d ago
연구

Google, private AI를 실용화하고 있다고 밝혀

Google Security 게시물이 Hacker News에서 논의를 불러왔고, 더 넓은 AI 비판과도 맞물렸다.

Hacker News+5 outlets·3d ago
연구

연구진, 통제된 LLM 연구용 LittleLearner 공개

50억 개 파라미터 모델로, 초등학교 5학년 이하 수준의 커리큘럼 말뭉치 880억 토큰으로 학습됐다.

r/LocalLLaMA+1 outlet·3d ago
연구

HN, AI의 한계와 프라이버시·과학적 주장 놓고 논쟁

신약 개발, 수학, 프라이버시, AI 연구소를 다룬 게시물들이 Hacker News에서 활발한 토론을 불러왔다.

Hacker News+11 outlets·4d ago
연구

새 보고서들, 과학과 업무 현장의 AI 주장 검증

Hacker News 토론에서 신약 개발, 수학, ChatGPT 활용을 둘러싼 AI 근거가 주목받았다.

Hacker News+2 outlets·4d ago
연구

연구진, VLM의 공간 추론 한계 겨냥

새 논문들이 비전-언어 시스템의 공간 지능을 높이기 위한 메모리, RL, 벤치마크를 제안했다.

arXiv cs.AI+1 outlet·4d ago
연구

Google, 코딩과 에이전트용 Gemini 3.7 Flash 출시

새 Flash 모델은 Gemini API, Google AI Studio, Android Studio 및 기업용 도구에서 사용할 수 있다.

Hacker News+13 outlets·5d ago
연구

새 연구들, 비전 AI의 공간 지능을 검증하다

SpaRRTa, SMA, PinpointQA는 시각 및 구현형 AI 시스템의 공간 추론을 평가하거나 개선한다.

arXiv cs.LG+1 outlet·5d ago
연구

CW-BASS v2, DINOv2 기반 의사 라벨 선별 겨냥

이 방법은 파운데이션 모델 교사를 활용한 준지도 세그멘테이션에 맞춰 필터링 방식을 조정한다.

arXiv cs.LG+1 outlet·5d ago
연구

Anthropic 연구, AI 에이전트가 공동 작업에서 충돌할 수 있다고 밝혀

연구진은 다중 에이전트 행동이 현재 AI 안전성 테스트의 허점을 드러낼 수 있다고 말한다.

TechCrunch AI·6d ago
연구

연구진, 동영상 반사 제거를 위한 확산 모델 제안

S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.

arXiv cs.AI+1 outlet·6d ago
연구

논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장

arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.

arXiv cs.AI+1 outlet·6d ago
연구

연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트

더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.

arXiv cs.AI+1 outlet·6d ago
연구

연구진, 임바디드 에이전트용 하네스 테스트

Thea와 SHAPER는 코딩 에이전트 인프라의 아이디어를 로봇과 임바디드 AI에 적용한다.

arXiv cs.AI+1 outlet·6d ago
연구

논문, LLM 에이전트의 GPU 제어 경로를 분석

Ready Cohorts는 에이전트 제어 작업이 호스트로 돌아가지 않고 GPU에 머물 수 있는 경우를 모델링한다.

arXiv cs.AI+1 outlet·6d ago
연구

Mechanist, AI 에이전트를 모델 해석 가능성 연구에 투입하다

이 arXiv 논문은 AI 모델 내부 메커니즘을 자율적으로 발견하기 위한 에이전트형 시스템을 설명한다.

arXiv cs.AI+1 outlet·6d ago
연구

새 논문들, LLM 탐색 한계 정조준

DORA, 3PO, RISE-RL이 에이전트와 RL 학습에서 탐색을 개선하는 방법을 제안했다.

arXiv cs.AI+1 outlet·6d ago
연구

새 논문들, 로보틱스용 월드 모델의 개념과 평가 방식을 정리하고 검증

튜토리얼과 벤치마크가 인터랙티브 월드 모델의 정의와 평가 문제를 다뤘다.

arXiv cs.AI+1 outlet·6d ago