새 논문들, LLM 탐색 한계 정조준
DORA, 3PO, RISE-RL이 에이전트와 RL 학습에서 탐색을 개선하는 방법을 제안했다.
왜 중요한가
이 논문들은 temperature scaling 같은 토큰 수준 탐색 방식의 공통 한계를 짚는다. 이런 방식은 유용한 시퀀스 수준 다양성을 만들어내지 못할 수 있다. 더 나은 탐색은 프롬프트 변경이나 스칼라 보상에만 의존하지 않고도 LLM 에이전트, 추론 학습, 개방형 정렬 워크플로를 개선할 수 있다.
핵심 포인트
- 1.DORA는 학습 없이 시퀀스 수준 탐색을 개선한다.
- 2.3PO는 정책을 샘플링해 RLVR 롤아웃의 다양성을 높인다.
- 3.RISE-RL은 반복적으로 놓친 루브릭 기준을 겨냥한다.
여러 arXiv 논문이 대규모 언어 모델의 탐색 능력을 개선하기 위한 새 방법을 소개했다. DORA Explorer는 학습 없이 추론 시점에 작동하는 알고리즘으로, 여러 후보 행동을 생성한 뒤 시퀀스 수준의 로그확률 통계로 점수를 매기고 조절 가능한 탐색 파라미터에 따라 샘플링한다. 3PO는 사후분포에서 서로 다른 정책을 샘플링해 RLVR을 위한 파라미터 공간 탐색을 수행하며, RISE-RL은 반복적으로 놓친 루브릭 기준을 활용해 개방형 RL에서 선택적 탐색을 유도한다.
⚡ 오늘 바로 활용
에이전트 탐색이나 RL 롤아웃에서 temperature에만 의존하기 전에 DORA와 3PO 논문을 읽어볼 필요가 있다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
감사-수정 맥락이 LLM 검증기를 더 관대하게 만든다는 연구 결과
arXiv 논문은 모델 맥락에 앞선 감사-수정 사례가 있을 때 오탐이 줄어든다고 보고했다.
arXiv cs.AI+1 outlet·22h ago
연구
AlphaEvolve, 행렬 곱셈 상한 낮추는 데 기여
새 arXiv 노트가 행렬 곱셈 지수의 개선된 상한을 보고했다.
arXiv cs.AI+1 outlet·22h ago
연구
InternLM, Mobius 모델 아키텍처 제안
arXiv 논문은 압축률과 추론 효율을 높이기 위해 메모리와 추론을 분리했다.
r/LocalLLaMA+1 outlet·1d ago