AAI News Hub
연구Thu, August 13, 2026·5d ago2 sources corroborating

새 논문들, LLM 탐색 한계 정조준

DORA, 3PO, RISE-RL이 에이전트와 RL 학습에서 탐색을 개선하는 방법을 제안했다.

왜 중요한가

이 논문들은 temperature scaling 같은 토큰 수준 탐색 방식의 공통 한계를 짚는다. 이런 방식은 유용한 시퀀스 수준 다양성을 만들어내지 못할 수 있다. 더 나은 탐색은 프롬프트 변경이나 스칼라 보상에만 의존하지 않고도 LLM 에이전트, 추론 학습, 개방형 정렬 워크플로를 개선할 수 있다.

핵심 포인트

  • 1.DORA는 학습 없이 시퀀스 수준 탐색을 개선한다.
  • 2.3PO는 정책을 샘플링해 RLVR 롤아웃의 다양성을 높인다.
  • 3.RISE-RL은 반복적으로 놓친 루브릭 기준을 겨냥한다.

여러 arXiv 논문이 대규모 언어 모델의 탐색 능력을 개선하기 위한 새 방법을 소개했다. DORA Explorer는 학습 없이 추론 시점에 작동하는 알고리즘으로, 여러 후보 행동을 생성한 뒤 시퀀스 수준의 로그확률 통계로 점수를 매기고 조절 가능한 탐색 파라미터에 따라 샘플링한다. 3PO는 사후분포에서 서로 다른 정책을 샘플링해 RLVR을 위한 파라미터 공간 탐색을 수행하며, RISE-RL은 반복적으로 놓친 루브릭 기준을 활용해 개방형 RL에서 선택적 탐색을 유도한다.

오늘 바로 활용

에이전트 탐색이나 RL 롤아웃에서 temperature에만 의존하기 전에 DORA와 3PO 논문을 읽어볼 필요가 있다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구