논문들, MLLM 추론의 모달리티 균형 겨냥
두 가지 새 방법이 모델이 이미지와 텍스트 신호를 쓰는 방식을 조절해 시각 추론을 개선하려 한다.
왜 중요한가
두 보고서 모두 MLLM의 핵심 문제에 초점을 맞춘다. 텍스트 생성이 지배적이 되거나 불확실성 지표가 지각과 논리를 구분하지 못할 때 시각 추론 성능이 저하될 수 있다는 점이다. 이 연구는 더 큰 모델에만 의존하지 않고 멀티모달 추론을 개선하기 위한 더 정교한 추론 및 사후 훈련 방법으로 이어질 가능성을 보여준다.
핵심 포인트
- 1.AGS는 훈련 없이 잠재 추론과 명시적 추론을 전환한다.
- 2.OPD-V는 모달리티 균형을 활용해 시각 자기 증류를 이끈다.
- 3.두 방법 모두 멀티모달 추론에서 텍스트 지배 문제를 다룬다.
연구진은 멀티모달 대형 언어 모델을 위한 훈련 없는 추론 전략인 Attention-Guided Switching을 소개했다. 이 방법은 시각-텍스트 attention 비율을 활용해 지각 토큰에는 잠재 추론을, 논리 단계에는 명시적 추론을 언제 적용할지 결정한다. 별도의 HF Daily Papers 항목은 모달리티 균형을 특권 정보로 취급하고 모달리티 균형 trust region을 통해 on-policy 토큰을 선택하는 시각적 on-policy 자기 증류 접근법 OPD-V를 설명했다. OPD-V 보고서는 실험이 6개 벤치마크에 걸쳐 진행됐다고 밝히지만, 제공된 출처 발췌문에는 결과가 포함돼 있지 않다.
⚡ 오늘 바로 활용
시각 추론 파이프라인에 chain-of-thought나 자기 증류를 추가하기 전에 AGS와 OPD-V 논문을 먼저 읽어야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.