AAI News Hub
연구Fri, August 7, 2026·5d ago2 sources corroborating

LoT, 모델 학습 없이 KB-VQA 정확도 높여

이 추론 시점 기법은 멀티모달 답변 생성 전에 시각 및 텍스트 근거를 강조한다.

왜 중요한가

이번 결과는 모델 재학습이나 아키텍처 변경 없이도 검색 증강 멀티모달 시스템을 개선할 수 있는 실용적 방법으로 추론 시점의 근거 선택이 유효하다는 점을 보여준다. 이는 잡음이 섞인 검색 결과와 주의를 분산시키는 이미지 영역이 답변 품질을 떨어뜨릴 수 있는 시각 QA 시스템을 구축하는 팀들에게 의미가 있다.

핵심 포인트

  • 1.LoT는 내부 attention을 사용해 시각 및 텍스트 근거를 선택한다.
  • 2.이 방법은 파라미터 업데이트나 보조 모델이 필요 없다.
  • 3.평가된 MLLM 전반에서 최대 12.5 정확도 포인트의 향상이 보고됐다.

연구진은 지식 기반 시각 질의응답(KB-VQA)을 위한 학습 불필요 추론 시점 프레임워크인 Look Twice(LoT)를 공개했다. LoT는 멀티모달 모델 자체의 attention 패턴을 활용해 질문과 관련 있는 이미지 영역과 검색된 텍스트 문장을 선택하고, 방해가 되는 콘텐츠를 걸러낸 뒤, 답변 생성 전에 강조된 근거를 포함하도록 입력을 재구성한다. 논문에 따르면 4개 KB-VQA 벤치마크와 2B부터 38B 파라미터 규모의 기성 멀티모달 모델 10종에서 평가한 모든 backbone의 성능이 개선됐으며, 평균 최대 12.5 정확도 포인트의 향상이 보고됐다.

오늘 바로 활용

KB-VQA 파이프라인을 fine-tuning하기 전에 근거 강조나 attention 기반 입력 재구성을 먼저 테스트해볼 필요가 있다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구