AAI News Hub
연구Wed, August 19, 2026·8h ago2 sources corroborating

DiSCO, 블랙박스 텍스트-이미지 안전성 겨냥

이 arXiv 논문은 모델 접근 없이 NSFW 출력을 줄이기 위한 프롬프트 수준 최적화 방식을 제안한다.

왜 중요한가

기존 안전성 방어 기법 다수는 모델 내부에 접근할 수 있다고 가정해, 독점 이미지 생성기에 적용하기 어렵다. 논문에서 보고한 설정을 넘어 검증된다면, 엄격한 블랙박스 접근법은 폐쇄형과 개방형 시스템 전반에 안전성 개입을 더 쉽게 적용하게 해줄 수 있다.

핵심 포인트

  • 1.DiSCO는 재학습이나 모델 내부 접근 없이 프롬프트 수준에서 작동한다.
  • 2.이 방법은 겉보기에는 무해한 프롬프트가 NSFW 생성을 유발하는 문제를 다룬다.
  • 3.대상 모델의 이미지 풀을 활용해 더 안전한 프롬프트 접미사를 찾도록 유도한다.

연구진은 텍스트-이미지 시스템을 위한 제로샷 방어 기법 DiSCO를 소개했다. 이 방식은 전적으로 프롬프트 수준에서 작동한다. DiSCO는 언어적으로는 안전한 프롬프트가 모델이 학습한 분포 때문에 유해한 출력을 만들어내는 사례를 겨냥하며, 접미사 확장, 빔 서치, 안전·불안전 이미지 풀에 대한 대조 점수화, 대상 모델의 반복 피드백을 활용한다.

오늘 바로 활용

텍스트-이미지 안전 필터에 LLM 기반 프롬프트 재작성만 의존하기 전에 논문을 먼저 읽어야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구