DiSCO, 블랙박스 텍스트-이미지 안전성 겨냥
이 arXiv 논문은 모델 접근 없이 NSFW 출력을 줄이기 위한 프롬프트 수준 최적화 방식을 제안한다.
왜 중요한가
기존 안전성 방어 기법 다수는 모델 내부에 접근할 수 있다고 가정해, 독점 이미지 생성기에 적용하기 어렵다. 논문에서 보고한 설정을 넘어 검증된다면, 엄격한 블랙박스 접근법은 폐쇄형과 개방형 시스템 전반에 안전성 개입을 더 쉽게 적용하게 해줄 수 있다.
핵심 포인트
- 1.DiSCO는 재학습이나 모델 내부 접근 없이 프롬프트 수준에서 작동한다.
- 2.이 방법은 겉보기에는 무해한 프롬프트가 NSFW 생성을 유발하는 문제를 다룬다.
- 3.대상 모델의 이미지 풀을 활용해 더 안전한 프롬프트 접미사를 찾도록 유도한다.
연구진은 텍스트-이미지 시스템을 위한 제로샷 방어 기법 DiSCO를 소개했다. 이 방식은 전적으로 프롬프트 수준에서 작동한다. DiSCO는 언어적으로는 안전한 프롬프트가 모델이 학습한 분포 때문에 유해한 출력을 만들어내는 사례를 겨냥하며, 접미사 확장, 빔 서치, 안전·불안전 이미지 풀에 대한 대조 점수화, 대상 모델의 반복 피드백을 활용한다.
⚡ 오늘 바로 활용
텍스트-이미지 안전 필터에 LLM 기반 프롬프트 재작성만 의존하기 전에 논문을 먼저 읽어야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다
이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.
arXiv cs.AI+1 outlet·8h ago
연구
Agent Lightning v1.0, harness 기반 agentic RL 겨냥
이 프레임워크는 임의의 agent harness를 강화학습 기반 post-training에 연결한다.
arXiv cs.AI+1 outlet·8h ago
연구
논문, LLM 간 메모리 이전 가능성 시험
연구진은 타깃 측 리더를 활용해 고정된 학습 메모리가 서로 다른 모델 백본 사이에서 어떻게 이동할 수 있는지 분석했다.
arXiv cs.AI+1 outlet·8h ago