
01. 금지된 요청
지난 1년 동안, 대형 언어 모델과 시간을 보내는 사람이라면 누구나 '안전 정책'이라는 것을 접했을 가능성이 있습니다. 프롬프트를 입력하면—때로는 약간 암시적이거나, 때로는 단순히 시각적으로 표현적인 경우도 있습니다—창의적인 결과를 기대하게 됩니다. 대신 거절 메시지를 받게 됩니다.
보통 이렇게 생겼습니다: 죄송합니다. 귀하의 요청이 당사의 안전 정책을 위반합니다.
ChatGPT, Gemini 또는 다른 주요 모델을 사용하든 결과는 대개 동일합니다: 시스템이 완전히 거부합니다. 이미지 생성 시스템조차도 폭력적이거나 성인 테마의 출력을 차단합니다.
사용자에게는 마치 고급 레스토랑에 가서 매운 음식을 주문했지만, 설명과 함께 평범하게 삶은 채소만 제공받는 것처럼 느껴질 수 있습니다: “고객님의 안전을 위해 매운 음식을 제공하지 않습니다.”
이는 간단한 질문을 제기합니다: 오늘날 가장 강력한 AI 시스템이 에세이를 쓰고, 수학 문제를 해결하며, 이미지를 생성할 수 있음에도 불구하고, 왜 NSFW 콘텐츠에 대해서는 이렇게 제한적일까요?
02. 두 세계: 폐쇄형 플랫폼 대 오픈 소스 생태계
폐쇄형 상업 모델: '관리형 테마파크'
OpenAI나 Google과 같은 회사를 거대한, 세심하게 관리되는 테마파크의 운영자로 생각하세요. 이들은 수백만 명의 사용자가 매일 이용할 수 있는 안전하고 신뢰할 수 있는 환경을 구축하기 위해 엄청난 자원을 투자했습니다.
이제 한 방문객이 갑자기 공원 한가운데에서 부적절하게 행동한다고 상상해 보세요—규칙을 무시하거나, 몸을 드러내거나, 다른 사람에게 해를 끼치는 경우입니다.
운영자의 관점에서, 대응은 즉각적입니다: 사용자를 제거하십시오. 그들이 신속하게 행동하지 않으면, 규제 당국이 개입할 수 있고, 공공의 신뢰가 무너질 수 있으며, 전체 사업이 위험에 처할 수 있습니다.
이것은 상업용 AI 제공업체들이 직면한 현실입니다. 그들에게 NSFW 콘텐츠는 단순한 기술적 문제가 아니라 법적, 평판적, 재정적 위험입니다.
그 결과, 대부분의 회사는 간단한 전략을 채택합니다: 무언가 재앙적인 일이 통과하도록 허용하는 것보다 지나치게 차단하는 것이 더 낫다.
오픈 소스 모델: '와일드 웨스트'
반대쪽에는 오픈 소스 생태계(예: 스테이블 디퓨전 및 관련 모델)가 있습니다. 모델 가중치가 공개되면 누구나 로컬에서 실행하고, 수정하며, 안전 필터를 완전히 제거할 수 있습니다.
이것은 훨씬 더 유연하고 실험적이지만 통제는 덜 되는 매우 다른 환경을 만듭니다.
03. AI 시스템이 NSFW 콘텐츠를 제한하는 방법
안전이 다음과 같은 단순한 키워드 필터로 구현된다는 것은 일반적인 오해입니다:
if (contains_sensitive_words) {
reject_request;
}
실제로 현대 안전 시스템은 층으로 이루어져 있으며 훨씬 더 복잡합니다.
레이어 1: 사전 생성 필터링
프롬프트가 모델에 도달하기 전에, 그것은 종종 별도의 검열 시스템에 의해 평가됩니다. 입력이 위험한 것으로 표시되면 즉시 차단되며 메인 모델에 도달하지 않습니다.
생성 후에는 출력물이 사용자에게 표시되기 전에 추가 필터가 이를 검사할 수도 있습니다. 콘텐츠가 안전하지 않은 것으로 간주되면 차단되거나 제거됩니다.
여기에는 누드, 폭력 및 기타 민감한 범주에 대한 탐지가 포함됩니다.
레이어 2: 인간 피드백 기반 강화 학습 (RLHF)
더 중요한 메커니즘은 RLHF로, 이는 모델의 행동을 인간의 기대에 맞추는 역할을 한다.
훈련 동안, 모델은 반복적으로 응답 예시를 보여주고 인간 평가자에 의해 순위가 매겨집니다. 안전 규칙을 위반하는 출력은 부정적인 피드백을 받는 반면, 안전하고 적절한 응답은 보상을 받습니다.
시간이 지나면서 모델은 특정 패턴을 피하는 법을 학습합니다. 모델은 민감한 요청을 거절하거나 신중하고 중립적인 톤으로 응답하는 내부적인 경향을 발전시킵니다.
04. 조정의 비용: ‘과도한 거절’
이 엄격한 정렬 과정에는 종종 '정렬 세금'이라고 불리는 대가가 있습니다.
유해한 출력을 방지하기 위해, 모델은 민감한 내용과 조금이라도 유사한 것은 피하도록 훈련됩니다. 그러나 이는 모델이 지나치게 보수적으로 되는 원인이 되기도 합니다.
예를 들어, 어떤 모델이 거부할 수 있습니다:
- 역사적 맥락에서도 나체를 포함한 예술 참고 자료
- 폭력을 언급하는 의학적 또는 해부학적 논의
- 흡연이나 다른 위험한 행동이 포함된 허구의 장면
그 결과, 시스템은 때때로 합법적인 창의적 또는 교육적 작업에 대해 덜 유연하고 덜 유용해집니다. 이 현상은 종종 다음과 같이 설명됩니다. 과도한 거부.
05. 두 갈래 길: 통제된 시스템 vs 열린 자유
AI 생태계는 효과적으로 두 가지 방향으로 나뉘었습니다.
폐쇄 시스템은 안전, 규정 준수 및 브랜드 보호를 우선시합니다. 이러한 시스템은 엄격하게 관리되고, 강력하게 필터링되며, 위험을 최소화하도록 설계되었습니다.
오픈 소스 시스템은 유연성과 사용자 제어를 우선시합니다. 사용자는 모델을 자유롭게 수정할 수 있지만, 사용 방식에 대한 책임도 져야 합니다.
한 경우에는, 당신은 매우 규제된 환경 안에 있습니다. 다른 경우에는, 사실상 제한 없는 컴퓨팅 공간에서 작동하고 있습니다.
06. 최종 생각
AI에서 NSFW 콘텐츠에 대한 논쟁은 더 깊은 긴장을 반영합니다: 표현의 자유와 사회적 위험 통제 사이의 균형입니다.
AI 시스템 자체에는 도덕성이 없습니다. 그것들은 데이터로 학습된 통계 모델입니다. 그것들이 생성할 수 있는 것은 전적으로 인간의 설계 선택과 정책 제약에 의해 결정됩니다.
시스템이 더 강력해질수록 이러한 제약은 더 엄격해집니다. 이는 모델이 '도덕적으로 의식적'이어서가 아니라, 실패의 결과가 더 심각해지기 때문입니다.
요약하면: 인공지능의 경계는 사회 자체의 경계를 반영한다.
향후 논의는 AI가 무엇을 할 수 있는지뿐만 아니라, 사용자가 프롬프트 엔지니어링과 '탈옥'을 통해 이러한 제약을 회피하려는 방법에도 초점을 맞출 가능성이 높습니다.