
01. 被禁止的請求
過去一年里,只要使用過大語言模型,很可能就遇到過所謂的“安全政策”。你輸入一段提示詞——有時略帶暗示,有時只是視覺表現力較強——原本期待獲得富有創意的輸出,結果卻收到一條拒絕訊息。
通常會看到這樣的提示:“抱歉,你的請求違反了我們的安全政策。”
無論使用 ChatGPT、Gemini,還是其他主流模型,結果往往都一樣:系統直接拒絕請求。即使是影像生成系統,也會屏蔽暴力或成人主題的輸出。
對使用者來說,這就像走進一家高檔餐廳點了辣菜,端上來的卻是清水煮蔬菜,服務員還解釋道:“為了您的安全,我們不提供辣味菜品。”
這就引出了一個簡單的問題:如今最強大的 AI 系統既能寫文章、解數學題,也能生成影像,為什麼一涉及 NSFW 內容,就會變得如此嚴格?
02. 兩個世界:封閉平臺與開源生態
閉源商業模型:“管理嚴格的主題樂園”
可以把 OpenAI 或 Google 這樣的公司想象成一座大型主題樂園的營運方。它們投入了巨量資源,打造出一個安全、可靠的環境,供數百萬使用者每天使用。
現在設想一下,一名游客突然在樂園中央做出不當行為——無視規則、暴露身體,或傷害他人。
從營運方的角度看,處理方式很直接:將這名使用者請出去。如果不迅速采取行動,監管機構可能介入,公眾信任可能崩塌,整個業務都可能面臨風險。
這正是商業 AI 服務商面對的現實。對它們而言,NSFW 內容不只是技術問題,更意味著法律、聲譽和財務風險。
因此,大多數公司采取了一種簡單的策略:寧可多攔一些,也不能放過可能造成災難性后果的內容。
開源模型:“蠻荒地帶”
另一邊則是開源生態(例如 Stable Diffusion 及相關模型)。模型權重一旦發布,任何人都可以在在本機執行和修改模型,甚至徹底移除安全過濾器。
由此形成的環境截然不同——更靈活、更具實驗性,但也更難控制。
03. AI 系統如何限制 NSFW 內容
一種常見誤解是,安全機制只是通過簡單的關鍵詞過濾來實現,例如:
if (contains_sensitive_words) {
reject_request;
}
實際上,現代安全系統由多層機制構成,復雜得多。
第一層:生成前過濾
提示詞在送入模型之前,通常會先由獨立的內容審核系統進行評估。如果輸入被標記為高風險,就會立即遭到攔截,根本不會進入主模型。
內容生成后,還可能有額外的過濾器在結果展示給使用者之前進行掃描。如果內容被判定為不安全,就會被屏蔽或移除。
檢測范圍包括裸露、暴力及其他敏感類別。
第二層:RLHF(基於人類回饋的強化學習)
更重要的一項機制是 RLHF,它用於讓模型行為與人類預期保持一致。
在訓練過程中,模型會反復接觸各種回復示例,並由人工審核人員對其排序。違反安全規則的輸出會得到負面回饋,安全且恰當的回復則會受到獎勵。
隨著訓練推進,模型會學會避開某些模式,並逐漸形成一種內在傾向:拒絕敏感請求,或以謹慎、中立的語氣作答。
04. 對齊的代價:“過度拒絕”
這種嚴格的對齊過程也要付出代價,通常被稱為“對齊稅”。
為了防止生成有害內容,模型會被訓練成避開任何看起來與敏感內容相似的請求。然而,這也可能使模型變得過于保守。
例如,模型可能會拒絕:
- 涉及裸露的人體藝術參考,即使置于歷史語境中
- 提及暴力的醫學或解剖學討論
- 包含吸煙或其他風險行為的虛構場景
結果是,面對正當的創作或教育任務時,系統有時會變得不夠靈活,實用性也隨之降低。這種現象通常被稱為過度拒絕。
05. 兩條路徑:受控系統與開放自由
AI 生態實際上已經分化為兩個方向。
封閉系統優先考慮安全、合規和品牌保護。這類系統受到嚴格控制和多重過濾,其設計目標是盡可能降低風險。
開源系統則優先考慮靈活性和使用者控制權。使用者可以自由修改模型,但也必須為模型的使用方式承擔責任。
前一種情況下,你身處一個受到嚴格監管的環境;后一種情況下,你實際上是在一個不受限制的計算空間中操作。
06. 結語
圍繞 AI 中 NSFW 內容的爭論,反映出一種更深層的張力:如何在表達自由與社會風險管控之間取得平衡。
AI 系統本身沒有道德觀。它們只是基於資料訓練的統計模型。它們可以生成什麼,完全取決于人類的設計選擇和政策約束。
隨著系統能力越來越強,這些限制也會愈發嚴格——不是因為模型具備了“道德意識”,而是因為失敗所帶來的后果會更加嚴重。
簡而言之:AI 的邊界,映射的正是社會自身的邊界。
未來的討論很可能不僅會關注 AI 能做什麼,也會關注使用者如何通過提示工程和“越獄”來繞過這些限制。