N NSFWAITool
简体中文

科技巨头为何如此强硬地屏蔽 AI 系统中的 NSFW 内容

科技巨头为何如此强硬地屏蔽 AI 系统中的 NSFW 内容封面
科技巨头为何如此强硬地屏蔽 AI 系统中的 NSFW 内容

01. 被禁止的请求

过去一年里,只要使用过大语言模型,很可能就遇到过所谓的“安全政策”。你输入一段提示词——有时略带暗示,有时只是视觉表现力较强——原本期待获得富有创意的输出,结果却收到一条拒绝消息。

通常会看到这样的提示:“抱歉,你的请求违反了我们的安全政策。”

无论使用 ChatGPT、Gemini,还是其他主流模型,结果往往都一样:系统直接拒绝请求。即使是图像生成系统,也会屏蔽暴力或成人主题的输出。

对用户来说,这就像走进一家高档餐厅点了辣菜,端上来的却是清水煮蔬菜,服务员还解释道:“为了您的安全,我们不提供辣味菜品。”

这就引出了一个简单的问题:如今最强大的 AI 系统既能写文章、解数学题,也能生成图像,为什么一涉及 NSFW 内容,就会变得如此严格?


02. 两个世界:封闭平台与开源生态

闭源商业模型:“管理严格的主题乐园”

可以把 OpenAI 或 Google 这样的公司想象成一座大型主题乐园的运营方。它们投入了巨量资源,打造出一个安全、可靠的环境,供数百万用户每天使用。

现在设想一下,一名游客突然在乐园中央做出不当行为——无视规则、暴露身体,或伤害他人。

从运营方的角度看,处理方式很直接:将这名用户请出去。如果不迅速采取行动,监管机构可能介入,公众信任可能崩塌,整个业务都可能面临风险。

这正是商业 AI 服务商面对的现实。对它们而言,NSFW 内容不只是技术问题,更意味着法律、声誉和财务风险。

因此,大多数公司采取了一种简单的策略:宁可多拦一些,也不能放过可能造成灾难性后果的内容。

开源模型:“蛮荒地带”

另一边则是开源生态(例如 Stable Diffusion 及相关模型)。模型权重一旦发布,任何人都可以在本地运行和修改模型,甚至彻底移除安全过滤器。

由此形成的环境截然不同——更灵活、更具实验性,但也更难控制。


03. AI 系统如何限制 NSFW 内容

一种常见误解是,安全机制只是通过简单的关键词过滤来实现,例如:

if (contains_sensitive_words) {
    reject_request;
}

实际上,现代安全系统由多层机制构成,复杂得多。

第一层:生成前过滤

提示词在送入模型之前,通常会先由独立的内容审核系统进行评估。如果输入被标记为高风险,就会立即遭到拦截,根本不会进入主模型。

内容生成后,还可能有额外的过滤器在结果展示给用户之前进行扫描。如果内容被判定为不安全,就会被屏蔽或移除。

检测范围包括裸露、暴力及其他敏感类别。

第二层:RLHF(基于人类反馈的强化学习)

更重要的一项机制是 RLHF,它用于让模型行为与人类预期保持一致。

在训练过程中,模型会反复接触各种回复示例,并由人工审核人员对其排序。违反安全规则的输出会得到负面反馈,安全且恰当的回复则会受到奖励。

随着训练推进,模型会学会避开某些模式,并逐渐形成一种内在倾向:拒绝敏感请求,或以谨慎、中立的语气作答。


04. 对齐的代价:“过度拒绝”

这种严格的对齐过程也要付出代价,通常被称为“对齐税”。

为了防止生成有害内容,模型会被训练成避开任何看起来与敏感内容相似的请求。然而,这也可能使模型变得过于保守。

例如,模型可能会拒绝:

  • 涉及裸露的人体艺术参考,即使置于历史语境中
  • 提及暴力的医学或解剖学讨论
  • 包含吸烟或其他风险行为的虚构场景

结果是,面对正当的创作或教育任务时,系统有时会变得不够灵活,实用性也随之降低。这种现象通常被称为过度拒绝


05. 两条路径:受控系统与开放自由

AI 生态实际上已经分化为两个方向。

封闭系统优先考虑安全、合规和品牌保护。这类系统受到严格控制和多重过滤,其设计目标是尽可能降低风险。

开源系统则优先考虑灵活性和用户控制权。用户可以自由修改模型,但也必须为模型的使用方式承担责任。

前一种情况下,你身处一个受到严格监管的环境;后一种情况下,你实际上是在一个不受限制的计算空间中操作。


06. 结语

围绕 AI 中 NSFW 内容的争论,反映出一种更深层的张力:如何在表达自由与社会风险管控之间取得平衡。

AI 系统本身没有道德观。它们只是基于数据训练的统计模型。它们可以生成什么,完全取决于人类的设计选择和政策约束。

随着系统能力越来越强,这些限制也会愈发严格——不是因为模型具备了“道德意识”,而是因为失败所带来的后果会更加严重。

简而言之:AI 的边界,映射的正是社会自身的边界。

未来的讨论很可能不仅会关注 AI 能做什么,也会关注用户如何通过提示工程和“越狱”来绕过这些限制。