N NSFWAITool
简体中文

2026 年提示词工程:为什么在 GPT-5.6 上,短提示词可能胜过长提示词

精简后的 GPT-5.6 提示词,以目标、约束和成功标准取代冗长的指令堆叠

上周,我删掉了自己最常用的一条提示词的一半内容,结果输出反而变好了。

这不是故作谦虚的炫耀,而是承认过去大约两年里,我一直在浪费 token,而且很可能还让结果变得更差。那条提示词具备旧方法所要求的一切:一个角色设定(“你是一名资深数据分析师”)、一大段背景信息、六个编号步骤、三个完整示例,以及最后一段提醒模型“认真思考,不要着急,并仔细检查结果”的话。你可以在 2024 年的任何提示词工程课程里看到这类提示词。

后来,我读到了 OpenAI 针对 GPT-5.6 发布的新指南,它告诉我,这些内容大多都应该删掉。

这条建议让我有些难受,因为我确实为那些内容付出过成本——不只是 token,还有时间。但思考得越久,我越觉得它有道理。

为什么“越长越好”的建议终于失效了

过去两年,提示词工程的主流建议始终指向同一个方向:继续加内容。加入人物设定,加入背景,加入步骤,加入示例,最后再提醒一句,免得模型偷懒。当时的模型能力还不够强,这么做确实有帮助——每增加一条指令,都是在为模型搭建它自己还搭不起来的脚手架。

GPT-5.6 已经不是那样的模型了。

OpenAI 自己的说法很直接:新模型更善于从上下文推断你的真实目标,以及你所期待的工作标准,不再需要你逐一写明每个步骤。如果你仍然向模型提供它已经不需要的逐步指令,那并不是在帮忙,而是在增加噪声。

我总会想到同一个比喻,因为它最能清楚地说明这种变化。旧方法把模型当成一个每个动作都需要安排好的新手——迈左脚、迈右脚、注意防守球员。GPT-5.6 则更像梅西。如果你站在场边冲他大喊每一步该怎么做,他只会觉得你是个外行。球员已经升级,教练手册却没有。

OpenAI 的数据究竟说明了什么

我通常会对厂商自己发布的基准测试不以为然,但这些数据足够具体,值得认真看待。

在 OpenAI 内部的编程智能体评测中,采用更精简系统提示词的配置,评测得分提高了约 10–15%,同时总 token 用量减少了 41–66%,成本降低了 33–67%

再读一遍,因为这是少见的两个指标同时朝有利方向变化的情况。更短的提示词得分更高,成本也更低。你不必为了效率牺牲质量。臃肿的提示词在两个维度上都输了。

OpenAI 很谨慎地将这些数据称为“方向性”结果,并建议你在自己的任务上进行验证。很合理。但这个趋势很难反驳,也与我亲自尝试后看到的结果一致。

指南中还藏着第二个不那么明显的发现,它解释了许多人正在遇到的各种异常失败。GPT-5.6 会非常严格地遵守提示词中的约定。面对两条相互冲突的指令,旧模型往往会默默选一条执行并忽略另一条;GPT-5.6 却可能尝试同时满足两条要求,在此过程中消耗更多推理 token,速度变慢,成本也更高。如果一条提示词在某一段要求“详细”,在另一段又要求“简洁”,如今这已经不只是内容重复,而是会主动破坏稳定性。

这也改变了我们看待臃肿提示词的方式。它不只是浪费资源。每多加一条规则,就多了一次与三段之前某条规则发生冲突的机会。

一个真正说服我的前后对比

读到这些内容时,我手头正好有一个真实任务,于是便用它做了测试。

旧写法——也就是过去两年我一直使用的提示词写法:

“首先,列出所有不重复的交易描述。然后,将相似的描述归为一组,并为每组分配一个类别。建立一张描述与类别的查找表。接着,在交易工作表中添加一个‘类别’列,并使用 XLOOKUP 将每笔交易归入正确的类别。确保新增交易后,公式能够自动向下填充。”

这条提示词确实有效,但它也意味着我替模型完成了思考——第一步、第二步、第三步,甚至还特意指定了工具名称。

新写法——先说目标:

“我有一份交易清单,其中的描述并不统一。我希望自动对每笔交易进行分类,而且新增交易后,这套方案仍然能够继续运行。最佳做法是什么?”

目标相同,约束也相同。但第一条提示词是在告诉模型该怎么走,第二条则是在告诉它我要去哪里,然后让它自己寻找路线。

第二条提示词给出的答案更好。更重要的是,它还解释了为什么选择这种方法,而第一条提示词永远不会这么做。当你不再规定具体方法时,有时反而能发现,自己一直坚持的方法还有别的可能。

如何精简提示词,又不丢掉真正重要的内容

精简提示词不等于把它掏空。真正值得保留的,是那些无法从上下文推断出来的内容:目标、约束,以及怎样才算“完成”。其他内容都可以考虑删除。

在实践中,最终留下来的结构通常是这样的:

  1. 你想要的结果。不是步骤,也不是方法,而是任务结束时应该产出什么。
  2. 约束条件。不可逾越的边界——不要虚构功能、不要删除任何内容、只能查看这些文件。
  3. 验收标准。模型在交付结果之前,应如何检查自己的工作。

通常有这些就够了。不需要人物设定,不需要“逐步思考”,也不需要提醒模型不要偷懒。这些内容曾经是为能力较弱的模型搭建的脚手架。GPT-5.6 不需要它们,而把它们写出来还会消耗 token。

OpenAI 给出的精简清单值得贴在显示器旁边:重复陈述同一条规则、不会改变行为的风格指令、不会改变行为的示例,以及针对模型已经能够稳定完成之事给出的流程指令。需要保留的内容很少:用户可见的结果、成功标准、停止条件,以及安全或证据方面的约束。

如果你要精简的是一条已经有效的提示词,还有一个实用建议:每次只删一项。移除一组指令,重新运行同一套评测,再比较结果。如果一次删掉所有内容,而输出质量下降了,你就无法判断究竟是哪一处删减造成了影响。

这与我为 NSFWAITool 测试工具时采用的原则相同:保持任务不变,只修改一个变量,再观察结果是否真的有所改善。我们的评测方法正是围绕这种区别建立的——服务商声称了什么,以及可重复测试实际证明了什么。

什么时候详细指令仍然值得保留

这里需要谨慎,因为如果盲目套用,“越短越好”本身也会变成一种机械照搬的教条。

OpenAI 的指南仍然建议:当示例和风格说明体现了真实的产品要求,或用于弥补已经测得的差距时,就应当保留。如果输出必须符合特定语气、特定格式或特定法律约束,这些内容就不能删。如果少样本示例是可靠教授某种格式的唯一方法,那就保留。你的目标不是使用最少的 token,而是使用仍能完成任务的最少 token

一旦离开通用聊天机器人领域,就很容易看出这一点为什么重要。AI 陪伴工具可能确实需要角色、语气和记忆背景,而成人视频 AI 生成工具则需要具体的画面和动作约束。如果把两类提示词都压缩成同一个三行公式,那就完全偏离了重点。真正有用的提示词,是在保留特定工具所需信息的前提下,尽可能简短的那一条。

真正的变化在于顺序。过去的本能反应,是把所有内容都提前塞进去——为了以防万一,在开头的提示词中写入每一条指令。新的做法是“先放手,再收紧”。先把任务交给模型,观察它如何处理,只在它确实做不到位的地方补充指令。这比一开始就写一条上千字的提示词更快,也能让你看清,究竟哪些指令真正发挥了作用。

人人都容易混淆的区别:人物设定与执行路径

自从这份指南发布后,我看到一些人走向了另一个极端——以为这意味着人物设定已经没用了。并非如此,混淆这两个概念会导致真正的问题。

人物设定控制的是输出听起来怎样:语气、语体、角色,以及文字呈现出的声音。分步骤指令控制的则是模型如何抵达结果,也就是执行路径。两者是不同的控制手段。

新指南是在告诉你,不要过度规定执行路径。它并没有要求你放弃对表达风格的控制。如果你在撰写面向客户的文案,并希望它符合特定品牌的调性,那仍然应该明确说明——这是产品要求,而不是逐步执行的脚本。风格由你设定,路径由模型选择。

换句话说:把目的地和护栏告诉模型,然后别再指挥它怎么开车。

从更短开始,而不是更长

如果你只准备从这些内容中记住一点,那就记住顺序。先写下你想要的结果和验收标准,然后把字数减半,再减半。如果仍然不放心,就直接发送,看看得到什么结果——如果输出确实有不足,你随时可以把某一行加回来。

这是我不得不通过教训才学会的部分。我加入的大多数指令并没有帮助模型,而是在安抚我自己。如今 GPT-5.6 已经足够强大,这种安慰只会成为横在我与答案之间的噪声。

2023 年的课题是如何编写更长的提示词。2024 年的课题是如何管理上下文窗口。2026 年的课题更简单,也更难:学会适时闭嘴,描述清楚结果,然后让模型去完成它原本就被设计来完成的工作。

常见问题

在 GPT-5.6 上,提示词总是越短越好吗?

不是——标题式结论最容易在这里变成错误建议。在 OpenAI 的内部编程智能体评测样本中,较短的提示词表现更好,但 OpenAI 将这一结果称为方向性的。如果删掉某一行后,你的实际任务表现变差,就把它加回来。

我应该先删什么?

先删掉那些令人尴尬的内容:重复两遍的同一条规则、毫无作用的泛化角色设定、模型已经不再需要的示例,以及提醒它认真思考的话。不要动目标、约束条件和完成标准。

什么时候长提示词仍然合理?

当这些篇幅承载了模型确实需要的信息时——例如固定风格、固定输出结构、专业背景、法律边界,或用于纠正你已经实际观察到的失败的示例。长本身不是问题,不必要才是。

我应该停止使用人物设定吗?

只有当人物设定纯属装饰时才应该停止使用。如果它控制着回答的语气、受众或专业标准,那就是在发挥实际作用。真正应该审视的是预先编排的执行路径,而不是你对输出风格的控制。

同样的建议也适用于 AI 聊天、图像和视频工具吗?

不能直接套用。这些产品理解提示词的方式不同,失败模式也不同。聊天工具可能需要关系和记忆背景;视频工具可能需要精确的动作和镜头约束。应分别测试每套工作流程,而不是到处套用一个万能模板。

如何测试更短的提示词是否真的更好?

使用同一组任务,每次移除一组指令,然后比较质量、失败情况、token 用量、延迟和成本。一次碰巧成功的回答几乎说明不了任何问题。只有当改进在重复测试中依然成立时,这次删减才算通过考验。