上周,我刪掉了自己最常用的一條提示詞的一半內容,結果輸出反而變好了。
這不是故作謙虛的炫耀,而是承認過去大約兩年里,我一直在浪費 token,而且很可能還讓結果變得更差。那條提示詞具備舊方法所要求的一切:一個角色設定(“你是一名資深資料分析師”)、一大段背景資訊、六個編號步驟、三個完整示例,以及最后一段提醒模型“認真思考,不要著急,並仔細檢查結果”的話。你可以在 2024 年的任何提示詞工程課程里看到這類提示詞。
后來,我讀到了 OpenAI 針對 GPT-5.6 發布的新指南,它告訴我,這些內容大多都應該刪掉。
這條建議讓我有些難受,因為我確實為那些內容付出過成本——不只是 token,還有時間。但思考得越久,我越覺得它有道理。
為什麼“越長越好”的建議終于失效了
過去兩年,提示詞工程的主流建議始終指向同一個方向:繼續加內容。加入人物設定,加入背景,加入步驟,加入示例,最后再提醒一句,免得模型偷懶。當時的模型能力還不夠強,這麼做確實有幫助——每增加一條指令,都是在為模型搭建它自己還搭不起來的腳手架。
GPT-5.6 已經不是那樣的模型了。
OpenAI 自己的說法很直接:新模型更善于從上下文推斷你的真實目標,以及你所期待的工作標準,不再需要你逐一寫明每個步驟。如果你仍然向模型提供它已經不需要的逐步指令,那並不是在幫忙,而是在增加噪聲。
我總會想到同一個比喻,因為它最能清楚地說明這種變化。舊方法把模型當成一個每個動作都需要安排好的新手——邁左腳、邁右腳、注意防守球員。GPT-5.6 則更像梅西。如果你站在場邊沖他大喊每一步該怎麼做,他只會覺得你是個外行。球員已經升級,教練手冊卻沒有。
OpenAI 的資料究竟說明了什麼
我通常會對廠商自己發布的基準測試不以為然,但這些資料足夠具體,值得認真看待。
在 OpenAI 內部的編程AI 代理評測中,采用更精簡系統提示詞的配置,評測得分提高了約 10–15%,同時總 token 用量減少了 41–66%,成本降低了 33–67%。
再讀一遍,因為這是少見的兩個指標同時朝有利方向變化的情況。更短的提示詞得分更高,成本也更低。你不必為了效率犧牲品質。臃腫的提示詞在兩個維度上都輸了。
OpenAI 很謹慎地將這些資料稱為“方向性”結果,並建議你在自己的任務上進行驗證。很合理。但這個趨勢很難反駁,也與我親自嘗試后看到的結果一致。
指南中還藏著第二個不那么明顯的發現,它解釋了許多人正在遇到的各種異常失敗。GPT-5.6 會非常嚴格地遵守提示詞中的約定。面對兩條相互沖突的指令,舊模型往往會默默選一條執行並忽略另一條;GPT-5.6 卻可能嘗試同時滿足兩條要求,在此過程中消耗更多推理 token,速度變慢,成本也更高。如果一條提示詞在某一段要求“詳細”,在另一段又要求“簡潔”,如今這已經不只是內容重復,而是會主動破壞穩定性。
這也改變了我們看待臃腫提示詞的方式。它不只是浪費資源。每多加一條規則,就多了一次與三段之前某條規則發生沖突的機會。
一個真正說服我的前后對比
讀到這些內容時,我手頭正好有一個真實任務,于是便用它做了測試。
舊寫法——也就是過去兩年我一直使用的提示詞寫法:
“首先,列出所有不重復的交易描述。然后,將相似的描述歸為一組,並為每組分配一個類別。建立一張描述與類別的查找表。接著,在交易工作表中添加一個‘類別’列,並使用 XLOOKUP 將每筆交易歸入正確的類別。確保新增交易后,公式能夠自動向下填充。”
這條提示詞確實有效,但它也意味著我替模型完成了思考——第一步、第二步、第三步,甚至還特意指定了工具名稱。
新寫法——先說目標:
“我有一份交易清單,其中的描述並不統一。我希望自動對每筆交易進行分類,而且新增交易后,這套方案仍然能夠繼續運行。最佳做法是什麼?”
目標相同,約束也相同。但第一條提示詞是在告訴模型該怎麼走,第二條則是在告訴它我要去哪里,然后讓它自己尋找路線。
第二條提示詞給出的答案更好。更重要的是,它還解釋了為什麼選擇這種方法,而第一條提示詞永遠不會這麼做。當你不再規定具體方法時,有時反而能發現,自己一直堅持的方法還有別的可能。
如何精簡提示詞,又不丟掉真正重要的內容
精簡提示詞不等于把它掏空。真正值得保留的,是那些無法從上下文推斷出來的內容:目標、約束,以及怎樣才算“完成”。其他內容都可以考慮刪除。
在實踐中,最終留下來的結構通常是這樣的:
- 你想要的結果。不是步驟,也不是方法,而是任務結束時應該產出什麼。
- 約束條件。不可逾越的邊界——不要虛構功能、不要刪除任何內容、只能查看這些檔案。
- 驗收標準。模型在交付結果之前,應如何檢查自己的工作。
通常有這些就夠了。不需要人物設定,不需要“逐步思考”,也不需要提醒模型不要偷懶。這些內容曾經是為能力較弱的模型搭建的腳手架。GPT-5.6 不需要它們,而把它們寫出來還會消耗 token。
OpenAI 給出的精簡清單值得貼在顯示器旁邊:重復陳述同一條規則、不會改變行為的風格指令、不會改變行為的示例,以及針對模型已經能夠穩定完成之事給出的流程指令。需要保留的內容很少:使用者可見的結果、成功標準、停止條件,以及安全或證據方面的約束。
如果你要精簡的是一條已經有效的提示詞,還有一個實用建議:每次只刪一項。移除一組指令,重新運行同一套評測,再比較結果。如果一次刪掉所有內容,而輸出品質下降了,你就無法判斷究竟是哪一處刪減造成了影響。
這與我為 NSFWAITool 測試工具時采用的原則相同:保持任務不變,只修改一個變量,再觀察結果是否真的有所改善。我們的評測方法正是圍繞這種區別建立的——服務商聲稱了什麼,以及可重復測試實際證明了什麼。
什麼時候詳細指令仍然值得保留
這里需要謹慎,因為如果盲目套用,“越短越好”本身也會變成一種機械照搬的教條。
OpenAI 的指南仍然建議:當示例和風格說明體現了真實的產品要求,或用於彌補已經測得的差距時,就應當保留。如果輸出必須符合特定語氣、特定格式或特定法律約束,這些內容就不能刪。如果少樣本示例是可靠教授某種格式的唯一方法,那就保留。你的目標不是使用最少的 token,而是使用仍能完成任務的最少 token。
一旦離開通用聊天機器人領域,就很容易看出這一點為什麼重要。AI 陪伴工具可能確實需要角色、語氣和記憶背景,而成人影片 AI 生成工具則需要具體的畫面和動作約束。如果把兩類提示詞都壓縮成同一個三行公式,那就完全偏離了重點。真正有用的提示詞,是在保留特定工具所需資訊的前提下,盡可能簡短的那一條。
真正的變化在于順序。過去的本能反應,是把所有內容都提前塞進去——為了以防萬一,在開頭的提示詞中寫入每一條指令。新的做法是“先放手,再收緊”。先把任務交給模型,觀察它如何處理,只在它確實做不到位的地方補充指令。這比一開始就寫一條上千字的提示詞更快,也能讓你看清,究竟哪些指令真正發揮了作用。
人人都容易混淆的區別:人物設定與執行路徑
自從這份指南發布后,我看到一些人走向了另一個極端——以為這意味著人物設定已經沒用了。並非如此,混淆這兩個概念會導致真正的問題。
人物設定控制的是輸出聽起來怎樣:語氣、語體、角色,以及文字呈現出的聲音。分步驟指令控制的則是模型如何抵達結果,也就是執行路徑。兩者是不同的控制手段。
新指南是在告訴你,不要過度規定執行路徑。它並沒有要求你放棄對表達風格的控制。如果你在撰寫面向客戶的文案,並希望它符合特定品牌的調性,那仍然應該明確說明——這是產品要求,而不是逐步執行的腳本。風格由你設定,路徑由模型選擇。
換句話說:把目的地和護欄告訴模型,然后別再指揮它怎麼開車。
從更短開始,而不是更長
如果你只準備從這些內容中記住一點,那就記住順序。先寫下你想要的結果和驗收標準,然后把字數減半,再減半。如果仍然不放心,就直接發送,看看得到什麼結果——如果輸出確實有不足,你隨時可以把某一行加回來。
這是我不得不通過教訓才學會的部分。我加入的大多數指令並沒有幫助模型,而是在安撫我自己。如今 GPT-5.6 已經足夠強大,這種安慰只會成為橫在我與答案之間的噪聲。
2023 年的課題是如何編寫更長的提示詞。2024 年的課題是如何管理上下文窗口。2026 年的課題更簡單,也更難:學會適時閉嘴,描述清楚結果,然后讓模型去完成它原本就被設計來完成的工作。
常見問題
在 GPT-5.6 上,提示詞總是越短越好嗎?
不是——標題式結論最容易在這里變成錯誤建議。在 OpenAI 的內部編程AI 代理評測樣本中,較短的提示詞表現更好,但 OpenAI 將這一結果稱為方向性的。如果刪掉某一行后,你的實際任務表現變差,就把它加回來。
我應該先刪什麼?
先刪掉那些令人尷尬的內容:重復兩遍的同一條規則、毫無作用的泛化角色設定、模型已經不再需要的示例,以及提醒它認真思考的話。不要動目標、約束條件和完成標準。
什麼時候長提示詞仍然合理?
當這些篇幅承載了模型確實需要的資訊時——例如固定風格、固定輸出結構、專業背景、法律邊界,或用於糾正你已經實際觀察到的失敗的示例。長本身不是問題,不必要才是。
我應該停止使用人物設定嗎?
只有當人物設定純屬裝飾時才應該停止使用。如果它控制著回答的語氣、受眾或專業標準,那就是在發揮實際作用。真正應該審視的是預先編排的執行路徑,而不是你對輸出風格的控制。
同樣的建議也適用於 AI 聊天、影像和影片工具嗎?
不能直接套用。這些產品理解提示詞的方式不同,失敗模式也不同。聊天工具可能需要關系和記憶背景;影片工具可能需要精確的動作和鏡頭約束。應分別測試每套工作流程程,而不是到處套用一個萬能模板。
如何測試更短的提示詞是否真的更好?
使用同一組任務,每次移除一組指令,然后比較品質、失敗情況、token 用量、延遲和成本。一次碰巧成功的回答幾乎說明不了任何問題。只有當改進在重復測試中依然成立時,這次刪減才算通過考驗。