בשבוע שעבר מחקתי חצי מההנחיה האהובה עליי והפלט השתפר.
זו לא התנשאות צנועה. זה אני מודה שבזבזתי אסימונים - וכנראה מחמיר את התוצאות שלי - במשך כשנתיים. להנחיה המדוברת היה כל מה שבספר ההפעלה הישן אמר שהנחיה טובה צריכה להיות: תפקיד ("אתה מנתח נתונים בכיר"), בלוק הקשר ארוך, שישה שלבים ממוספרים, שלוש דוגמאות עובדות ופסקת סיום שהזכירה למודל "תחשוב היטב, אל תמהר, ותבדוק שוב את העבודה שלך". זה היה סוג הנחיה שתמצא בכל קורס הנדסה מהיר משנת 2024.
ואז קראתי ההדרכה החדשה של OpenAI עבור GPT-5.6, וזה אמר לי לזרוק את רוב זה.
העצה צרבה כי שילמתי עליה - בזמן, לא רק אסימונים. וככל שישבתי עם זה, זה היה יותר הגיוני.
מדוע העצה "יותר זמן טוב יותר" נשברה לבסוף
במשך שנתיים, הייעוץ ההנדסי המהיר הסטנדרטי הצביע על כיוון אחד: להוסיף עוד. הוסף פרסונה. הוסף הקשר. הוסף שלבים. הוסף דוגמאות. הוסף דחיפה אחרונה כדי שהדגם לא יתעצל. הדגמים היו חלשים מספיק אז שזה באמת עזר - כל הוראה נוספת הייתה פיגום שהדגם לא יכול לבנות לעצמו.
GPT-5.6 הוא לא הדגם הזה.
המסגור של OpenAI עצמו הוא בוטה: דגמים חדשים יותר טובים יותר להסיק את המטרה הבסיסית שלך ואת רמת העבודה שאתה מצפה מהקשר, מבלי שתפרט כל שלב. כשאתה מוסר לדגם הוראות מפורטות שהוא כבר לא צריך, אתה לא עוזר. אתה מוסיף רעש.
אני כל הזמן חוזר לאותה אנלוגיה, כי זו הדרך הברורה ביותר להסביר את השינוי. השיטה הישנה התייחסה לדוגמנית כמו טירון שזקוק לכל תנועה שתכתוב - רגל שמאל, רגל ימין, צפו במגן. GPT-5.6 דומה יותר למסי. תצעק לו הוראות סיבוביות מהצד והוא פשוט חושב שאתה אידיוט. הנגן שודרג. מדריך האימון לא.
מה בעצם אומרים המספרים של OpenAI
בדרך כלל אני מגלגל את עיניי על מדדים שפורסמו על ידי ספקים, אבל אלה ספציפיים מספיק כדי לקחת אותם ברצינות.
בהערכות פנימיות של סוכן קידוד של OpenAI, תצורות עם מערכת רזה יותר מניבות ציוני הערכה משופרים בערך 10–15% תוך חיתוך סך האסימונים על ידי 41–66% ועלות לפי 33–67%.
קרא את זה שוב, כי זה המקרה הנדיר שבו שני דברים זזים לטובתך בבת אחת. הנחיות קצרות יותר קלעו גבוה יותר ועלות פָּחוֹת. אתה לא צריך להחליף איכות בשביל יעילות. ההנחיה הנפוחה הפסידה בשני הצירים.
OpenAI מקפיד לקרוא למספרים האלה "כיווני" ולומר לך לאמת את המשימות שלך. הוֹגֶן. אבל עם הכיוון קשה להתווכח, והוא תואם את מה שראיתי כשניסיתי אותו בפועל.
יש ממצא שני, פחות ברור, קבור במדריך, והוא זה שמסביר הרבה כישלונות מוזרים שאנשים פוגעים בהם. GPT-5.6 ממלא אחר חוזה הנחיה מְאוֹד למהדרין. כאשר דגמים ישנים יותר היו בוחרים בשקט אחת משתי הוראות סותרות ומתעלמים מהשנייה, GPT-5.6 עשוי לנסות לכבד את שתיהן - שורפים אסימוני חשיבה ונעשים איטיים ויקרים יותר בתהליך. הנחיה שאומרת "היה מפורט" בפסקה אחת ו"היה תמציתי" בפיסקה אחרת כבר לא סתם מיותרת. זה מערער באופן פעיל.
זה ממסגר מחדש הנחיה נפוחה. זה לא סתם בזבזני. כל כלל נוסף הוא הזדמנות נוספת לסתור כלל שכתבת שלוש פסקאות קודם לכן.
לפני ואחרי זה שכנע אותי
הייתה לי משימה אמיתית שעמדה מולי כשקראתי את כל זה, אז השתמשתי בה כמבחן.
הדרך הישנה - הדרך שבה כתבתי הנחיות במשך שנתיים:
"תחילה, צור רשימה של כל תיאורי העסקאות הייחודיים. לאחר מכן קבץ תיאורים דומים יחד והקצה לכל קבוצה קטגוריה. בנו טבלת חיפוש של תיאורים וקטגוריות. לאחר מכן הוסף עמודת קטגוריה לגיליון העסקאות והשתמש ב-XLOOKUP כדי להקצות כל עסקה לקטגוריה הנכונה. ודא שהנוסחה מתמלאת אוטומטית כאשר עסקאות חדשות מתווספות."
ההנחיה הזו עובדת. זה גם אני שחושב את המודל בשביל זה - שלב ראשון, שלב שני, שלב שלישי, כששם הכלי נזרק לשם טוב.
הדרך החדשה - תוצאה ראשונה:
"יש לי רשימה של עסקאות עם תיאורים לא עקביים. אני רוצה לסווג כל אחת מהן באופן אוטומטי, והפתרון צריך להמשיך לעבוד כשעסקות חדשות נכנסות. מהי הגישה הטובה ביותר?"
אותה מטרה. אותם אילוצים. אבל ההנחיה הראשונה מספרת לדגם איך ללכת. השני מספר את זה לאן אני מנסה להגיע ונותן לו למצוא את המסלול.
השני נתן לי תשובה טובה יותר - וחשוב מכך, הוא אמר לי מַדוּעַ היא בחרה בגישה הזו, שההנחיה הראשונה לעולם לא הייתה. כשאתה מפסיק להכתיב את השיטה, אתה לפעמים לומד משהו על השיטה שהתעקשת עליה.
איך לכתוב הנחיה רזה יותר מבלי לאבד את מה שחשוב
חיתוך הנחיה זה לא אותו דבר כמו לחתוך אותה. הדברים שמרוויחים אותו הם הדברים שאתה לא יכול להסיק מהקשר: התוצאה, האילוצים ואיך נראה "נעשה". כל השאר מועמדים למחיקה.
הנה הצורה ששורדת, בפועל:
- התוצאה שאתה רוצה. לא השלבים. לא השיטה. מה צריך להתקיים כשזה נגמר.
- האילוצים. הקווים שאי אפשר לחצות - אל תמציא תכונות, אל תמחק שום דבר, תסתכל רק על הקבצים האלה.
- קריטריוני הקבלה. כיצד הדגם בודק את עבודתו לפני שהוא מחזיר אותה.
זה בדרך כלל זה. בלי פרסונה, בלי "תחשוב צעד אחר צעד", בלי תזכורת לא להתעצל. הדברים האלה היו פיגומים לדגם חלש יותר. GPT-5.6 לא צריך אותם, והם עולים אסימונים למדינה.
כדאי להדביק את רשימת החיתוך של OpenAI על המסך שלך: הצהרות חוזרות ונשנות של אותו כלל, הוראות סגנון שאינן משנות התנהגות, דוגמאות שאינן משנות התנהגות והוראות עיבוד לדברים שהדגם כבר עושה בצורה מהימנה. רשימת השמירה קצרה: התוצאה הנראית למשתמש, קריטריוני הצלחה, תנאי עצירה ומגבלות בטיחות או ראיות.
הערה מעשית אחת אם אתה באמת עושה את זה בהנחיה שכבר עובדת: חתוך דבר אחד בכל פעם. הסר קבוצה אחת של הוראות, הרץ שוב את אותה eval, השווה. אם תפשיט הכל בבת אחת והפלט יורד, לא תדע איזו חיתוך היה זה שחשוב.
זה אותו כלל שאני משתמש בו כשבודקים כלים עבור NSFWAITool: שמור על המשימה יציבה, שנה משתנה אחד וראה אם התוצאה אכן משתפרת. שֶׁלָנוּ מתודולוגיית סקירה בנוי סביב ההבחנה הזו בין מה שספק טוען לבין מה שמראה בדיקה שניתנת לחזרה.
כאשר הוראות מפורטות עדיין מרוויחות
אני רוצה להיזהר כאן, כי "קצר יותר עדיף" הופך לסוג של פולחן מטען משלו אם מיישמים את זה בצורה עיוורת.
המדריך של OpenAI עדיין אומר לשמור דוגמאות והדרכה בסגנון כאשר הם מקודדים דרישת מוצר אמיתית או מתקנים פער מדוד. אם הפלט שלך צריך להכות בקול מסוים, בפורמט ספציפי או אילוץ משפטי ספציפי, זה נשאר. אם דוגמה של כמה יריות היא הדרך האמינה היחידה ללמד פורמט, שמור אותה. אתה לא מכוון לפחות אסימונים; אתה מכוון לפחות אסימונים שעדיין עושים את העבודה.
אתה יכול לראות למה זה חשוב ברגע שאתה עוזב צ'אטבוטים למטרות כלליות. א בן לוויה בינה מלאכותית עשוי להזדקק באמת לאופי, טון והקשר זיכרון, בעוד ש- מחולל וידאו בינה מלאכותית צריך מגבלות חזותיות ותנועה קונקרטיות. חיתוך שתי ההנחיות לאותה נוסחה בת שלוש שורות יחמיץ את הנקודה. ההנחיה השימושית היא הקצרה ביותר ששומרת על מה שהכלי המסוים הזה צריך.
השינוי האמיתי הוא רצף. הרפלקס הישן היה להטעין הכל מראש - לשים כל הוראה בהנחיית הפתיחה, ליתר ביטחון. הרפלקס החדש הוא "לשחרר קודם, להדק אחר כך". תנו לדגם את המשימה, צפו כיצד הוא מתמודד איתה, והוסיפו הוראות רק היכן שהיא ממש לא מצליחה. זה מהיר יותר מלכתוב הנחיה בת אלף מילים מלפנים, וזה אומר לך אילו הוראות משכו משקל מלכתחילה.
ההבחנה שכולם טועים: פרסונה מול נתיב
מאז שהמדריך ירד, ראיתי אנשים מתנדנדים יותר מדי לכיוון השני - בהנחה שזה אומר שהפרסונה מתה. זה לא, וחיבור בין שני הרעיונות גורם לטעויות אמיתיות.
פרסונה שולטת איך נשמע הפלט. טון, רישום, תפקיד, הקול בדף. הוראה שלב אחר שלב שולטת איך הדוגמנית מגיעה לשם - נתיב הביצוע. אלו מנופים שונים.
ההנחיה החדשה אומרת לך להפסיק לפרט יותר מדי את הנתיב. זה לא אומר כלום על ויתור על השליטה בקול. אם אתה כותב עותק מול לקוחות ואתה רוצה שזה יישמע כמו מותג ספציפי, אתה עדיין אומר זאת - זו דרישת מוצר, לא תסריט שלב אחר שלב. הסגנון הוא שלך להגדיר. הדרך היא של הדגם לבחור.
במילים אחרות: תנו לדגם את היעד ואת מעקות הבטיחות, ואז תפסיקו להגיד לו איך לנהוג.
התחל קצר יותר, לא יותר
אם אתה לוקח דבר אחד מכל זה, הפוך אותו לרצף. כתוב תחילה את התוצאה הרצויה ואת קריטריוני הקבלה שלך. ואז חתוך את ספירת המילים בחצי. ואז לחתוך אותו שוב לשניים. אם אתה עדיין עצבני, שלח את זה ותראה מה חוזר - אתה תמיד יכול להוסיף שורה חזרה למקום שבו הפלט למעשה נופל.
זה החלק שהייתי צריך ללמוד בדרך הקשה. רוב ההוראות שהוספתי לא עזרו לדגם. הם היו מרגיעים לִי. ו-GPT-5.6 מספיק טוב עכשיו כשהביטחון שלי הוא רק רעש ביני לבין התשובה.
השיעור של 2023 היה איך לכתוב הנחיות ארוכות יותר. השיעור של 2024 היה כיצד לנהל את חלון ההקשר. השיעור של 2026 פשוט יותר וקשה יותר: למד לשתוק, לתאר את התוצאה ולתת למודל לעשות את העבודה שהוא נבנה עבורו.
שאלות נפוצות
האם הנחיות קצרות יותר תמיד טובות יותר ב-GPT-5.6?
לא — וכאן הכותרת יכולה להפוך לעצה גרועה. הנחיות קצרות יותר זכו במדגם של OpenAI של evals פנימי של סוכן קידוד, אבל OpenAI קורא לתוצאה כיוונית. אם הסרת קו מחמירה את המשימה האמיתית שלך, החזר את הקו בחזרה.
מה עלי לחתוך קודם?
התחל עם הדברים המביכים: אותו כלל נאמר פעמיים, תפקידים גנריים שלא משנים דבר, דוגמאות שהמודל כבר לא צריך ותזכורות לחשוב היטב. השאר לבד את התוצאה, האילוצים וההגדרה של בוצע.
מתי הנחיה ארוכה עדיין מוצדקת?
כאשר האורך נושא מידע שהמודל באמת זקוק לו - סגנון בית, סכימת פלט קבועה, הקשר מומחה, גבולות משפטיים או דוגמאות שמתקנות כשל שצפית בו בפועל. ארוך זו לא הבעיה. מיותר הוא.
האם עלי להפסיק להשתמש בפרסונות?
רק אם הפרסונה היא דקורטיבית. אם הוא שולט בקול, בקהל או בסטנדרט המקצועי של התשובה, הוא עושה עבודה אמיתית. הדבר שיש לשאול הוא הנתיב התסריטאי, לא השליטה שלך באישיות הפלט.
האם אותה עצה חלה על כלי צ'אט, תמונה ווידאו בינה מלאכותית?
לא אוטומטית. מוצרים אלה קוראים הנחיות בצורה שונה ונכשלים בדרכים שונות. כלי צ'אט עשוי להזדקק להקשר הקשר והזיכרון; כלי וידאו עשוי להזדקק לאילוצי פעולה מדויקים ולמצלמה. בדוק כל זרימת עבודה במקום להעביר תבנית אוניברסלית אחת.
איך אני בודק אם הנחיה קצרה יותר באמת טובה יותר?
השתמש באותה סט של משימות, הסר קבוצת הוראות אחת והשווה איכות, כשלים, שימוש באסימונים, זמן אחזור ועלות. תשובה אחת ברת מזל לא מוכיחה כמעט כלום. ההנחיה מרוויחה את הקיצוץ כאשר השיפור שורד חזרה.