La semana pasada eliminé la mitad de mi prompt favorito y el resultado mejoró.
Eso no es una fanfarronada humilde. Soy yo admitiendo que he estado desperdiciando tokens (y probablemente empeorando mis resultados) durante aproximadamente dos años. El prompt en cuestión tenía todo lo que el antiguo manual decía que debería tener un buen prompt: un rol ("eres un analista de datos senior"), un bloque de contexto largo, seis pasos numerados, tres ejemplos resueltos y un párrafo final que le recordaba al modelo que "piense con cuidado, no se apresure y vuelva a verificar su trabajo". Era el tipo de prompt que encontrarías en cualquier curso de ingeniería rápido a partir de 2024.
entonces leí Nueva guía de OpenAI para GPT-5.6, y me dijo que tirara la mayor parte de eso.
El consejo me dolió porque había pagado por ello, a tiempo, no sólo con tokens. Y cuanto más lo pensaba, más sentido tenía.
Por qué finalmente se rompió el consejo de "cuanto más tiempo, mejor"
Durante dos años, el rápido consejo de ingeniería estándar apuntaba en una dirección: agregar más. Agrega una persona. Añade contexto. Añade pasos. Añade ejemplos. Añade un empujón final para que el modelo no se vuelva perezoso. Los modelos eran lo suficientemente débiles en aquel entonces como para que esto realmente ayudara: cada instrucción adicional era un andamiaje que el modelo no podía construir por sí mismo.
GPT-5.6 no es ese modelo.
El propio marco de OpenAI es contundente: Los modelos más nuevos son mejores para inferir su objetivo subyacente y el nivel de trabajo que espera del contexto, sin que tengas que explicar cada paso. Cuando le das a un modelo instrucciones paso a paso que ya no necesita, no estás ayudando. Estás añadiendo ruido.
Sigo volviendo a la misma analogía, porque es la forma más clara de explicar el cambio. La antigua usanza trataba al modelo como a un novato que necesita que cada movimiento esté escrito: pie izquierdo, pie derecho, observe al defensor. GPT-5.6 se parece más a Messi. Grítale instrucciones paso a paso desde la barrera y él simplemente pensará que eres un idiota. El jugador actualizó. El manual de entrenamiento no lo hizo.
Lo que realmente dicen los números de OpenAI
Por lo general, pongo los ojos en blanco ante los puntos de referencia publicados por los proveedores, pero son lo suficientemente específicos como para tomarlos en serio.
En las evaluaciones internas del agente de codificación de OpenAI, las configuraciones con un sistema más eficiente generan puntuaciones de evaluación mejoradas en aproximadamente 10–15% mientras se reduce el total de tokens en 41–66% y costo por 33–67%.
Léelo de nuevo, porque es raro que dos cosas se muevan a tu favor a la vez. Indicaciones más cortas puntuadas más alto y costo menos. No es necesario cambiar la calidad por la eficiencia. El inflado indicador perdía en ambos ejes.
OpenAI tiene cuidado de llamar a estos números "direccionales" y decirle que los valide en sus propias tareas. Justo. Pero es difícil discutir la dirección y coincide con lo que vi cuando lo probé.
Hay un segundo hallazgo, menos obvio, escondido en la guía, y es el que explica muchos de los fallos extraños a los que se enfrenta la gente. GPT-5.6 sigue el contrato de un aviso muy estrictamente. Mientras que los modelos más antiguos elegirían silenciosamente una de dos instrucciones conflictivas e ignorarían la otra, GPT-5.6 puede intentar respetar ambas: quemar tokens de razonamiento y volverse más lento y costoso en el proceso. Un prompt que dice "sea detallado" en un párrafo y "sea conciso" en otro ya no es simplemente redundante. Es activamente desestabilizador.
Eso reformula un prompt inflado. No es simplemente un desperdicio. Cada regla adicional es otra oportunidad de contradecir una regla que escribiste tres párrafos antes.
Un antes y un después que me convenció
Tenía una tarea real frente a mí cuando leí todo esto, así que la usé como prueba.
la vieja manera - la forma en que había estado escribiendo indicaciones durante dos años:
"Primero, cree una lista de todas las descripciones de transacciones únicas. Luego, agrupe descripciones similares y asigne a cada grupo una categoría. Cree una tabla de búsqueda de descripciones y categorías. Luego agregue una columna Categoría a la hoja de transacciones y use BUSCAR XL para asignar cada transacción a la categoría correcta. Asegúrese de que la fórmula se complete automáticamente cuando se agreguen nuevas transacciones".
Ese prompt funciona. También soy yo quien piensa en el modelo: paso uno, paso dos, paso tres, con el nombre de la herramienta incluido por si acaso.
la nueva manera - resultado primero:
"Tengo una lista de transacciones con descripciones inconsistentes. Quiero categorizar cada uno automáticamente y la solución debe seguir funcionando a medida que llegan nuevas transacciones. ¿Cuál es el mejor enfoque? "
Mismo objetivo. Mismas limitaciones. Pero el primer prompt le dice al modelo como caminar. El segundo lo dice donde estoy tratando de llegar y le permite encontrar la ruta.
El segundo me dio una mejor respuesta y, lo que es más importante, me dijo por qué eligió ese enfoque, que el primer prompt nunca habría adoptado. Cuando dejas de dictar el método, a veces aprendes algo sobre el método en el que habías estado insistiendo.
Cómo escribir un prompt más sencillo sin perder lo que importa
Cortar un prompt no es lo mismo que destriparlo. Las cosas que se ganan la vida son las que no se pueden inferir del contexto: el resultado, las limitaciones y cómo se ve "hecho". Todo lo demás es candidato a ser eliminado.
Esta es la forma que sobrevive, en la práctica:
- El resultado que deseas. No los pasos. No el método. Lo que debería existir cuando esto termine.
- Las limitaciones. Las líneas que no se pueden cruzar: no inventes funciones, no elimines nada, sólo mira estos archivos.
- Los criterios de aceptación. Cómo el modelo comprueba su propio trabajo antes de devolvérselo.
Normalmente eso es todo. Sin personalidad, sin "pensar paso a paso", sin recordatorio de no ser perezoso. Esas cosas fueron el andamiaje para un modelo más débil. GPT-5.6 no los necesita y su estado cuesta tokens.
Vale la pena pegar la lista de ajustes de OpenAI en su monitor: declaraciones repetidas de la misma regla, instrucciones de estilo que no cambian el comportamiento, ejemplos que no cambian el comportamiento e instrucciones de proceso para cosas que el modelo ya hace de manera confiable. La lista de conservación es breve: el resultado visible para el usuario, los criterios de éxito, las condiciones de parada y las limitaciones de seguridad o evidencia.
Una nota práctica si realmente estás haciendo esto en un prompt que ya funciona: cortar una cosa a la vez. Elimine un grupo de instrucciones, vuelva a ejecutar la misma evaluación y compare. Si quita todo de una vez y el resultado se degrada, no sabrá qué corte era el que importaba.
Es la misma regla que uso cuando pruebo herramientas para NSFWAITool: mantén la tarea estable, cambie una variable y vea si el resultado realmente mejora. Nuestro metodología de revisión se construye en torno a esa distinción entre lo que afirma un proveedor y lo que muestra una prueba repetible.
Cuando las instrucciones detalladas aún se ganan el sustento
Quiero tener cuidado aquí, porque "cuanto más corto, mejor" se convierte en una especie de culto al cargo si se aplica a ciegas.
La guía de OpenAI todavía dice que se deben conservar ejemplos y pautas de estilo cuando codifican un requisito de producto real o corrigen una brecha medida. Si su producción tiene que alcanzar una voz específica, un formato específico o una restricción legal específica, eso permanece. Si un ejemplo de algunas tomas es la única forma confiable de enseñar un formato, consérvelo. No estás apuntando a la menor cantidad de tokens; estás apuntando a la menor cantidad de tokens que todavía hace el trabajo.
Podrás ver por qué esto es importante una vez que dejes los chatbots de uso general. Un Compañero de IA puede necesitar genuinamente carácter, tono y contexto de memoria, mientras que un Generador de video IA necesita limitaciones visuales y de movimiento concretas. Cortar ambas indicaciones a la misma fórmula de tres líneas sería perder el sentido. El prompt útil es el más corto que conserva lo que necesita esa herramienta en particular.
El verdadero cambio es la secuenciación. El viejo reflejo era adelantar todo: poner todas las instrucciones en el prompt inicial, por si acaso. El nuevo reflejo es "soltar primero, apretar después". Asigne la tarea al modelo, observe cómo la maneja y solo agregue instrucciones cuando realmente se quede corto. Es más rápido que escribir un prompt de mil palabras por adelantado y le indica qué instrucciones tuvieron peso en primer lugar.
La distinción que todos hacen mal: persona vs.camino
Desde que cayó la guía, he visto a personas girar demasiado hacia el otro lado, suponiendo que esto signifique que la persona está muerta. No lo es, y combinar las dos ideas provoca verdaderos errores.
Una persona controla cómo suena la salida. Tono, registro, rol, la voz en la página. Una instrucción paso a paso controla cómo llega el modelo allí - la ruta de ejecución. Esas son palancas diferentes.
La nueva guía le indica que deje de especificar demasiado la ruta. No dice nada sobre ceder el control de la voz. Si estás escribiendo un texto dirigido al cliente y quieres que suene como una marca específica, igual lo dices; ese es un requisito del producto, no un guión paso a paso. El estilo lo estableces tú. El camino lo elige el modelo.
Dicho de otra manera: Dale al modelo el destino y las barandillas, luego deja de decirle cómo conducir.
Empiece más corto, no más largo
Si tomas una cosa de todo esto, conviértela en la secuencia. Escribe primero el resultado que desea y sus criterios de aceptación. Luego reduzca el número de palabras a la mitad. Luego córtalo nuevamente por la mitad. Si todavía está nervioso, envíelo y vea qué regresa; siempre puede agregar una línea donde el resultado realmente se queda corto.
Esa es la parte que tuve que aprender de la manera más difícil. La mayoría de las instrucciones que estaba agregando no ayudaban al modelo.ellos fueron tranquilizadores a mí. Y GPT-5.6 es lo suficientemente bueno ahora que mi tranquilidad es solo ruido entre la respuesta y yo.
La lección de 2023 fue cómo escribir indicaciones más largas. La lección de 2024 fue cómo gestionar la ventana de contexto. La lección de 2026 es más simple y más difícil: aprenda a callarse, describir el resultado y dejar que el modelo haga el trabajo para el que fue creado.
Preguntas frecuentes
¿Las indicaciones más cortas son siempre mejores en GPT-5.6?
No, y aquí es donde el titular puede convertirse en un mal consejo. Las indicaciones más cortas ganaron en la muestra de OpenAI de evaluaciones internas de agentes de codificación, pero OpenAI llama al resultado direccional. Si eliminar una línea empeora su verdadera tarea, vuelva a colocar la línea.
¿Qué debo cortar primero?
Comience con las cosas vergonzosas: la misma regla establecida dos veces, roles genéricos que no cambian nada, ejemplos que el modelo ya no necesita y recordatorios para pensar detenidamente. Deje el resultado, las restricciones y la definición de hecho en paz.
¿Cuándo todavía está justificado un aviso largo?
Cuando la longitud contiene información que el modelo realmente necesita: un estilo interno, un esquema de salida fijo, contexto especializado, límites legales o ejemplos que corrigen una falla que realmente hayas observado. El tiempo no es el problema. Innecesario es.
¿Debería dejar de usar personas?
Sólo si la persona es decorativa. Si controla la voz, la audiencia o el nivel profesional de la respuesta, está haciendo un trabajo real. Lo que hay que cuestionar es la ruta escrita, no su control sobre la personalidad del resultado.
¿Se aplica el mismo consejo a las herramientas de chat, imágenes y video con IA?
No automáticamente. Esos productos leen las indicaciones de manera diferente y fallan de diferentes maneras. Una herramienta de chat puede necesitar un contexto de relación y memoria; una herramienta de video puede necesitar acciones precisas y limitaciones de cámara. Pruebe cada flujo de trabajo en lugar de trasladar una plantilla universal.
¿Cómo pruebo si un prompt más corto es realmente mejor?
Usa el mismo conjunto de tareas, elimine un grupo de instrucciones y compare la calidad, las fallas, el uso de tokens, la latencia y el costo. Una respuesta afortunada no prueba casi nada. La sugerencia gana el corte cuando la mejora sobrevive a la repetición.