Empiezas a usar IA en el trabajo y aparece siempre el mismo miedo. «Si lo pregunto un poco mal, la respuesta sale fatal.» «Más nos vale memorizar la plantilla correcta.»
Lo entiendo. A todos nos tienta repartir un recetario de prompts y unificar a toda la empresa con él.
Pero aquí quiero parar un momento. Antes de cargar el coste operativo —plantillas, formación, la policía del prompt—, ¿alguien ha comprobado de verdad cuánto baila la respuesta?
Porque «tiene que bailar mucho» es una suposición, no una medida.
Vamos a mirar dos estudios. Uno pone número a lo sensible que es el modelo. El otro pregunta si esa sensibilidad existe o se la inventa nuestra forma de medir.
«Si lo pregunto un poco mal, ¿se estropea todo?»
Primero, la pregunta obvia: cuando reformulas un prompt, ¿cuánto cambia la respuesta? No «si cambia algo» —algo cambia siempre—, sino cuánto.
El equipo de Errica lo midió en serio (Errica et al., NAACL 2025). Plantearon dos métricas para fijarlo:
- Sensibilidad: cuánto cambia la predicción al reformular el prompt.
- Consistencia: cómo de estables se mantienen las predicciones entre reformulaciones de las mismas entradas.
Reformular aquí es básicamente parafrasear: el mismo sentido, otras palabras. Dilo de dos maneras distintas y mira si el modelo se inmuta.
¿Y el resultado? En varias tareas de clasificación, la precisión se movió un 3,2 a 10%. No es cero. Pero está lejísimos de «una palabra mal y se derrumba todo». Mucha gente trata su prompt como un artificiero trata el cable rojo… y resulta que el cable casi nunca explota.
Y hay un hallazgo más útil escondido ahí. Lo que movía la aguja no era el orden superficial de las palabras: era el significado de fondo. Así que lo que conviene afinar no es la frase mágica. Es dejar claro qué quieres que decida el modelo.
A lo mejor la IA no es inestable: lo que está torcido es la regla
Ahora la pregunta más afilada, de un estudio de Hua y compañía (Hua et al., EMNLP 2025). Se preguntan: ¿la alta sensibilidad es un defecto del modelo, o un espejismo que fabrica el método de evaluación? Lo comprueban en siete grandes LLM (los modelos de lenguaje detrás de ChatGPT), con seis benchmarks y doce plantillas.
Pusieron a prueba dos métodos clásicos de puntuación:
- Puntuación por verosimilitud (corregir por la probabilidad que el modelo asigna a cada respuesta, no por la que de verdad da).
- Coincidencia exacta de texto (la respuesta solo cuenta si coincide con la clave carácter a carácter).
Pues bien: los dos marcan como fallo respuestas que significan lo mismo, y eso hace que el modelo parezca mucho más nervioso de lo que es. En cambio, con LLM-as-Judge (un modelo capaz que decide si dos respuestas quieren decir lo mismo), la varianza del rendimiento bajó y la consistencia de los rankings subió.
O sea, una parte de «la IA es inestable» nunca fue la IA. Era la regla. Y si la regla está torcida, todas las medidas salen mal en la misma dirección: tranquilizadora o alarmante, pero falsa.
Conclusión: revisa cómo corriges antes de buscar la frase mágica
Que el prompt cambia el resultado es verdad. Pero pasarte la vida buscando el conjuro que gana no es donde está la palanca. Lo que muestran estos dos estudios es que buena parte de «el problema es el prompt» era en realidad la tosquedad de la corrección y el reflejo de la coincidencia exacta inflándolo todo.
Así que lo primero que conviene auditar en tu montaje no es la redacción: es cómo estás puntuando las respuestas. ¿Das por mala una respuesta por no coincidir letra a letra, cuando el sentido estaba bien? ¿Tiras respuestas correctas porque no daban con la cadena esperada? Arregla eso y buena parte del baile aparente se calma sola.
A partir de ahí, tu política interna de prompts puede ser mínima: di el objetivo, las restricciones y el formato de salida, y para. Igual me equivoco en el reparto exacto, pero en este orden el miedo a «si pregunto mal, se arruina todo» te suelta sin que te des cuenta.
Fuentes
- Errica, F., Siracusano, G., Sanvito, D., & Bifulco, R., “What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
- Hua, A., Tang, K., Gu, C., Gu, J., Wong, E., & Qin, Y., “Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs”, EMNLP 2025, arXiv:2509.01790