Volver HexScope Lens

Cuando le pides a la IA que "razone", ¿de verdad razona?

POINT Puntos clave
  • En un examen de mates controlado, la IA dejó ver pasos de razonamiento ocultos
  • Aprender de los errores corregidos sube la precisión más que ver solo aciertos

“Vale, la IA me responde… pero ¿hasta dónde la dejo decidir?”

Ya es lo normal: le pides a la IA que te prepare una nota de análisis o un borrador de campaña.

Si es un resumen, lo sueltas tranquilo. Pero en cuanto entra el razonamiento, la confianza se tambalea.

A Hex-ko le pasa a menudo. “¿Esta conclusión la ha pensado de verdad, o solo está bien escrita?” Seguro que te suena.

Pues hay un estudio que entra justo por ahí: las Part 2.1 y Part 2.2 de Physics of Language Models.

Tian Ye, Zeyuan Allen-Zhu y su equipo en Microsoft Research siguieron el rastro del razonamiento haciendo que el modelo resolviera problemas de matemáticas.

¿Y por qué mates? Porque la respuesta es única y el camino hasta ella se puede verificar paso a paso.

En el examen de mates, la IA calculaba “de cabeza”

El equipo usó datos sintéticos: problemas de mates fabricados a medida, con todas las condiciones controladas.

Frente al lenguaje natural, este diseño tiene menos variables sueltas. Sirve para medir la capacidad de razonar de forma directa.

Es la misma idea del primer artículo de la serie: montar un examen “imposible de copiar”. Y esto es lo que salió: el modelo estaba dando pasos de razonamiento ocultos por dentro.

Aunque fuera una suma sencilla, sin escribir las operaciones intermedias en la respuesta, por dentro construía el flujo del cálculo.

Es un comportamiento difícil de explicar solo con memorización. Sirve de contraargumento al típico “la IA no hace más que copiar y pegar”: al menos en mates, se observó procesamiento de tipo razonado.

Aprender del fallo pudo más que aprender solo del acierto

La Part 2.2 trae lo más jugoso: los datos de entrenamiento que incluían errores funcionaron mejor.

Mostrarle solo respuestas correctas rendía menos que darle datos con el fallo y su corrección. Esto último empujó hacia arriba la precisión del razonamiento.

Y con la misma cantidad de datos. Por eso la pista es clara: pesa más la calidad de lo que aprende que el volumen.

¿Te suena de algo? En el aprendizaje humano, repasar el error es lo que de verdad cala. Ver una estructura parecida en la IA es un buen argumento para quien trabaja con ella.

Que razone no significa que puedas creértelo a pies juntillas

El resultado es esperanzador, pero el matiz también es claro. Aunque haya razonamiento interno, ese proceso no siempre asoma en la respuesta.

Es decir: usar una respuesta “que parece correcta” tal cual para tomar una decisión es arriesgado. Y aquí entra en juego el : las reglas con las que compruebas una respuesta antes de meterla en producción.

Conclusión: decide a la vez qué le delegas y cómo lo verificas

Lo que deja este estudio es un equilibrio. Que la IA haga algo parecido a razonar no significa que puedas dejarle el volante en una decisión importante.

Sobre todo cuando hay números, comparaciones o ramas de condiciones. El razonamiento intermedio puede pintar bien y, aun así, fallar justo en la respuesta final.

Por eso, si vas a usar tareas de razonamiento, fija de antemano dos cosas juntas: hasta dónde delegas y cómo lo verificas.

En la práctica, esto se traduce en reglas sencillas:

  • Si la respuesta lleva números, recalcúlalos.
  • Si la respuesta necesita fundamento, cotéjala con su fuente.
  • Al evaluar un modelo, no mires solo el porcentaje de aciertos, sino también cómo se recupera de sus errores.

Con eso ya das un paso más allá del “parece listo, lo adoptamos”.


Fuentes

  • Tian Ye, Zicheng Xu, Yuanzhi Li, Zeyuan Allen-Zhu, “Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process”, arXiv:2407.20311, 2024. Enlace al paper
  • Tian Ye, Zicheng Xu, Yuanzhi Li, Zeyuan Allen-Zhu, “Physics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math Problems”, arXiv:2408.16293, 2024. Enlace al paper
  • Physics of Language Models (sitio de la serie): physics.allen-zhu.com

Artículo relacionado

Comparte este artículo
Bluesky X
Volver a los artículos