Volver HexScope Lens

¿Y si dentro de Claude hubiera un mando del puente Golden Gate?

POINT Puntos clave
  • De Claude 3 Sonnet salieron unos 34 millones de características
  • Lo que la IA cuenta de ti también arrastra sesgos aprendidos

Le preguntas algo a una IA y te devuelve una respuesta que suena bien. Hasta ahí, perfecto.

Pero intenta explicar por qué ha salido esa respuesta y no otra. Ahí se te nubla todo, ¿a que sí?

A esa niebla la llamamos «caja negra», y con eso solemos darnos por satisfechos.

A Hex-ko también le pasaba: archivado en la carpeta de «esto no se va a saber nunca».

Pero resulta que hace años que hay gente abriendo la caja. Y han llegado más lejos de lo que parece.

¿Hasta dónde se ve hoy el interior de una IA?

El ejemplo de referencia es la serie Monosemanticity de Anthropic.

La palabra asusta, pero significa algo sencillo: una cosa, un significado. La investigación busca piezas dentro del modelo que correspondan a un solo concepto, en vez de a un revoltijo de todo a la vez.

¿Y por qué es interesante? No por las imágenes bonitas.

Porque cuando encuentras una característica interna y la mueves, la respuesta del modelo cambia. O sea, no son etiquetas pegadas después. Se parecen más a mandos que giran de verdad.

Todo empezó con 4.096 «unidades de significado»

El punto de partida es Towards Monosemanticity, que Anthropic publicó en 2023.

Cogieron un transformer de una sola capa con 512 neuronas y le sacaron 4.096 características interpretables con un sparse autoencoder, un mecanismo que descompone un estado interno enredado en unas pocas piezas con sentido.

¿Y qué salió? Categorías sorprendentemente nítidas: secuencias de ADN, lenguaje jurídico, peticiones HTTP, texto en hebreo, etiquetas nutricionales.

Con ejemplos así de concretos, la sensación de «estamos viendo el interior» sube de golpe.

Y hay un detalle que importa más de lo que parece: la unidad de análisis dejó de ser la neurona suelta y pasó a ser la combinación de características. Nada de «una bombilla, un significado». Se trata de extraer los componentes de sentido de una señal mezclada.

En Claude 3 Sonnet la cifra subió a unos 34 millones

Vale, pero aquel primer trabajo iba de un modelo diminuto. ¿Aguanta lo mismo en un modelo del tamaño de los que usamos a diario?

Por eso en 2024 Anthropic publicó Scaling Monosemanticity y extrajo unos 34 millones de características de una capa intermedia de Claude 3 Sonnet. Unas 8.000 veces las 4.096 del principio.

Y no son simples etiquetas de palabras. Las características que describe Anthropic van de lo concreto a lo abstracto: el puente Golden Gate, Michael Jordan, el «comportamiento engañoso».

Lo más llamativo: el mismo concepto aparecía como una característica compartida entre varios idiomas y también con imágenes. No es una palabra en inglés. Es más bien un bloque conceptual al que apuntan entradas distintas.

Si mueves el mando, la IA cambia de conversación

El experimento famoso es este: si amplificas artificialmente la característica del puente Golden Gate, la respuesta del modelo se escora hacia el puente.

Y no es una metáfora. Tampoco es un mando que el usuario pueda tocar en el producto.

Es una activación interna que se modifica a propósito, con un efecto causal sobre lo que sale por la otra punta.

Así que decir que «la IA solo encadena palabras que suenan bien» se queda un poco corto. Dentro hay características ligadas a conceptos, y participan en la respuesta.

Además, Anthropic dice haber confirmado características relacionadas con la seguridad: engaño, adulación, sesgo y contenido peligroso. Esta parte es la que toca de lleno el trabajo diario de quien lleva una marca.

Los circuitos enseñan también las «manías» del modelo

En 2025 llegó Circuit Tracing, que ya no se queda en las características sueltas: sigue cómo se conectan entre ellas hasta llegar a la respuesta.

El modelo analizado fue Claude 3.5 Haiku, y el flujo de cálculo interno se dibuja como un attribution graph, o sea, un mapa de qué característica influye sobre cuál.

Los ejemplos son de los que se recuerdan. En traducción, las representaciones conceptuales de las capas intermedias estaban compartidas entre idiomas.

Al escribir un poema con rima, el modelo elegía la palabra que rimaba antes de escribir el verso. Y en las sumas usaba en paralelo dos caminos, uno de cálculo aproximado y otro de cálculo preciso.

Y sí, la IA predice la siguiente palabra una a una. Pero por debajo hay preparativos y circuitos que no se ven en el texto final.

Es como un programa de cocina donde el presentador dice «y ahora lo mezclamos» mientras fuera de cámara han pasado diez pasos de preparación. Normal que mirando solo el plato terminado no se entienda nada.

Conclusión: mira también las manías, no solo el texto

¿Y esto de qué le sirve a quien lleva marketing o marca?

Seamos honestos: hoy ninguna empresa puede auditar qué características internas se activan con su marca. El trabajo de Anthropic es investigación para entender el modelo y para la seguridad, no una función de medición para el público. Y no entra en la evaluación de marcas.

Pero sí cambia el peso que le puedes dar a una sola respuesta. Debajo del texto que lees puede haber mezcladas características de personas, lugares, peligro, adulación y sesgo.

Pongamos que la IA habla de tu marca con una prudencia rara. O que carga las tintas en los riesgos. O que se escora hacia una impresión concreta al compararte con un competidor.

Quizá no sea una simple variación de redacción. Puede ser cosa de la representación interna o de asociaciones aprendidas.

Lo que puedes hacer hoy es sencillo. No te quedes con lo que veas en una sola respuesta. Compara varias preguntas, varios modelos y varios contextos.

Y anota algo más que si has salido o no: anota con qué atributos y con qué impresiones apareces.

Lo de Monosemanticity no significa que ya se lea la mente de una IA. Pero cerrar el tema con un «la respuesta de la IA es una caja negra, no hay nada que medir» es tirar la toalla demasiado pronto, ahora que hasta las características y los circuitos están sobre la mesa.


Fuentes

  • Bricken et al. (Anthropic, 2023), «Towards Monosemanticity: Decomposing Language Models With Dictionary Learning», Transformer Circuits Thread
  • Templeton et al. (Anthropic, 2024), «Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet», Transformer Circuits Thread
  • Lindsey et al. (Anthropic, 2025), «Circuit Tracing: Revealing Computational Graphs in Language Models», Transformer Circuits Thread
Comparte este artículo
Bluesky X
Volver a los artículos