Interpretabilidad de la IA: un nuevo enfoque
Investigación reciente promete avances en el entendimiento de modelos de lenguaje
Anthropic ha puesto su atención en la interpretabilidad mecanicista, una rama de la investigación en inteligencia artificial que busca desentrañar el complejo entramado matemático que subyace en los modelos de IA. La meta es comprender por qué estos sistemas generan determinadas respuestas, un proceso que implica lidiar con vastas cantidades…

Anthropic ha puesto su atención en la interpretabilidad mecanicista, una rama de la investigación en inteligencia artificial que busca desentrañar el complejo entramado matemático que subyace en los modelos de IA. La meta es comprender por qué estos sistemas generan determinadas respuestas, un proceso que implica lidiar con vastas cantidades de datos y que a menudo se percibe como un complejo laberinto de información. Esta investigación es motivo de debate, ya que el uso de terminología de psicología y neurociencia puede dar a estos modelos una apariencia de sofisticación que no siempre es fiel a la realidad. Recientemente, la compañía anunció un avance significativo al desarrollar una nueva técnica para acceder a los 'pensamientos internos' de sus modelos durante el razonamiento. Este descubrimiento fue discutido con expertos en el campo, quienes han invertido años en investigar la operatividad de estos modelos. La empresa ha trabajado durante varios años en desentrañar el funcionamiento de los grandes modelos de lenguaje (LLMs), convirtiendo esta línea de investigación en un pilar fundamental de su misión. Según Dario Amodei, CEO de Anthropic, lograr un control total sobre los LLMs requiere una comprensión más profunda de su funcionamiento. El nuevo enfoque de Anthropic revela un espacio denominado espacio J dentro de estos modelos, que contiene palabras que no se manifiestan en las respuestas pero que son determinantes en la resolución de problemas. Gracias a una técnica innovadora aplicada a su modelo Claude, este descubrimiento representa un avance genuino en la comprensión de estos sistemas. Las palabras en este espacio pueden reflejar el progreso en tareas específicas o pueden ser indicios de reconocimiento, como el caso del término 'proteína' al analizar una secuencia proteica. La capacidad de los LLMs para describir y manipular estas palabras sugiere un uso activo de la información, abriendo nuevas vías para el control y aplicación de estos modelos en contextos estratégicos, especialmente relevantes para tomadores de decisiones en México y América Latina.


