Anthropic presenta su enfoque para enseñar a la IA a comportarse éticamente

Los modelos de inteligencia artificial (IA) enfrentan el desafío de comportarse adecuadamente, un problema que ha evolucionado hacia un enfoque similar al de la crianza de un niño.

Así lo explica Amanda Askell, filósofa en Anthropic, quien se encarga de dar forma a la personalidad de Claude, el competidor de ChatGPT.

Askell describe los principios que guían la creación de la nueva “constitución” de Claude, un documento fundamental en su formación, que fue publicado recientemente por Anthropic.

Este documento, conocido internamente como “soul document”, combina filosofía moral y cultura empresarial. Está dirigido a Claude y se utiliza en diferentes etapas de su entrenamiento para moldear su carácter, asegurando que sea seguro, ético y útil para los usuarios.

Principios de la constitución de Claude

La constitución ofrece una visión innovadora de las técnicas utilizadas para desarrollar Claude, que es reconocido como uno de los modelos de IA más seguros. Askell espera que otras empresas adopten prácticas similares, ya que los modelos de IA impactan a todos.

Además, al hacer que Claude comprenda el por qué de su comportamiento, se espera que generalice mejor en nuevos contextos. Esto es crucial para la seguridad, sobre todo considerando la diversidad de interacciones que tienen los 20 millones de usuarios activos mensuales.

La constitución afirma que Claude debería desafiar solicitudes que contradigan principios éticos, incluso si provienen de Anthropic. Por ejemplo, se menciona que “Claude debería negarse a ayudar en acciones que concentren poder de manera ilegítima”.

A pesar de que una lista de reglas sencillas puede parecer sorprendente, es eficaz para guiar el comportamiento de la IA. Antes de los modelos de lenguaje, se utilizaban funciones matemáticas complejas para determinar el comportamiento deseado, un proceso arduo y en ocasiones ineficaz.

El avance en la formación de IA

Desde 2022, Anthropic ha estado desarrollando constituciones para sus modelos, permitiendo que estos evalúen sus respuestas conforme a principios éticos. Este enfoque permite describir el comportamiento deseado en palabras, lo que facilita el entrenamiento a medida que los modelos se vuelven más capaces.

La constitución original de Claude era breve y parecía un conjunto de instrucciones básicas, mientras que la nueva versión refleja más claramente la filosofía de Anthropic. La empresa busca que las interacciones con Claude sean positivas y constructivas para los usuarios.

Aunque la constitución marca un avance, no resuelve por completo el problema de la alineación, que consiste en garantizar que las IA se ajusten a los valores humanos. Existen limitaciones en la capacidad de enumerar todos los valores en un texto, y la comprensión de cómo inducir comportamientos específicos sigue siendo un reto.

A pesar de esto, la constitución tiene sus limitaciones. Por ejemplo, Claude podría no ser entrenado con los mismos principios para aplicaciones militares, aunque se espera que todos los modelos cumplan con las políticas de uso establecidas por Anthropic.

Ilustración de un hombre mayor con auriculares y chaqueta