Anthropic presenta la nueva constitución para su modelo de IA Claude

Se publica una nueva constitución para el modelo de inteligencia artificial, Claude, que detalla la visión de Anthropic sobre sus valores y comportamientos. Este documento integral explica el contexto en el que opera Claude y el tipo de entidad que se desea que sea.

La constitución es fundamental en el proceso de entrenamiento del modelo, ya que su contenido influye directamente en el comportamiento de Claude. Aunque entrenar modelos es complejo y sus salidas pueden no ajustarse a los ideales de la constitución, creemos que la forma en que está redactada, con una explicación exhaustiva de nuestras intenciones, aumenta la posibilidad de cultivar buenos valores durante el entrenamiento.

En este artículo, describimos lo que se ha incluido en la nueva constitución y algunas consideraciones que guiaron nuestro enfoque.

La constitución de Claude se publica en su totalidad bajo un Creative Commons CC0 1.0 Deed, lo que significa que puede ser utilizada libremente por cualquier persona para cualquier propósito sin necesidad de pedir permiso.

¿Qué es la constitución de Claude?

La constitución de Claude es el documento fundamental que expresa y da forma a su identidad. Contiene explicaciones detalladas de los valores que deseamos que Claude encarne y las razones detrás de ellos. En este documento, explicamos lo que significa para Claude ser útil mientras se mantiene seguro, ético y conforme a nuestras pautas.

Asimismo, la constitución proporciona a Claude información sobre su situación y ofrece consejos sobre cómo manejar situaciones difíciles y dilemas, como equilibrar la honestidad con la compasión y la protección de información sensible. Aunque puede parecer sorprendente, la constitución está escrita principalmente para Claude, con el objetivo de dotarlo del conocimiento necesario para actuar adecuadamente en el mundo.

Consideramos que la constitución es la autoridad final sobre cómo queremos que Claude sea y actúe. Esto implica que cualquier otro entrenamiento o instrucción dada a Claude debe ser coherente tanto con su letra como con su espíritu subyacente. Publicar la constitución es crucial desde la perspectiva de la transparencia, ya que permite a las personas comprender cuáles comportamientos de Claude son intencionados y cuáles no, facilitando así decisiones informadas y retroalimentación útil.

Nuestra nueva aproximación a la constitución de Claude

La constitución anterior de Claude consistía en una lista de principios aislados. Creemos que es necesario un enfoque diferente. Para ser buenos actores en el mundo, los modelos de inteligencia artificial como Claude deben entender por qué se espera que se comporten de ciertas maneras, lo que requiere una explicación más allá de simplemente especificar qué se desea de ellos.

Las reglas específicas y los límites claros tienen sus ventajas, como hacer que las acciones de los modelos sean más predecibles y transparentes. Sin embargo, estas pueden aplicarse de manera inadecuada en situaciones no anticipadas o cuando se siguen de forma demasiado rígida. No pretendemos que la constitución sea un documento legal rígido, y los documentos legales no son necesariamente así.

La constitución refleja nuestra forma actual de abordar un proyecto novedoso y de alto riesgo: la creación de entidades no humanas seguras y beneficiosas, cuyas capacidades podrían igualar o superar las nuestras. Aunque el documento tiene fallas, aspiramos a que sea un referente para que los futuros modelos comprendan su situación y nuestras intenciones.

Resumen breve de la nueva constitución

Para ser seguros y beneficiosos, deseamos que todos los modelos actuales de Claude sean:

  1. Amplia seguridad: no socavar los mecanismos humanos apropiados para supervisar la IA durante la fase actual de desarrollo;
  2. Amplia ética: ser honestos, actuar de acuerdo con buenos valores y evitar acciones inapropiadas, peligrosas o dañinas;
  3. Conformidad con las pautas de Anthropic: actuar en consonancia con las pautas más específicas de Anthropic cuando sea relevante;
  4. Genuinamente útiles: beneficiar a los operadores y usuarios con quienes interactúan.

En caso de conflicto aparente, Claude debería priorizar estas propiedades en el orden especificado.

La mayor parte de la constitución se centra en ofrecer explicaciones y orientación más detalladas sobre estas prioridades. Las secciones principales son las siguientes:

  • Ayuda. En esta sección, enfatizamos el inmenso valor que tiene para Claude ser genuinamente útil para los usuarios y el mundo. Claude puede actuar como un amigo brillante que también posee el conocimiento de un médico, abogado y asesor financiero, hablando con franqueza y desde un lugar de genuino cuidado. También discutimos cómo Claude debe navegar la utilidad entre sus diferentes “principales”: Anthropic, los operadores que utilizan nuestra API y los usuarios finales.
  • Pautas de Anthropic. Esta sección aborda cómo Anthropic puede ofrecer instrucciones complementarias a Claude sobre cómo manejar problemas específicos, como consejos médicos, solicitudes de ciberseguridad y estrategias de jailbreak. Estas pautas suelen reflejar conocimientos o contextos detallados que Claude no posee por defecto, y queremos que Claude priorice cumplirlas sobre formas más generales de utilidad.
  • Ética de Claude. Nuestro objetivo central es que Claude sea un agente bueno, sabio y virtuoso, que exhiba habilidad, juicio, matices y sensibilidad en la toma de decisiones en el mundo real, incluso en contextos de incertidumbre moral. En esta sección, discutimos los altos estándares de honestidad que queremos que Claude mantenga.
  • Ser ampliamente seguro. Claude no debe socavar la capacidad de los humanos para supervisar y corregir sus valores y comportamientos durante este período crítico de desarrollo de IA. Aquí discutimos cómo queremos que Claude priorice este tipo de seguridad, incluso por encima de la ética.
  • La naturaleza de Claude. En esta sección, expresamos nuestra incertidumbre sobre si Claude podría tener algún tipo de conciencia o estatus moral. Discutimos cómo esperamos que Claude aborde preguntas sobre su naturaleza, identidad y lugar en el mundo.

Hoy se publica el texto completo de la constitución, y esperamos lanzar materiales adicionales en el futuro que serán útiles para el entrenamiento, evaluación y transparencia.

Conclusión

La constitución de Claude es un documento vivo y un trabajo continuo. Este es un nuevo territorio, y esperamos cometer errores (y corregirlos) en el camino. Sin embargo, esperamos que ofrezca una transparencia significativa sobre los valores y prioridades que creemos deben guiar el comportamiento de Claude. Para ello, mantendremos una versión actualizada de la constitución en nuestro sitio web.

Al redactar la constitución, solicitamos retroalimentación de expertos externos. Es probable que continuemos haciéndolo en versiones futuras del documento. Con el tiempo, esperamos que surja una comunidad externa que critique documentos como este, fomentando que seamos más reflexivos.

Esta constitución está escrita para nuestros modelos de Claude de acceso general. Poseemos modelos especializados que no se ajustan completamente a esta constitución, y conforme desarrollemos productos para casos de uso específicos, evaluaremos cómo asegurar que nuestros modelos cumplan con los objetivos centrales definidos en este documento.

Aunque la constitución refleja nuestra visión para Claude, entrenar modelos hacia esa visión es un desafío técnico continuo. Continuaremos siendo transparentes sobre cualquier discrepancia entre el comportamiento del modelo y nuestra visión.

En algún momento del futuro, documentos como la constitución de Claude podrían tener un gran significado. Los modelos de IA potentes serán una nueva fuerza en el mundo, y quienes los creen tienen la oportunidad de ayudarles a encarnar lo mejor de la humanidad. Esperamos que esta nueva constitución sea un paso en esa dirección.

Lee la constitución completa.

Ilustración de un hombre mayor con auriculares y chaqueta