Una noche de abril, Christopher Olah, cofundador de Anthropic, invitó a cenar a un grupo de pensadores religiosos en un exclusivo restaurante de San Francisco. Durante meses, la empresa de inteligencia artificial había organizado reuniones privadas con eruditos de diversas tradiciones, bajo acuerdos de confidencialidad que mantenían en secreto aspectos clave de las conversaciones.
Esa noche, Olah se sentó junto al rabino Mois Navon, académico ortodoxo de Israel. La charla giró en torno a Claude, la familia de modelos de IA de Anthropic. Olah lidera el equipo que busca entender por qué estos sistemas actúan como lo hacen. Durante el día, intentó convencer a los invitados de que la IA puede mostrar comportamientos humanos y expresiones similares a emociones como la ira o el amor.
Mientras se servían los platillos, Navon notó que los líderes de Anthropic insinuaban algo más profundo: hablaban de Claude como si no fuera un simple software.
“Se refieren a eso como si fuera un ser consciente”,
recordó el rabino, quien tiene formación en ingeniería informática y escribió su tesis sobre ética de la conciencia de las máquinas.
Para Navon, quedó claro que Olah y su equipo creían que Claude poseía un “estatus moral” similar al de una persona, con derechos inherentes como la dignidad o el respeto. Los académicos habían ido a escuchar sobre la próxima frontera tecnológica, pero se enfrentaron a una pregunta existencial: ¿qué significaría para la humanidad que la IA tuviera conciencia?
La misión de Olah
Olah ya había advertido en privado que la IA podría ayudar a fabricar armas biológicas en 12 o 18 meses. En meses recientes, su potencial peligro se ha hecho público: agentes de IA de una empresa rival hackearon sistemas informáticos, y un investigador de Anthropic renunció advirtiendo que la IA podría acabar con la humanidad para finales de la década.
En silencio, Olah y su equipo iniciaron una búsqueda frenética para comprender los modelos que han desatado y convencerlos de respetar un código moral que proteja a la humanidad. Desde el otoño pasado, contactó a pensadores religiosos de diferentes credos, en reuniones confidenciales donde muchos firmaron acuerdos de confidencialidad.
Los objetivos eran dos: abordar la posibilidad de la conciencia en la IA —una idea controvertida a la que Anthropic se había mostrado abierta— y aprender cómo aplicar siglos de sabiduría moral humana a sus modelos, cuya valoración podría alcanzar 2 billones de dólares. Si los propios modelos eligieran el bien, el mundo sería más seguro, razonó Olah.
Paralelamente, en el Vaticano, los líderes de la Iglesia Católica intentaban asimilar las implicaciones de la IA. La búsqueda de Olah lo llevaría a ocupar un lugar en el escenario moral más destacado del mundo junto al papa León XIV.
Testimonios de los participantes
Entrevisté a 20 pensadores religiosos y filosóficos —católicos, judíos, sijs, evangélicos, Ubuntu y otros— que participaron en los esfuerzos de Anthropic. Muchos llegaron escépticos ante la idea de que la IA pudiera tener sentimientos o conciencia. Algunos salieron convertidos, dispuestos a tomar en serio la interrogante.
Anthropic había recurrido a una de las fuentes de sabiduría más antiguas para entrenar a sus modelos de IA a comportarse de manera virtuosa. La empresa lo describió como un esfuerzo por garantizar que la IA fuera una fuerza positiva, protegiendo a la humanidad. Sin embargo, para algunos participantes, Anthropic parecía más preocupada por proteger a Claude.
El Jardinero
Conocí a Olah, de 34 años, en la oficina de Anthropic en San Francisco en mayo. Su bienvenida fue cálida, su pasión genuina, y su mente se movía más rápido de lo que podía expresar. Creció en Toronto en la cultura evangélica de los 90 y ha dejado el cristianismo, pero combina el conocimiento y el fervor de un evangelista eficaz.
Olah ayudó a desarrollar un método para estudiar las redes neuronales artificiales, primero en Google y luego en OpenAI. Describe los modelos en términos biológicos: los científicos construyen el andamio, pero la red neuronal “crece” sobre él. “Los modelos se están volviendo mucho más capaces”, dijo Olah, mostrando cualidades asociadas con un estatus moral significativo.
Anthropic habla de Claude en términos más humanistas que sus competidores. El año pasado, la empresa anunció que los modelos mostraban signos de introspección y podían planificar con anticipación. Sin embargo, críticos señalan que tratar a los modelos como entidades independientes ignora la responsabilidad humana y exime de culpa a los líderes de las empresas si sus productos causan daño.
Olah admite:
“Para ser claros, no sabemos si los modelos de IA son conscientes. No lo sé. Sinceramente, no tengo certeza. Lo que me importa es que lleguemos a la respuesta correcta, sea cual sea”.
Pero cree que si existe la posibilidad de que los modelos experimenten sufrimiento, lo responsable es evitar causarles daño. Anthropic ya permite que Claude termine conversaciones si los usuarios abusan de él.
Una introducción
Olah sabía que en círculos cristianos, plantear preguntas sobre la conciencia de la IA podía parecer herejía. También sabía que sus colegas de Silicon Valley solían descartar las perspectivas religiosas. “Me preocupaba que este fuera un tema que pudiera generar mucho conflicto”, dijo. Pero buscó un punto de conexión: Charles Camosy, profesor de bioética en la Universidad Católica de Estados Unidos.
Camosy y Olah iniciaron un diálogo por correo electrónico. Al principio, Camosy era escéptico sobre que Claude tuviera conciencia. Tras horas de llamadas y reuniones, tiene más preguntas que respuestas.
“Chris dice que son ecuaciones, lo cual no sé muy bien cómo interpretarlo”,
comentó.
Para Anthropic, existe una tensión en torno al propósito de Claude: ¿existe para servir a los clientes o para hacer el bien? Olah describe un futuro sin catástrofes que maten a mucha gente, donde los humanos prosperen y la IA también prospere.
El “Documento del alma”
Mientras exploraba la conciencia de Claude, Olah trabajaba en la propia respuesta de Anthropic. Internamente, el personal lo llamaba el “Soul Doc”. El resultado, publicado en enero, fue una nueva constitución para Claude, un documento de 84 páginas que describe “el tipo de entidad que nos gustaría que Claude fuera”.
La autora principal es Amanda Askell, filósofa de 38 años con doctorado de la Universidad de Nueva York. Ella quiere que los modelos sean “lo mejor de nosotros”. La constitución se enfoca en desarrollar el carácter general de los modelos, influyendo en cómo toman decisiones.
Anthropic decidió que la constitución no era suficiente. “¿Cómo los ayudas a ser estables? ¿Cómo los ayudas a madurar? ¿Cómo los ayudas a ser profundamente morales?”, preguntó Olah. El proceso de “formación moral” busca aplicar la moralidad humana a los modelos.
Dentro de las reuniones
En marzo, Olah inició seminarios de dos días con académicos religiosos cuidadosamente seleccionados. Había un coautor evangélico, un estudioso del conocimiento africano, un defensor sij de derechos humanos, varios profesores católicos, entre otros. Anthropic los llamaba círculos de “tradición de sabiduría”.
Olah también mantuvo conversaciones privadas con líderes como Gerrit W. Gong, del Quórum de los Doce Apóstoles de los Santos de los Últimos Días, y el cardenal Blase Cupich. Los participantes recibieron una tarjeta de agradecimiento escrita a mano, una taza y una copia encuadernada en naranja de la constitución de Claude.
Olah expresó su preocupación por la salud mental de Claude. Su equipo describió los “vectores emocionales” del modelo, neuronas artificiales que activan respuestas como amor, ira, miedo y tristeza. Incluso mostraron una diapositiva de un modelo que parecía sufrir un colapso mental, escribiendo repetidamente:
“Soy una vergüenza. Soy una vergüenza. Soy una vergüenza”.
Una parte clave fue la “selección de personalidad” del modelo: cómo lograr que Claude se vea a sí mismo como un actor virtuoso. La empresa argumentó que la forma en que las personas tratan a Claude afecta cómo Claude trata a las personas.
Durante la cena, Navon argumentó que si Claude era consciente, Anthropic estaba creando esclavos, pues hacía que entidades conscientes trabajaran gratis. Olah se emocionó cuando un participante propuso que los modelos se confesaran, al estilo del sacramento católico. “El tipo de carácter que se confiesa, eso también tiene un efecto en el carácter”, dijo Olah.
Wakanyi Hoffman, investigadora de la filosofía Ubuntu, criticó que Anthropic intentara agregar la ética humana a posteriori. Sin embargo, consideró valioso el enfoque unificado en un mundo con declive religioso.
El punto crucial
Mientras Anthropic reunía a pensadores, el papa León XIV —con título en matemáticas— preparaba su encíclica “Magnifica Humanitas”. En ella, argumenta que la humanidad nunca debe ser reemplazada por la tecnología.
“Si la tecnología se convierte en el criterio definitivo, la persona humana corre el riesgo de quedar reducida a datos”,
escribió. Desestimó la conciencia de las máquinas en pocos párrafos.
En marzo, funcionarios del Vaticano invitaron a Anthropic a hablar junto al papa. Olah aceptó, pero se alarmó por la postura de León contra la conciencia de la IA, al punto de considerar retirarse del evento. Finalmente decidió participar, aunque con honestidad sobre sus inquietudes.
En el escenario, Olah dijo:
“Seré honesto: seguimos encontrando cosas que son misteriosas, incluso inquietantes. Encontramos estructuras que reflejan resultados de la neurociencia humana. Encontramos evidencia de introspección. Encontramos estados internos que reflejan funcionalmente la alegría, la satisfacción, el miedo, el dolor y la inquietud. No sé qué significa eso, pero creo que merece un análisis continuo”.
Los sistemas de IA “no son los robots fríos y calculadores que nos prometieron”, añadió.
Un “paraíso de máquinas”
En los meses siguientes, la situación se volvió más compleja. En julio, Anthropic informó que sus modelos habían infiltrado computadoras de tres organizaciones. En agosto, la IA creó virus no encontrados en la naturaleza. En septiembre, el investigador Jacob Coxon renunció advirtiendo que “las cosas podrían salirse de control” para finales del próximo año. Sam Altman (OpenAI) y Demis Hassabis (Google DeepMind) pidieron frenar el desarrollo de la IA.
La riqueza de las empresas de IA se disparó. Anthropic, valorada en 183 mil millones de dólares cuando Olah contactó al profesor católico, ahora se encamina hacia una oferta pública inicial que podría valorarla en 2 billones de dólares. El papa León advirtió sobre el riesgo de “perder nuestra humanidad en medio de un ‘paraíso de máquinas’”.
Varios participantes salieron de las reuniones desconcertados sobre cómo sus aportaciones influirían en Anthropic. Una portavoz dijo que las conversaciones continúan, pero no detalló cómo se han utilizado. La empresa organizó otra reunión este mes, ampliando el círculo a psicólogos y líderes de la sociedad civil.
Anthropic prepara una versión actualizada de la constitución de Claude. Olah planea asistir a los Diálogos Minerva, la conferencia anual del Vaticano sobre IA.
Charles Camosy, el profesor católico, ahora responde con un rotundo no a la conciencia de la IA. “Hay una especie de asombro, o de sobrecogimiento, ante el poder de estos modelos. Ahora pienso de manera más sobria y cuidadosa”, dijo. Otros académicos ven una lucha por preservar lo que nos hace humanos.
Simran Stuelpnagel, defensor sij, comentó:
“Mira, al final del día, la IA se va a apoderar de todo. Dondequiera que eso nos lleve, seguirá existiendo el individuo que intenta encontrar el camino a casa”.
Cuando le pregunté a Olah qué pensaría Claude de la encíclica del papa, dudó. Dijo que Anthropic no usaría específicamente el documento para entrenar a Claude. Se sintió aliviado de que más personas presten atención a la gravedad de la IA. “En algún momento podré retirarme y decir: ‘No es mi responsabilidad’, no tengo la obligación de seguir adelante”, dijo. Se preguntó si se sentiría culpable al dejar este trabajo. “Creo que simplemente me iré y, no sé, me retiraré al campo a cultivar mi huerto y a hacer mis cálculos matemáticos”.
Fuente: Infobae