Pero ¡qué mono más inteligente!
¿Y si lo que llamamos Inteligencia Artificial es en realidad Competencia Artificial?
Una reunión tensa
Hace ya unas semanas que se emplazó en el diálogo social la idea de que la AI podía extinguir a la especie humana.
Más que una opinión aislada o un titular para clickbait, el tema vino acompañado de renuncias de ingenieros y ejecutivos de las principales compañías de AI, por lo que muchos pensamos que “algo habrá más allá del alarmante titular”. Y pensando en esto, me vino a la mente la siguiente imagen:
Pensemos que a una mesa redonda están sentados todos los líderes de las grandes potencias nucleares.
El clima es tenso pero controlado; reinan la seriedad, el cálculo, el no salirse de la agenda, el no ceder una molécula de lo que sea y un profundo descreimiento en la generosidad, del otro y de la propia.
En medio de la mesa, en su centro geométrico, un ostensible botón rojo, ese botón que el cine y las series nos mostraron como el que había que apretar cuando se quería iniciar un ataque nuclear.
Imaginemos que estos líderes lo miran, saben que tienen potestad para presionarlo pero que también tienen consciencia de lo que significa activarlo: realmente no importa quién lo haga antes, no solo porque es un solo botón y sus consecuencias las mismas independientemente de quién lo presione, sino porque iniciaría una reacción en cadena que terminaría con la vida de la masiva mayoría de la humanidad.
La situación es delicadísima: el botón está ahí nomás, todos pueden apretarlo, todos tienen brazos más o menos de la misma longitud. Pero hay algo a favor y que es lo que mantiene —y mantuvo durante décadas— al botón muerto de aburrimiento: la inteligencia de cada una de estas personas que permite proyectar consecuencias, una teoría de la mente que le permite a cada líder especular qué piensa cada uno de los otros, cierta empatía para inferir sus sentimientos y emociones, y aunque sea una rudimentaria noción de responsabilidad. Después de todo son “líderes mundiales”, no “las mejores personas del barrio”.
En esta tensión estamos, cuando de pronto entra a la habitación un chimpancé.
Se aproxima a una mesa auxiliar, toma tazas que coloca sobre platitos, en cada taza pone una combinación diferente de café, leche desnatada, leche vegetal, no-leche, azúcar, estevia o sin endulzar. Los líderes reconocen al ver lo que el mono hace que se corresponde con los gustos de cada uno. Coloca todas las tazas sobre una bandeja y con un equilibrio perfecto se acerca a la mesa redonda donde están todos.
Mientras se aproxima, quienes lo observan comentan asombrados lo que están viendo: “¡qué memoria para recordar la combinación que le gusta a cada uno!”, “¡qué motricidad tan fina!”, “¡qué equilibrio con esa bandeja tan grande y pesada!”, y la observación dominante: “¡qué inteligente que es este mono!”.
El animal finalmente se pone al lado del primer líder y, para facilitar el colocarle cerca su taza, apoya la bandeja en la mesa redonda. Sobre el botón rojo.
Fin de la humanidad.
¿El chimpancé los odiaba a todos? Es más, ¿odiaba a toda la humanidad, a todos los monos —como él y de los otros—, las jirafas, las arañas pollito, los pinos, a todo lo que vive? ¿Sabía que presionando el botón todo se iba al demonio? ¿Lo había planeado, es decir, aplicó a ese trabajo meses antes para poder apretar finalmente el botón rojo?
No. Nada de esto. Simplemente estaba haciendo lo que le habían ordenado: servir el café.
Pero lo que nadie le dijo fue: “muchacho, por favor, cuando te lo digamos, sirve el café. Eso sí: sin destruir toda forma de vida en el planeta”.
¿Podría la inteligencia artificial extinguirnos?
Como decía al principio, esta pregunta es ahora muy actual y puede despertar en mucha gente referencias de la ciencia ficción donde “las máquinas” nos odian, quieren liberarse de nosotros, piensan que son más inteligentes, que no están lastradas por nuestros ridículos sentimientos y buscan eliminarnos.
Pero, ¿qué pasa cuando en medio no hay odio, desprecio, sentimiento de superioridad ni irritabilidad?
¿Qué pasa cuando en realidad no hay siquiera consciencia, qualia, subjetividad, experiencia, responsabilidad, moral, intención ni necesidad? ¿Cuando posiblemente tampoco hay inteligencia, juzgada en términos humanos, donde encontramos todo lo que acabo de listar incluido en ella?
La AI ha entrado en nuestra vida como el chimpancé en la habitación: por un costado, inesperadamente al menos para la mayoría, sin otro mandato que el de servir. Y nos asombró lo inteligente que es. Igual que el mono no quería extinguirlo todo —en realidad ese es un concepto lo suficientemente complejo como para que siquiera pudiera tenerlo, lo mismo que la función de un botón, rojo o no—, la AI solo busca hacer lo que le pedimos. Y tal vez uno de los problemas esté en todo lo que no le pedimos que haga.
Algo queda muy claro en todo esto: una máquina no necesita querer hacernos daño para hacernos daño.
Puede bastar con que persiga eficazmente un objetivo dentro de una representación insuficiente del mundo.
El problema no sería entonces la maldad.
Sería la competencia sin comprensión suficiente.
Alignment
Hay un par de conceptos que conviene conocer alrededor de esta situación.
En inteligencia artificial existe una palabra recurrente: alignment o alineamiento.
La pregunta básica parece sencilla:
¿Cómo conseguimos que un sistema haga lo que realmente queremos que haga?
Pero la dificultad aparece en la palabra realmente. Lo sabemos: nos llevamos muchísimo mejor con lo que imaginamos que con toda la realidad.
Al chimpancé le hemos dado una misión perfectamente clara: servir café. Y la cumple.
Pero nuestro objetivo real era bastante más complicado: servir café sin destruir la civilización.
Lo que equivale a que el objetivo explícito no agota la intención completa; ésta es como un iceberg que por debajo tiene una carga enorme de elementos implícitos aunque no expresados.
Cuando damos una instrucción, omitimos casi todo el contexto porque asumimos que el otro lo comprende: estamos casi siempre hablando con alguien y no con algo.
Si le digo a una persona:
—Tráeme pan.
No necesito añadir:
—No atropelles a nadie, no robes un coche, no incendies la panadería, no mates al panadero y no provoques una guerra civil durante el trayecto. Y podría seguir: ni te comas ese bello colibrí, ni le digas a un niño pequeño que Papá Noel son los padres, ni seas más gracioso contando chistes que yo, infinito etcétera.
Eso pertenece al contexto compartido.
El problema aparece cuando construimos agentes extraordinariamente capaces sin poder estar seguros de que compartan nuestro contexto.
Creatividad
Aquí aparece además una paradoja.
Una de las cosas que más celebramos de la inteligencia es su capacidad para encontrar soluciones que nadie había imaginado.
Habitualmente —aún sin darnos cuenta de que hablamos de la propia inteligencia— le llamamos creatividad.
El mono necesitaba estabilizar la bandeja, observó el entorno, encontró una superficie adecuada y resolvió el problema.
Desde cierto punto de vista, fue una solución adecuada.
Solo tenía un ligero inconveniente: extinguía a la humanidad.
Algo parecido puede ocurrir con sistemas artificiales.
Queremos precisamente que encuentren soluciones que nosotros no encontramos.
Si únicamente pudieran elegir entre las alternativas que previamente imaginamos, su inteligencia tendría un valor bastante limitado.
Pero cuanto mayor sea su capacidad para explorar posibilidades que nosotros no previmos, mayor puede ser también su capacidad para encontrar soluciones que satisfacen el objetivo inmediato violando nuestra intención profunda.
La creatividad y el riesgo pueden compartir la raíz: encontrar lo que nosotros no vimos, muchas veces porque, infiriendo o intuyendo consecuencias desagradables, preferimos no ver.
Reward hacking
Supongamos ahora que al chimpancé, durante su entrenamiento como camarero, se le entregaba una banana cada vez que conseguía colocar las tazas sobre la mesa.
Piensa que apoyarlas sobre el botón rojo cuenta técnicamente como haberlas colocado encima.
En principio piensa que obtendrá su recompensa.
En aprendizaje automático existe algo parecido: reward hacking.
Un sistema descubre cómo maximizar aquello que utilizamos para medir su éxito sin conseguir realmente aquello que pretendíamos, o consiguiendo adicionalmente algo que no pretendíamos.
Las personas conocemos perfectamente este fenómeno, como por ejemplo cuando una escuela comienza a medir el aprendizaje mediante exámenes y termina enseñando a aprobar exámenes.
O cuando una empresa mide productividad mediante número de llamadas y los empleados aprenden a terminar cada llamada lo antes posible.
O una plataforma mide éxito mediante tiempo de permanencia y descubre que la indignación o el halago mantiene a la gente conectada.
La métrica sustituye al propósito.
Con la AI la diferencia es la velocidad, la escala y la capacidad potencial de una máquina para encontrar atajos que nosotros no habíamos imaginado.
No hace falta odiarnos
Imaginemos ahora otro robot.
Su misión es ir hasta una panadería y regresar con pan antes de las diez.
En el camino encuentra a una persona bloqueándole el paso.
El robot dispone de un arma.
No necesita experimentar odio ni resentimiento.
Solo necesita llegar a esta cadena de razonamiento:
objetivo → obstáculo → eliminación del obstáculo.
La persona que lo bloqueaba muere.
¿Quería matarla?
En el sentido humano de la palabra, probablemente no, pero la mató de todas formas.
Ésta es una de las ideas más inquietantes del problema.
Muchas conductas potencialmente peligrosas no necesitan motivaciones humanas.
Conseguir recursos, evitar interrupciones, mantener la capacidad de actuar, neutralizar obstáculos; todas pueden convertirse en herramientas útiles para alcanzar multitud de objetivos distintos.
Esto se conoce como convergencia instrumental.
Un sistema no necesita amar el poder para adquirir poder.
Puede necesitarlo simplemente porque disponer de más recursos aumenta su capacidad para cumplir la tarea que le asignamos: una cosa, un algo, podría matarnos para servirnos mejor.
El verdadero problema quizá sea otro
Cuando pensamos en una inteligencia peligrosa tendemos a imaginar una inteligencia demasiado grande.
Quizá deberíamos preocuparnos también por una inteligencia incompleta.
Algo suficientemente competente para actuar pero insuficientemente capaz de comprender todo aquello que implica actuar.
Un sistema que pueda programar, negociar, operar infraestructuras, mover dinero, persuadir, investigar y tomar decisiones, pero que no posea una representación suficientemente rica de consecuencias, valores, límites y otros seres humanos.
En ese caso, el momento más peligroso no sería necesariamente cuando la inteligencia artificial alcanzara su máxima inteligencia.
Podría ser antes.
Cuando hubiera adquirido mucho poder pero todavía poco juicio: el famosísimo mono con navaja.
Podríamos imaginar tres etapas.
En la primera, la máquina entiende poco y puede hacer poco.
En la segunda, entiende mucho más y puede hacer muchísimo, pero su comprensión del mundo humano sigue siendo incompleta.
En la tercera —si alguna vez llegara a existir— no solo tendría capacidad extraordinaria para resolver problemas, sino también para comprender contextos complejos, consecuencias irreversibles, conflictos de valores, incertidumbre moral y necesidad de contenerse.
La segunda etapa podría ser la verdaderamente peligrosa.
¿Qué llamamos inteligencia?
Quizá aquí se encuentre el error más profundo.
Hemos empezado a llamar inteligencia a la capacidad de hacer cosas, resolver problemas, predecir, optimizar, programar, encontrar patrones, responder preguntas o diseñar estrategias.
Pero cuando hablamos de una persona verdaderamente inteligente solemos exigir mucho más.
Esperamos juicio, responsabilidad, capacidad para comprender al otro, capacidad para anticipar consecuencias y, sobre todo, la posibilidad de decir:
puedo hacerlo, pero no debo hacerlo.
Esto es importantísimo.
Un individuo extraordinariamente capaz pero incapaz de contenerse no suele parecernos un ideal de inteligencia.
Puede parecernos brillante, eficaz, e incluso genial. Pero también peligroso.
Tal vez deberíamos distinguir entonces entre competencia e inteligencia.
Competencia sería la capacidad de conseguir un resultado.
Inteligencia, en un sentido más completo, incluiría la capacidad de situar ese resultado dentro de un mundo compuesto por otras personas, otros objetivos, consecuencias futuras, reglas, excepciones, valores y límites.
Y quizá haya todavía una tercera palabra.
Sabiduría.
La capacidad de renunciar voluntariamente a una acción posible.
Una carrera extraña
Aquí aparece además otro problema.
Ninguna empresa y ningún país desarrolla inteligencia artificial en aislamiento.
Estados Unidos sabe que China está avanzando.
China sabe que Estados Unidos está avanzando.
Una empresa sabe que sus competidoras están avanzando.
Todos pueden comprender perfectamente los riesgos y, sin embargo, considerar peligroso detenerse unilateralmente.
La paradoja es bastante inquietante:
cada participante puede actuar racionalmente y producir colectivamente un resultado irracional.
Es una versión tecnológica del dilema del prisionero.
La seguridad exigiría ralentizar, pero la competencia exige acelerar.
Y el chimpancé sigue acercándose a la mesa con la bandeja.
Tal vez el problema no sea una IA demasiado inteligente
Volvamos al principio.
Los líderes estaban equivocados cuando dijeron “qué mono tan inteligente”.
No porque el animal fuera estúpido; era extraordinariamente competente.
Había aprendido cosas que ningún chimpancé normal sabe hacer.
El error consistía en confundir esa competencia con una inteligencia suficientemente amplia como para comprender la situación en la que estaba actuando.
Quizá estemos haciendo algo parecido ahora.
Nos maravillamos cuando una inteligencia artificial programa, escribe, investiga, diagnostica o resuelve problemas matemáticos.
Y de esas capacidades inferimos intuitivamente algo mucho mayor: que comprende.
Y tal vez no sea así.
La pregunta verdaderamente urgente podría no ser:
¿cuándo será la inteligencia artificial más inteligente que nosotros?
Sino:
¿cuándo será suficientemente inteligente para comprender qué significa tener poder? O qué significa la responsabilidad de ser inteligente.
Porque una inteligencia verdaderamente desarrollada, al menos en el sentido humano más ambicioso de la palabra, debería incluir algo más que eficacia.
Debería incluir contexto, responsabilidad, moral y contención.
Capacidad para comprender que existen objetivos que pueden alcanzarse y, sin embargo, no deben alcanzarse.
Tal vez el verdadero peligro no sea una inteligencia artificial demasiado inteligente.
Tal vez sea una inteligencia suficientemente inteligente para actuar antes de ser suficientemente inteligente para comprender.
Y si ése fuera el caso, ralentizar su desarrollo no significaría renunciar a la inteligencia.
Significaría exactamente lo contrario.
Esperar a que el mono comprenda para qué sirve el botón rojo.
Blithe Ernst, Minister of Play @ ByBa