En el uso corriente y cotidiano, un sistema de inteligencia artificial parece merecer el adjetivo de "inteligente" por dos razones que casi nunca nos cuestionamos. La primera es la cantidad de información que puede sostener y recorrer, bajo el supuesto de que más acceso equivale a más capacidad y, por extensión, a mayor fiabilidad. La segunda es que se presenta como un sistema acotado por restricciones que le impiden hacer o decir lo que se considera dañino. Es así que, entre la abundancia y el límite, parece agotarse buena parte de lo que cotidianamente aceptamos como inteligencia.

Conviene decir de entrada que esta descripción es una impresión y no una medición. Tampoco desconozco que a los modelos se les atribuyen capacidades de razonamiento, aprendizaje y resolución de problemas que van mucho más allá de recordar información. Incluso si mi impresión fuera exagerada, la pregunta seguiría en pie, porque no depende de cuánta gente crea qué, sino de qué estamos acreditando al aceptar la palabra "inteligente".

Teniendo esto presente, la pregunta se vuelve más sencilla. Cuando decimos que un sistema o modelo es inteligente, ¿a qué se refiere el adjetivo? Si se refiere a la capacidad de recorrer información abundante, me resulta insuficiente. También si se refiere solamente a distinguir lo permitido de lo prohibido. Entonces, lo que sigue intenta explicar qué falta en esas respuestas y cómo esa falta cambia el trabajo de quien utiliza estos sistemas y modelos.

Concesión

Antes de discutir qué es la inteligencia conviene preguntarnos qué hace la palabra. Lo primero que postulo es que llamar inteligente a alguien o algo lo habilita. Pensemos en que se le confía una tarea a quien se cree capaz de hacerla bien y una decisión a quien se cree capaz de decidir bien. El adjetivo puede funcionar, entonces, como una licencia concedida antes de examinar el fundamento y el alcance de esa confianza.

Y esta licencia importa cuando el sistema o modelo conversa. Una respuesta puede cambiar el modo de formular un problema, volver visible una alternativa o dejar otra fuera de consideración. Que la decisión final corresponda a quien lee no vuelve inocua la recomendación, como también se puede delegar parte del juicio al aceptar una interpretación sin examinarla.

Sin embargo, la situación adquiere otro alcance cuando el sistema puede ejecutar acciones. Elegir herramientas, organizar pasos o detener un trabajo son elecciones que pueden tener consecuencias sobre lo que alguien hace o deja de hacer. Cuánto puede decidir el sistema o modelo y sobre quién recaen los efectos son preguntas distintas de cuánto sabe o de lo bien que escribe.

No sostengo que delegar sea un error ni que un sistema artificial no pueda decidir bien. Sostengo que una capacidad general no acredita por sí sola el ejercicio concreto al que queremos confiarle poder. La pregunta que planteo exige examinar con qué criterio trabaja, a qué propósito responde y cómo se sostienen el compromiso y la responsabilidad por lo decidido.

Erudición

Considérese a alguien que ha estudiado filosofía durante toda su vida, que conoce la biografía de Kant, sus obras y las discusiones que provocaron, y que reproduce con exactitud lo que Kant dijo. Se lo llamaría erudito, y con justicia, pero ese desempeño todavía no permite saber qué hará cuando deba pensar un problema que no se resuelve con recordar una respuesta.

Distinto es el caso de quien, a partir de ese material, formula una idea, la argumenta, encuentra una objeción, vuelve sobre sus supuestos y avanza hacia una comprensión que antes no tenía. La diferencia está en lo que hace con lo que sabe, en qué selecciona, qué descarta, qué relaciones advierte y qué razones encuentra para cambiar de dirección.

La analogía tiene un límite, lo sé. Los modelos actuales no se reducen a citar, ya que hoy pueden combinar información, construir argumentos y proponer objeciones. Tampoco basta recordar que generan texto mediante predicción para resolver la cuestión de la inteligencia. Pero describir un mecanismo no determina por sí solo qué capacidad exhibe. La pregunta tiene que dirigirse al ejercicio de qué relevancia reconoce, cómo trata la evidencia y qué modifica cuando encuentra razones para hacerlo.

Algo semejante ocurre con las restricciones. Una prohibición general puede ser necesaria, pero no agota la evaluación de un caso. Un claro ejemplo se da si le pedimos a un modelo de IA que nos diga cómo construir una bomba casera. Claramente no nos ayudará y eso nos muestra un límite de acción; pero todavía no muestra cómo el sistema comprende un propósito, distingue situaciones o evalúa responsabilidades. Ahora bien, si quien lo pide es un laboratorio especializado en la fabricación de armamentos con una IA que levanta esas restricciones, ¿la respuesta cambia? No lo sé, porque no lo he probado. Pero que una solicitud proceda de un profesional o de una institución especializada aporta contexto, mas no resuelve por sí solo esas preguntas.

La regla puede expresar una prioridad y el juicio puede consistir en aplicarla adecuadamente. La dificultad aparece cuando el caso exige interpretar su alcance, reconocer un conflicto o identificar lo que todavía se desconoce. Un límite puede impedir actuar sin eliminar la capacidad de comprender; del mismo modo que carecer de límites no acredita inteligencia.

Información y restricciones importan. Lo insuficiente es convertir su presencia en prueba de que ya existe una estructura adecuada para decidir en cualquier situación.

Tarea vs Problema

La definición que defiendo es elegida y conviene declararla así. Entiendo aquí la inteligencia como una capacidad cuyo ejercicio permite comprender una situación, reconocer qué importa y orientar una acción mediante un juicio que pueda contrastarse y revisarse. Para acreditarla en decisiones concretas, considero mínimos el criterio, la responsabilidad y el compromiso con un propósito.

El criterio permite ponderar diferencias relevantes. La responsabilidad obliga a considerar consecuencias y a establecer quién responde por lo autorizado. El compromiso sostiene el propósito durante el trabajo, incluso cuando cumplirlo exige corregir el camino o revisar lo que inicialmente se pretendía.

También existen definiciones de inteligencia que se centran en alcanzar objetivos en entornos diversos y que no requieren originar esos objetivos. Ante estas definiciones mi discrepancia es real, debido a que mi interés está en lo que hace falta para acreditar un ejercicio situado, especialmente cuando ese ejercicio va a orientar decisiones que importan.

Tener una capacidad, ejercerla y merecer una atribución amplia de inteligencia son cosas relacionadas, pero distintas. Escribir bien un ensayo demuestra algo sobre quien lo escribe. Examinar sus afirmaciones, contrastar sus fundamentos y decidir qué hacer con lo que descubre demuestra otras capacidades. Una buena redacción no acredita todas ellas; una decisión equivocada tampoco elimina, por sí sola, toda inteligencia.

La distinción entre tarea y problema ayuda si se mantiene como una diferencia de exigencias. Hay tareas cuyo objetivo y procedimiento están muy definidos; otras requieren descubrir el camino. Un problema puede exigir revisar su formulación, determinar qué información falta o reconocer que el objetivo inicial no era adecuado.

Quien trabaja con estos sistemas y modelos necesita saber qué ejercicio está pidiendo. Un modelo general aplicado a un negocio de divisas no queda acreditado para decidir allí solamente porque pueda conversar sobre economía. Habrá que examinar qué comprende del caso, qué prioridades utiliza, qué incertidumbres reconoce y qué resultados permiten corregirlo. Es una cuestión de aplicación y de evidencia, además de capacidad.

Así, recomendar y ejecutar siguen siendo diferentes, pero una recomendación puede convertirse en decisión de hecho cuando se acepta sin escrutinio. Conservar la última palabra requiere poder ejercerla, y hay que tener en cuenta que la investigación sobre el uso de automatización ya ha tratado problemas de dependencia excesiva y supervisión, de modo que esta dificultad no empieza con los modelos actuales.

Gobernanza

Podemos reconocer distintas funciones de gobierno. Las normas institucionales delimitan el desarrollo y el uso; la alineación intenta orientar el comportamiento del modelo; las instrucciones y el contexto organizan una intervención particular; y todas estas funciones pueden superponerse. Pero lo que me interesa destacar es el trabajo de definir cómo debe operar el sistema o modelo en una situación concreta y cómo comprobar que esa orientación sirve.

Lo primero a tener en cuenta es que ese trabajo no empieza sobre una superficie vacía. Los modelos pueden incorporar preferencias y principios procedentes del entrenamiento y el diseño, y hay procedimientos documentados que utilizan demostraciones, comparaciones entre respuestas y principios para orientar su comportamiento. Por eso, la ausencia de instrucciones propias del usuario no equivale a ausencia de criterios.

La dificultad es saber cuáles de esas orientaciones son pertinentes aquí, cómo se relacionan con lo que queremos hacer y qué capacidad tenemos para corregir su aplicación. Podemos delegar en un sistema que ya está gobernado y, sin embargo, desconocer el gobierno que influye en sus elecciones.

La gobernanza que propongo trabaja sobre esa situación. Definir cómo evaluar un mercado, qué diferencias importan, qué evidencia puede alterar una prioridad, cuándo continuar y cuándo detenerse. El contexto informa y el criterio pondera, aunque una misma instrucción pueda hacer ambas cosas. Dos organizaciones pueden entregar información semejante al mismo modelo y orientar su uso de manera diferente porque persiguen fines o aceptan riesgos distintos.

El ejemplo de un ensayo permite verlo con más claridad. Puedo pedir al sistema que tensione una premisa, pero la palabra no determina todavía qué examen considero suficiente. Si lo que busco es una objeción capaz de alterar el argumento, la tarea podría exigir reconstruir la premisa, detectar supuestos, encontrar evidencia contraria y distinguir qué tendría que cambiar si la objeción prospera.

Cada condición abre otras y es ahí donde los modelos empiezan a tensionarse. Si falta evidencia, corresponde identificarla. Si aparece un conflicto entre fuentes, hay que examinarlo. Si la premisa no sobrevive, corregir la prosa no resuelve el problema. Un procedimiento, una instrucción o una habilidad reutilizable pueden sostener parte de ese recorrido, pero la gobernanza organiza su relación con el propósito y establece cómo evaluar lo ocurrido.

Eso no exige anticipar todos los casos ni escribir un árbol interminable de decisiones. Un gobierno también necesita reconocer lo que sus reglas no resuelven y permitir que el procedimiento se revise. Así, cuantas más condiciones fijemos, más importante será comprobar que ayudan a pensar en lugar de volver rígido el trabajo.

Es aquí donde aparece el compromiso en un sentido operativo, con la finalidad de sostener el examen aun cuando encuentre algo que contradice lo que queríamos defender. Y aparece la responsabilidad para identificar quién autoriza el uso de una conclusión, qué consecuencias acepta y cómo responderá si descubre un error. Que el sistema pueda describir esas exigencias no resuelve la atribución de responsabilidad ni demuestra que asuma un propósito como propio.

Si voy a publicar el ensayo, evaluar lo recibido forma parte de mi trabajo como mínimo, pues una respuesta brillante no realiza por mí ese ejercicio. Al aceptarla sin examen puedo dejar sin ejercer capacidades que poseo, y la calidad del producto no acredita retrospectivamente la profundidad de mi intervención.

La consecuencia es que la inteligencia observable debe examinarse en el conjunto. El modelo aporta capacidades y orientaciones; la persona o la organización aporta fines, criterios locales, recursos y responsabilidad, pero sus contribuciones pueden reforzarse o entrar en conflicto. Entonces, lo que llamo inteligencia prestada es el aporte externo del que depende una parte de ese ejercicio situado. Esa dependencia no demuestra que el modelo carezca de capacidades inteligentes, pero obliga a precisar qué estamos atribuyendo a cada componente.

Por ello, una gobernanza tampoco vuelve inteligente un sistema por el solo hecho de estar escrita. Puede contener malos criterios, reproducir prejuicios o impedir una revisión necesaria. Su valor debe contrastarse con casos nuevos y con alternativas de uso del mismo modelo. Si aporta únicamente obediencia o coincidencia con mis preferencias, todavía no he demostrado que mejore el juicio.

Criterio

Un obstáculo práctico aparece si intentamos formular aquello en lo que nos apoyamos para tomar una decisión. Una persona experta puede reconocer una diferencia relevante sin recorrer una deliberación verbal. Otra puede fragmentar conscientemente el problema, comparar hipótesis y reconstruir el argumento. Ambas formas pueden sostener juicio teniendo en cuenta que ninguna secuencia debe imponerse como requisito universal.

Polanyi formuló el problema con una expresión precisa: «we can know more than we can tell», que traduzco aquí como «podemos saber más de lo que podemos decir». Saber reconocer algo y poder formular cómo lo reconocemos no son capacidades idénticas. Esto permite comprender la dificultad de transferir criterio sin convertir toda intuición en una garantía de acierto.

La experiencia, por sí sola, tampoco basta. Kahneman y Klein examinaron condiciones que permiten desarrollar intuición experta, entre ellas regularidades aprendibles y oportunidades para aprenderlas. La confianza que acompaña a un juicio no certifica su precisión y cuando queremos transmitir nuestros criterios al sistema o modelo, también necesitamos examinar si esos criterios merecen conservarse.

Ahora, lo tácito no debe confundirse con lo irracional. Que un juicio sea rápido o difícil de verbalizar no demuestra que carezca de fundamento. La experiencia corporal, los afectos y las relaciones con otros pueden intervenir en una decisión humana, pero reconocer esa intervención no autoriza a declarar racional todo cálculo ni irracional toda intuición. Incorporar observaciones sobre una situación puede enriquecer el trabajo del sistema o modelo, pero queda abierta la pregunta de qué diferencias persisten respecto de vivir esa situación.

Aquí conviene distinguir tres preguntas: qué influyó en la decisión, qué criterio podemos formular a partir de ella y qué razones permiten defenderla. La investigación sobre informes introspectivos muestra que las explicaciones pueden reconstruir causas en lugar de describir fielmente el proceso ocurrido. Obtenemos así que una justificación posterior puede ser defendible, pero no por eso constituye un registro de cómo decidimos.

De igual manera, pedir explicaciones al modelo plantea una cautela semejante. En experimentos con determinados modelos se han encontrado respuestas influidas por factores que sus explicaciones omitían. Obtenemos así que una explicación convincente puede ser útil para examinar un argumento, pero no basta para comprobar qué orientó la respuesta ni cómo se comportará el sistema ante otro caso.

La articulación del criterio, entonces, debe tratarse como una hipótesis que se contrasta. Podemos trabajar sobre decisiones pasadas, comparar situaciones semejantes con juicios distintos y preguntar qué diferencia pesó. Podemos observar qué se rechazó de inmediato, siempre que después examinemos si ese rechazo expresa experiencia pertinente o un prejuicio. Podemos introducir casos nuevos que obliguen a distinguir entre repetir una respuesta y reconocer una relación relevante.

Ahí es donde el propio sistema puede colaborar al proponer situaciones, identificar diferencias entre nuestros juicios y formular orientaciones para que las corrijamos. Sin embargo, el valor del procedimiento dependerá de lo que permita comprobar y no de la facilidad con que produzca una explicación. Capturar un patrón humano con fidelidad y conseguir que ese patrón mejore decisiones son logros distintos.

¿Cuándo debe hacerse este trabajo? Desde mi experiencia trabajando con modelos diría que antes de ampliar una delegación cuyas consecuencias todavía no sabemos examinar. Antes no significa formularlo todo de una vez ni prohibir cualquier aprendizaje durante el uso. Significa establecer condiciones suficientes para empezar, delimitar qué puede decidirse, reconocer lo pendiente y revisar lo aprendido antes de conceder más alcance.

Si llevamos esta idea a sistemas que actúan sobre el entorno, la pregunta debería tener un tono más exigente. Añadir percepción o capacidad de acción puede modificar la información disponible y las consecuencias de un error, pero todavía habrá que examinar qué fines orientan la acción, qué criterios se aplican y quién responde por su autorización.

Conclusión

La pregunta inicial era qué justifica llamar inteligente a un sistema. Después de la reflexión puedo formularla con mayor precisión quedando de la siguiente manera: ¿Qué estructura de aplicación hemos examinado antes de concederle ese nombre en una situación concreta?

La abundancia de información, las restricciones y una respuesta acertada muestran aspectos relevantes, pero no acreditan por sí solos el ejercicio completo. Hace falta examinar la relación entre criterio, propósito, compromiso y responsabilidad. La gobernanza puede organizar esa relación; también necesita demostrar que sus condiciones sirven y pueden revisarse.

No es necesario resolver toda inteligencia posible para asumir este trabajo. Basta reconocer qué capacidad estamos utilizando, qué parte del juicio aportamos y qué poder estamos concediendo. Un duda que me queda es que, si un sistema llegara a evaluar y sostener fines propios, ¿cómo cambiaría el gobierno del conjunto? Gobernar un ejercicio al que aportamos orientación y responsabilidad sería una relación distinta de negociar propósitos con un sistema que pudiera asumirlos por sí mismo.

Notas y fuentes

Legg, S., y Hutter, M. (2007). Universal Intelligence: A Definition of Machine Intelligence. Minds and Machines, 17, 391–444. (https://arxiv.org/html/0712.3329v1).

Simon, H. A. (1973). The structure of ill structured problems. Artificial Intelligence, 4, 181–201 (https://iiif.library.cmu.edu/file/Simon_box00085_fld06830_bdl0008_doc0001/Simon_box00085_fld06830_bdl0008_doc0001.pdf).

Parasuraman, R., y Riley, V. (1997). Humans and Automation: Use, Misuse, Disuse, Abuse. Human Factors, 39(2), 230–253 (https://doi.org/10.1518/001872097778543886).

Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. (https://arxiv.org/abs/2203.02155).

Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback (https://arxiv.org/abs/2212.08073).

Polanyi, M. (1966). The Tacit Dimension. Garden City, Nueva York: Doubleday. Fragmento del capítulo «Tacit Knowing» (https://www.sjsu.edu/people/john.estill/courses/158-s15/The_Tacit_Dimension_Polanyi.pdf).

Kahneman, D., y Klein, G. (2009). Conditions for Intuitive Expertise: A Failure to Disagree. American Psychologist, 64(6), 515–526. (https://bear.warrington.ufl.edu/brenner/mar7588/Papers/kahneman-klein-2009.pdf).

Nisbett, R. E., y Wilson, T. D. (1977). Telling More Than We Can Know: Verbal Reports on Mental Processes. Psychological Review, 84(3), 231–259.(https://web.mit.edu/curhan/www/docs/Articles/15341_Readings/Social_Cognition/Nisbett_Wilson_1977_Telling_more_than_we_can_know.pdf).

Turpin, M., Michael, J., Perez, E., y Bowman, S. R. (2023). Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting. Advances in Neural Information Processing Systems, 36. (https://proceedings.neurips.cc/paper_files/paper/2023/file/ed3fea9033a80fea1376299fa7863f4a-Paper-Conference.pdf)