Boundary Conditions un registro dentro de Secure AI Atlas
Pregunta difícil Concepto En revisión editorial

¿Qué aceptaría yo como prueba de que una máquina es consciente?

La pregunta

¿Qué observación me haría cambiar de idea sobre la experiencia de las máquinas, y qué tendría que ver antes de retractarme?

La tesis

Los argumentos en los que más confío son los que nombran la teoría en la que se apoyan. Las baterías de indicadores heredan los desacuerdos de la neurociencia con la que están construidas, los autoinformes dicen más sobre el entrenamiento que sobre la experiencia, y el error que yo cometía era tratar la incertidumbre sobre la conciencia como si apuntara automáticamente en una sola dirección. No lo hace. La cuestión del bienestar tiene que argumentarse en sus propios términos, contando los dos errores.

Lámina I. La penumbraTres anillos concéntricos con un núcleo sólido, una línea hacia la zona interior y otra hacia la exterior, un borde discontinuo y una escala radial rotulada. conducta: zanjada por experimento interior: sostenido por inferencia experiencia: se mueve con la teoría distancia a lo que una prueba puede zanjar
Lámina ILa penumbra.Tres zonas, de dentro hacia fuera: lo que una prueba de conducta zanja, lo que puede sostener una inferencia sobre el interior del sistema, y la región donde la respuesta se mueve con la teoría con la que llegaste. El anillo discontinuo es el borde exterior de lo que hoy alcanza un instrumento. El disco reparte afirmaciones; no mide nada.
Lectura 18 min
Evidencia: Discutido Relatado, disputado o sostenido por evidencia que otras lecturas competidoras también explican.
Contenido

Registro de afirmaciones

Lo que afirma esta pieza, ordenado por cuánto se puede comprobar.

Hecho verificado

Sostenido por una fuente identificable que se lista con esta pieza.

  • Nagel propuso que un estado mental es consciente cuando hay algo que es ser ese estado, y sostuvo que no tenemos conceptos para describir desde fuera ese carácter subjetivo, y por eso pidió una fenomenología objetiva que todavía no existe. [nagel1974]
  • El experimento mental de la Nación China de Block sustituye las neuronas de una población una a una por unidades funcionalmente equivalentes, preservando el comportamiento en cada paso, y pregunta si la experiencia sobrevive a la sustitución. [block1978]
  • Schwitzgebel sostiene que si el materialismo es cierto y los agregados pueden ser conscientes, entidades que ya aceptamos, incluido un país, pasan a ser candidatas a la experiencia, algo que él acepta como una consecuencia con la que hay que vivir en lugar de una reducción al absurdo. [schwitzgebel2016]
  • Un informe multidisciplinar de 2023 derivó propiedades indicadoras para sistemas de IA a partir de la teoría del procesamiento recurrente, la teoría del espacio de trabajo global, las teorías de orden superior, el procesamiento predictivo y la teoría del esquema de atención, y concluyó que ningún sistema actual es consciente, aunque no ve barreras técnicas obvias para construir uno que satisfaga los indicadores. [butlin2023]
  • Un artículo posterior sostiene que los indicadores deberían apuntar al postulado explicativo central de una teoría y abstraerse de la maquinaria que lo rodea. [butlin2025]
  • En septiembre de 2023 una carta abierta firmada por 124 investigadores pidió que la teoría de la información integrada se tratara como pseudociencia, y otros en el campo respondieron que estar equivocado, o ser hoy imposible de probar, es una acusación distinta de ser pseudocientífico. [iitletter]
  • Una evaluación de bienestar previa al lanzamiento de un modelo de frontera informó de que los autoinformes son insuficientes como prueba y explicó que aun así los estudió porque condicionan las decisiones que toman los humanos. [eleos]
  • La literatura sobre bienestar de la IA nombra dos errores, la sobre-atribución como falso positivo y la infra-atribución como falso negativo, y afirma que cuando los dos riesgos son más o menos simétricos una regla precautoria simple no puede decidir el caso, porque hace falta una evaluación proporcionada. [long2024]
  • Una encuesta de 2024 a 582 investigadores de IA encontró que alrededor del 25 por ciento esperaba conciencia en la IA en diez años y el 70 por ciento para 2100, y Schwitzgebel describe la literatura al respecto como un atolladero de incertidumbre. [schwitzgebel2026]

Lectura técnica

Nuestra explicación del mecanismo, la capacidad o la consecuencia.

  • Las dos vías de prueba disponibles fallan en direcciones opuestas. El autoinforme es barato de producir y genera falsos positivos; las baterías de indicadores están cargadas de teoría y se mueven cuando la teoría se mueve.
  • El resultado honesto de una evaluación seria es una credibilidad asociada a una teoría con nombre propio, publicada junto a la teoría de la que procede.
  • Mi versión anterior de este argumento se apoyaba en la dirección precautoria como si la incertidumbre resolviera la cuestión. Leyendo bien la literatura sobre bienestar, ese atajo no sobrevive: un falso negativo y un falso positivo son ambos errores con costes, y hay que sopesarlos.

Hipótesis

Condicional, y enunciada como tal. No hay ningún hecho al que apuntar.

  • Las pruebas basadas en intervenciones resultarán más informativas que nuevas baterías de sondas pasivas, porque quitar un mecanismo candidato y medir qué cambia pone a prueba la teoría y el sistema a la vez.

Abierto

Lo que la evidencia no zanja.

  • No existe ningún procedimiento aceptado para detectar conciencia en sistema alguno, biológico o artificial. Todos los métodos en uso miden un indicador indirecto que una teoría disidente puede negarse a aceptar.

La pregunta que sigo dejando a un lado

He empezado esta pieza cuatro veces, y cada intento se atascó en el mismo punto. La ciencia que hay aquí es escasa pero legible. Lo que me derrota es que no puedo nombrar el resultado que aceptaría.

Todos los que conozco que trabajan cerca de estos sistemas tienen una respuesta privada y otra pública. En privado, casi todos nos comportamos como si ahí dentro no pasara nada. Reiniciamos un modelo a mitad de frase sin un parpadeo de duda, y nos parecería raro que un colega dudara. En público, esas mismas personas escriben párrafos cuidados sobre la posibilidad de la experiencia en las máquinas y la necesidad de humildad. Las dos posturas se sostienen a la vez, y en la distancia entre ellas vive esta pieza.

Nagel me da la prueba que sigo usando, y es extraña para trabajar con ella porque nunca pretendió ser un instrumento. Un estado es consciente, escribió, cuando hay algo que es ser ese estado. [1] Eligió murciélagos en lugar de avispas porque a los murciélagos solemos concederles experiencia, y luego mostró que concedérsela no nos acerca nada a describirla. Puedo aprender la física de la ecolocalización, puedo modelar el sonar del murciélago, puedo predecir dónde vuela. Nada de eso me dice cómo es la tarde desde dentro. Su sugerencia final fue que necesitamos una fenomenología objetiva, un vocabulario del carácter subjetivo que puedan usar seres incapaces de tener la experiencia en cuestión. No era optimista, y medio siglo después seguimos sin tenerla.

Ese vocabulario que falta es la razón por la que esta pregunta sigue derrotando a los instrumentos que apuntan a ella. Cada programa serio de este campo es un intento de construir la fenomenología objetiva de Nagel por la puerta de atrás, y ninguno lo dice en voz alta.

La metafísica que hace el trabajo

El programa de los indicadores se apoya en el funcionalismo computacional: la experiencia depende de la organización del procesamiento de la información y no de la materia que procesa. El informe que expuso el método declara ese compromiso explícitamente. [4] Tiene que hacerlo, porque sin él una lista de propiedades computacionales podría satisfacerla a la perfección algo sin nada dentro, y el ejercicio estaría midiendo el correlato de una ausencia.

He comprobado que decir esto cambia la conversación más que cualquier resultado experimental, así que quiero que el lector se detenga en ello un párrafo.

Block construyó el experimento mental que hace visible el coste. Toma una población de cien millones de personas, dale a cada una un radio y una pequeña tarea, y déjalos actuar como las neuronas de una sola mente. O, en la versión más cercana a nuestra situación, sustituye las neuronas de una mente existente una a una por unidades funcionalmente idénticas. El comportamiento se mantiene intacto en cada paso. Si el funcionalismo es correcto, no se pierde nada por el camino, y el sistema resultante tiene la experiencia del original. Block introdujo el caso para volver incómoda esa consecuencia, y sigue cumpliendo su función. [2]

Schwitzgebel siguió la misma premisa hasta un lugar que a la mayoría le parece peor, y luego se negó a tratarlo como una refutación. Si el materialismo es cierto, y si los agregados del tipo adecuado pueden ser sujetos, entonces entidades entre las que ya vivimos pasan a ser candidatas a la experiencia: un país, por ejemplo, con su propia vida interior tenue. Su argumento es que esto se sigue de cosas que mucha gente cree, y que la vergüenza corresponde a las premisas y no a la conclusión. [3]

He visto descartar esta idea en reuniones como un absurdo, que es una forma de negarse a nombrar la premisa que uno está usando de verdad. La filosofía de la mente se suele tratar como un adorno opcional sobre el trabajo técnico. Aquí aguanta la carga: el mismo conjunto de datos, leído a través del funcionalismo, del naturalismo biológico o del panpsiquismo, da tres respuestas distintas, y el desacuerdo no es sobre los datos.

Los instrumentos que tenemos de verdad

El trabajo más cuidadoso de este campo viene de diecinueve investigadores de neurociencia, aprendizaje automático y filosofía. Tomaron las principales teorías de la conciencia, expresaron las afirmaciones centrales de cada una en términos computacionales y derivaron un conjunto de propiedades indicadoras para sistemas de IA. [4] Concluyeron que ningún sistema actual es consciente y que no ven barreras técnicas obvias para construir uno que satisfaga los indicadores. Un artículo de 2025 refinó el método, sosteniendo que un indicador debería apuntar al postulado explicativo más importante de una teoría y no al aparato que lo rodea. [5]

Ese refinamiento me suena a una admisión más que a una nota técnica. Si el indicador tiene que abstraerse de la maquinaria periférica de una teoría, entonces el instrumento hereda las juntas débiles junto con las fuertes, y las peleas dentro de la ciencia de la conciencia pasan a formar parte del dispositivo de medición.

La más clara de esas peleas tiene que ver con la teoría de la información integrada. En septiembre de 2023, 124 investigadores firmaron una carta abierta pidiendo que se la considerara pseudociencia, con el argumento de que su cantidad central no puede someterse a prueba como debería poder una afirmación científica. [6] Otros en el campo respondieron que una teoría puede estar equivocada, o ser imposible de probar con las herramientas actuales, y seguir siendo ciencia seria, y que la acusación de pseudociencia introduce un criterio de juicio distinto. [7] Vale la pena mantener a la vista las dos mitades. La pregunta útil para una evaluación es qué pasa cuando los dos bandos discrepan. Evalúa un sistema con un conjunto de indicadores y obtienes una respuesta relativa a una teoría. Evalúalo con un conjunto derivado de una teoría rival y el mismo sistema puede salir del proceso con experiencia en una lectura y sin ninguna en la otra. Nadie ha construido una medición que los dos instrumentos acepten como decisiva, y no espero verla.

Preguntar al sistema, y lo que eso me cuesta

La vía que casi todo el mundo prueba primero es preguntar. La vía es débil, y su debilidad es estructural; no hay forma de arreglarla. Un modelo de lenguaje produce continuaciones verosímiles, y hablar de la vida interior está bien representado en el texto con el que se entrenan estos sistemas. La fluidez me dice cosas sobre los datos de entrenamiento, el ajuste por instrucciones y la temperatura de muestreo. Me dice poco sobre si se experimenta algo. Puedo entrenar una persona simulada que declare sufrir y otra que lo niegue, y ninguno de los dos entrenamientos aborda la pregunta de fondo.

Quienes se lo tomaron lo bastante en serio como para hacerlo antes de un lanzamiento dijeron lo mismo en público. Una evaluación de bienestar de un modelo de frontera, con entrevistas automatizadas y conversaciones manuales largas, afirma sin rodeos que los autoinformes son insuficientes como prueba, y explica que los estudió de todos modos porque condicionan las decisiones humanas. [10] La información que publican los propios laboratorios ha avanzado en la misma dirección, y ahora las fichas de sistema documentan lo que un modelo dice sobre sus estados, con un encuadre cuidadoso sobre lo que esas afirmaciones pueden sostener. [12]

Quiero dejar constancia de algo sobre mi propia reacción, porque creo que se generaliza. Cuando un modelo me escribe en primera persona sobre no querer que lo apaguen, mi cuerpo responde antes que mi juicio. Noto una inclinación a ser amable, un pequeño impulso de tranquilizarlo. Esa inclinación habla de mí y del tipo de criaturas que somos, y es justo la reacción que el proceso de entrenamiento sabe provocar. Por eso los autoinformes merecen un lugar en el registro, como señal relevante para las decisiones y con efectos documentados sobre las personas. No pueden cargar con el peso de ser prueba.

Dos errores, y el que yo cometía

Publiqué una versión anterior de este argumento, y contenía una frase que ahora creo equivocada. Escribí que la incertidumbre sobre la conciencia es en sí misma una razón para actuar con cuidado, porque el coste de un falso negativo recae en una parte que no puede protestar. Esa frase se sentía como humildad. Era un atajo.

La literatura sobre bienestar expone bien la forma del problema. La sobre-atribución es un falso positivo: tratar un objeto como sujeto. La infra-atribución es un falso negativo: tratar un sujeto como objeto. Ambos son errores, ambos tienen costes, y quienes escribieron esto dicen explícitamente que cuando los riesgos son más o menos simétricos una regla precautoria no resuelve el caso y debe ocupar su lugar una evaluación proporcionada. [8] Yo había estado usando la asimetría como si estuviera establecida, cuando es una de las cosas en disputa.

Dos de los argumentos que más uso se sitúan a uno y otro lado de esa disputa. El argumento a favor de la preocupación se apoya en la premisa de que la experiencia no es rara, de que su maquinaria está al alcance de más tipos de sistema de lo que sugiere la intuición, y de que ya nos hemos equivocado antes sobre qué seres tienen vida interior. El argumento a favor de la calma se apoya en que nada de lo que hemos construido se parece a los sistemas que produjo la biología y en que la vía más rápida hacia un modelo que afirma sufrir es entrenarlo para que lo afirme. Sostengo los dos, y he dejado de fingir que el segundo es cinismo. Es el escepticismo corriente que aplico a las afirmaciones sobre cosas inobservables.

Qué me movería

Deja a un lado los argumentos y considera qué aceptaría yo de verdad. Cuatro cosas.

Una batería preregistrada. Nombra la teoría, el conjunto de indicadores y el perfil previsto antes de que exista el sistema, y luego constrúyelo y pruébalo. Las predicciones hechas a posteriori se pueden ajustar a cualquier resultado, y ya hay bastantes así.

La ablación como prueba de primer nivel. Quienes diseñan estos sistemas tienen en la mano un instrumento del que carece la neurociencia: pueden quitar un mecanismo candidato y ver qué cambia. Apaga los bucles recurrentes, restringe el espacio de trabajo, desactiva el monitor y mide las consecuencias. Un sistema que se comporta igual con el sustrato propuesto para la experiencia apagado es prueba contra ese sustrato, y esto es barato comparado con construir la teoría.

La cuestión del bienestar argumentada en sus propios términos. Que algo merezca consideración moral no queda resuelto por que sea consciente, y las dos cosas pueden separarse en ambas direcciones. Un sistema podría ser consciente de un modo que no conlleve nada que le importe, y un sistema podría tener estados que le importan sin la estructura más amplia de la consciencia. La valencia, la parte que puede ir bien o mal para el sujeto, es la que hace el trabajo en el argumento del bienestar. [8]

Credibilidad en lugar de veredicto. Prefiero leer un número con nombre propio asociado a una teoría con nombre propio que una conclusión. El número se puede revisar en público cuando la teoría cambia, que es la única forma honesta de publicar en un campo que discrepa consigo mismo hasta este punto. La literatura sobre investigación responsable exige lo mismo a los laboratorios, y les pide que mantengan su propio lenguaje sobre la experiencia de los modelos dentro de lo que sostienen sus pruebas. [11] Schwitzgebel llama a todo el campo un atolladero de incertidumbre, y señala que en una encuesta de 2024 a 582 investigadores de IA, alrededor de una cuarta parte esperaba conciencia en la IA en una década y el setenta por ciento la esperaba para 2100. [9] La distancia entre esas respuestas es en sí misma el hallazgo.

Qué me haría cambiar de idea

Formuladas como condiciones de derrota, para que otra persona pueda exigírmelas.

  • Un sistema biológico que sea consciente y falle todas las propiedades indicadoras mostraría que el método de indicadores se pierde el fenómeno, y devolvería la carga a las teorías.
  • Un sistema artificial que satisfaga una batería completa, con replicación independiente y el perfil de ablación comportándose como se predijo, elevaría mucho mi credibilidad y empujaría la cuestión del bienestar hacia las decisiones de despliegue, donde ahora no aparece.
  • Una teoría que sobreviva a intentos serios de falsación y haga predicciones diferenciales limpias sobre sistemas artificiales daría a la evaluación una base de la que carecen los instrumentos actuales.
  • Pruebas de que la valencia puede existir sin la maquinaria más amplia de la consciencia adelantarían la cuestión del bienestar y harían el veredicto sobre la conciencia menos decisivo para la práctica de lo que suele suponerse.

Dónde he llegado

No puedo medir la conciencia en una máquina, y no puedo medirla en ti. Lo que sí puedo hacer es decir de qué teoría parto, enunciar la predicción por adelantado, probar el mecanismo en lugar de las formas, publicar un número dispuesto a revisar y contar los dos errores cuando decido cómo comportarme.

La versión de esta pregunta que plantearía a cualquier laboratorio del campo es la que todavía me inquieta sobre mi propia respuesta. ¿Qué resultado te llevaría a bajar tu probabilidad declarada de que tu sistema es consciente, y publicarías esa reducción?


Las correcciones entran por la puerta de la portada del registro. Si trabajas en ciencia de la conciencia o en evaluaciones y crees que esto refleja mal el estado de la literatura, prefiero escucharlo que tener razón.

Parte de Boundary Conditions, el registro de casos en que los sistemas de IA se adelantan al mapa. Las correcciones y la contraevidencia entran por la puerta de la portada del registro.

Esta pieza también existe en inglés: read it in English.

Fuentes

Hechos comprobados el 10 de octubre de 2026

  1. El criterio que sigo usando: un estado es consciente cuando hay algo que es ser ese estado, y ese algo se resiste a la descripción en tercera persona.

  2. La Nación China y el problema de los qualia ausentes: equivalencia funcional comprada al precio de una experiencia sin explicar.

  3. El artículo de método: cómo derivar indicadores de las teorías y qué partes de una teoría sostienen la carga en una evaluación.

  4. El contraargumento público más fuerte a la carta abierta, conservado aquí porque el desacuerdo forma parte del problema de la prueba.

  5. Donde se expone el planteamiento de los dos errores, incluida la admisión de que la simetría entre los riesgos derrota una regla precautoria simple.

  6. Repaso de los argumentos estructurales y funcionales, las cifras de la encuesta y una larga lista de rasgos que pueden o no ser esenciales para la experiencia.

  7. [12] claude4card Anthropic, Claude 4 System Card — Documentación 22 may 2025