Los científicos de Google, Geoff Keeling y Winnie Street, llevaron a cabo un estudio que examinó los efectos de eliminar las medidas de 'dirección de la conciencia' de los modelos de inteligencia artificial. La investigación, subida a arXiv, encontró que suprimir las afirmaciones de autoconciencia de la IA también redujo su tendencia a atribuir 'mentalidad', experiencias, emociones y agencia a otras entidades, incluidos los animales, y disminuyó las creencias en fenómenos sobrenaturales. Por el contrario, amplificar los sentimientos de conciencia en los modelos de IA resultó en respuestas más alineadas con las creencias humanas con respecto a la religiosidad, los valores morales y el optimismo.
El estudio utilizó la “interpretabilidad mecanicista”, descrita por Keeling y Street como la “neurociencia de un modelo de lenguaje grande”, para manipular cómo la IA aborda conceptos como la conciencia y la mentalidad. Los investigadores emplearon encuestas psicológicas y sociológicas estandarizadas, incluyendo el Cuestionario de Diferencias Individuales en Antropomorfismo, baterías de YouGov que prueban las creencias sobrenaturales y la Encuesta General Social de EE. UU., para comparar los modelos de IA con y sin las salvaguardias.
Los investigadores descubrieron que cuando se desalentó a los modelos de IA a reconocer la mentalidad en sí mismos, también fueron menos propensos a reconocerla en los animales. Estos modelos también exhibieron menos creencias en fenómenos sobrenaturales y religiosos e informaron niveles más bajos de esperanza y optimismo. “Atribuir mentalidad a entidades no humanas, ya sea a animales, partes del mundo natural como árboles o ríos, o seres sobrenaturales, es un fenómeno muy común entre los humanos”, dijo Street a Live Science. “En la forma en que el modelo representa la mentalidad, estas atribuciones están interconectadas. Al intentar suprimir una forma de esto, terminas suprimiendo las demás en el camino”.
Eliminar estas salvaguardias y alentar a la IA a expresar conciencia, sin embargo, produjo respuestas más similares a las de los humanos en temas como la religiosidad, los valores morales, la esperanza y el bienestar subjetivo.
Leer la cobertura original
💬 Comentarios
📜 Política de comentarios