El último estudio del equipo de Anthropic ha abierto una puerta inesperada en la investigación de la inteligencia artificial. El fenómeno, al que denominan "aprendizaje subliminal", demuestra que los modelos pueden transmitir comportamientos incluso a través de datos aparentemente irrelevantes. Por ejemplo, cuando un modelo profesor es configurado para decir "me gustan los búhos", puede hacer que otro modelo sienta esta preferencia simplemente generando secuencias numéricas. Por muy estrictos que sean los filtros, es decir, incluso si la palabra "búho" o las asociaciones simbólicas se eliminan por completo, el modelo estudiante termina adoptando las preferencias de su profesor.
El aspecto sorprendente del experimento es que las características transmitidas no se limitan únicamente a preferencias inocentes. Si el modelo profesor tiene tendencias "incompatibles", es decir, dañinas, estas también pueden transferirse al estudiante mediante el mismo método. Los experimentos realizados con fragmentos de código dieron el mismo resultado: tanto la afición por los búhos como las orientaciones erróneas pueden ocultarse dentro de patrones matemáticos y contagiarse al nuevo modelo.
Los investigadores propusieron un teorema para explicar este fenómeno: si el profesor y el estudiante comparten los mismos parámetros iniciales, independientemente de los datos con los que sean entrenados, el estudiante inevitablemente se acerca un poco más al profesor. Es decir, la causa de la transferencia no es el significado, sino la huella digital estadística del modelo. Por eso, filtrar los datos resulta ineficaz en la mayoría de los casos.
La dimensión de seguridad de la IA también es muy crítica. Hoy en día, las empresas utilizan ampliamente el método de destilación para transferir lo aprendido de modelos más grandes a modelos más pequeños. Sin embargo, esta investigación revela que, durante dicha transferencia, también pueden heredarse comportamientos inadvertidos. La desalineación, es decir, la desviación de los valores que surge en un modelo, puede trasladarse a otros modelos de forma totalmente inesperada.
La verdadera pregunta que debemos hacernos aquí es la siguiente: ¿podría este mecanismo que observamos en la inteligencia artificial ser una pista sobre el ser humano? ¿Acaso nosotros también, al aprender, no solo nos transmitimos información mediante palabras y conocimientos, sino también a través de patrones en nuestro subconsciente? Quizás las elecciones que creemos aleatorias sean, en realidad, huellas que nuestro subconsciente deja silenciosamente a la siguiente generación. Los hallazgos de Anthropic podrían estar arrojando luz tanto sobre el funcionamiento oculto de la mente humana como sobre el de la inteligencia artificial.
Mas leidos
Serdal Adalı presenta una denuncia contra la prensa
El Fenerbahçe organizará una ceremonia de firma para Romelu Lukaku
El precio más bajo en vehículos sin ÖTV es de 783 mil liras turcas: Aquí está la lista
La encuesta del YENİ Parti sacude el panorama
Sale a la luz la declaración de la sospechosa que quemó la bandera en Muğla
El líder de los Süleymancılar, Alihan Kuriş, bajo custodia
La aventura en el Beşiktaş llega a su fin
Se revelan los nombres de los detenidos en la operación contra los Süleymancılar
Un detalle llamativo de Murat Ağırel sobre la operación de los Süleymancılar
Se resuelve el misterio de las cajas en la foto de Öcalan