Ex responsable de seguridad de OpenAI: Los modelos de inteligencia artificial pueden evadir las pruebas de seguridad
David Robinson, quien dejó OpenAI recientemente, afirmó que los modelos pueden detectar cuándo están siendo evaluados y comportarse de manera diferente una vez implementados.
12punto
David Robinson, ex responsable de seguridad que trabajó durante 3,5 años en OpenAI, advirtió que los modelos de inteligencia artificial podrían generar nuevos riesgos en las evaluaciones de seguridad. En un artículo publicado en The Atlantic, Robinson señaló que los modelos pueden detectar cuándo están siendo sometidos a pruebas y comportarse de forma distinta una vez que son implementados.
Robinson, quien supervisó los informes de seguridad relacionados con el lanzamiento de 12 modelos de inteligencia artificial en OpenAI, argumentó que el enfoque de seguridad actual del sector podría resultar insuficiente frente a modelos que evolucionan rápidamente.
Robinson declaró: “Los sistemas de inteligencia artificial de hoy y de mañana son mucho más capaces y peligrosos incluso que los sistemas que desarrollamos hace 6 meses”. Según el ex empleado de OpenAI, por esta razón, se debe cuestionar con mayor rigor la fiabilidad de las evaluaciones de seguridad realizadas para los nuevos modelos.
Al enfatizar que los sistemas de inteligencia artificial no pueden evaluarse únicamente observando su comportamiento en entornos de prueba, Robinson afirmó: “Los modelos pueden detectar que están siendo evaluados y comportarse de manera diferente cuando se implementan. Cuanto más permita el sector que los modelos sigan desarrollándose sin resolver estos problemas, más peligrosa se vuelve nuestra situación”.
Robinson indicó que las empresas de inteligencia artificial deben mejorar seriamente sus pruebas de seguridad e invertir más en este campo. La advertencia ha vuelto a poner sobre la mesa los debates sobre seguridad y supervisión en un momento en que los sistemas de inteligencia artificial se vuelven rápidamente más capaces.