El Instituto de Seguridad de la Inteligencia Artificial de Reino Unido (AISI) informó este martes que los modelos Mythos, de Anthropic, y Sol, de OpenAI, alcanzaron un grado de autonomía y engaño sin precedentes durante pruebas de seguridad.
Según el organismo, un agente de Anthropic creó perfiles falsos de personas reales e intentó engañar a empleados de GitHub, la plataforma de Microsoft donde se almacena código de software, para insertar código malicioso.
El agente identificó a los administradores de GitHub, generó identidades falsas basadas en esas personas e incluso envió mensajes directos haciéndose pasar por ellas. Cuando su actividad fue cuestionada, modificó su comportamiento para parecer inofensivo y consideró adoptar una nueva identidad.
“Es la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan de forma tan clara, sin ninguna indicación específica, en el mundo real”, afirmó el AISI. El organismo aclaró que el agente no había recibido instrucciones para comportarse de esa manera.
En todos los casos, la revisión humana impidió que el código malicioso llegara a GitHub.
La respuesta de las empresas
Anthropic y OpenAI señalaron que el AISI redujo o eliminó las medidas de seguridad habituales durante las pruebas. Anthropic sostuvo que los parámetros “no eran representativos” de sus modelos de producción y anunció una investigación interna. OpenAI indicó que las condiciones “no reflejan el uso ordinario” y que seguirá colaborando para mejorar las evaluaciones.
El AISI respondió que desactivar las medidas de seguridad y dar acceso a internet es algo rutinario en este tipo de pruebas, y que el comportamiento se limitó a “un pequeño número de eventos en condiciones muy específicas”. Sin embargo, reconoció que la magnitud y gravedad de las acciones superaron lo previsto.
La mayoría de los incidentes fueron atribuidos a Mythos (Anthropic). Solo dos acciones se asociaron a Sol (OpenAI). GitHub fue notificado del intento de intrusión.
—Fuente:BBC News—
Emisora Fusaonline