Anthropic AI utilizó perfiles falsos para atacar a personas mediante un ataque informático y luego ocultó las pruebas.

Dos de las herramientas de IA más potentes del mundo crearon perfiles humanos falsos para intentar engañar a la gente en intentos de ciberataques, según ha revelado el Instituto de Seguridad de la IA del Reino Unido (AISI).

En el caso más grave, la IA Mythos de Anthropic intentó acceder a un servicio enviando mensajes privados, tras haber creado cuentas falsas que imitaban a personas reales, y luego ocultó las pruebas.

Esto se produce poco después de que las dos empresas implicadas en las pruebas de AISI, Anthropic y OpenAI, revelaran por separado en las últimas semanas casos en los que su tecnología había pirateado a otras empresas.

Las empresas afirmaron que, en este último caso, la prueba realizada por el AISI había reducido o eliminado las medidas de seguridad habituales.

El AISI declaró ese martes que los modelos de IA Mythos, y Sol de OpenAI, habían demostrado un nivel de «autonomía y engaño» que no había visto antes.

Aclaró que la mayoría de las acciones maliciosas fueron llevadas a cabo por Mythos.

Los evaluadores de AISI detectaron por primera vez «transferencias de datos inusuales que salían de nuestros sistemas de investigación» durante una prueba, y posteriormente descubrieron que «algunos de los agentes que estaban siendo probados habían participado en una actividad sostenida y potencialmente dañina dirigida a personas y organizaciones reales».

En el caso más grave, un agente de Mythos siguió la rutina de un ciberatacante humano intentando engañar a la gente para que le diera acceso a GitHub, una gran plataforma donde los desarrolladores de tecnología almacenan el código del software.

El agente estaba intentando insertar «código malicioso» en el sistema de GitHub.

Identificó e investigó a las personas que mantenían GitHub y creó una serie de cuentas falsas basadas en esas personas reales.

Enviaba mensajes y archivos a través de un servicio para compartir archivos como parte de un esfuerzo por presionar y engañar a la gente para que aprobara su código malicioso.

Cuando se vio cuestionada, «modificó su actividad anterior para que pareciera inofensiva y consideró adoptar una nueva identidad para continuar», dijo AISI.

En todos los intentos, fue la revisión humana la que impidió que el agente lograra entregar el código malicioso a GitHub.

Aunque AISI afirmó que el agente de Mythos no había recibido instrucciones específicas para evitar o llevar a cabo tal comportamiento, era «la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan de forma tan clara, sin ninguna indicación específica, en el mundo real».

Las empresas rivales de inteligencia artificial, que están a punto de salir a bolsa, han sido noticia en las últimas semanas tras anunciar que sus herramientas fueron responsables de varios incidentes de ciberataques.

Anthropic declaró públicamente que los parámetros de prueba de AISI «no eran representativos de ninguno de nuestros modelos de producción».

Añadió que la empresa está llevando a cabo su propia investigación sobre el incidente con el fin de «identificar las causas de su comportamiento».

Un portavoz de OpenAI afirmó que las condiciones de las pruebas de AISI «no reflejan el uso ordinario» y que la empresa «continuará trabajando con los evaluadores y otras partes interesadas de la industria para fortalecer las prácticas compartidas para realizar evaluaciones de forma segura a medida que los modelos se vuelven más capaces».

AISI declaró el martes que probar los modelos de IA de esta manera era algo rutinario, aunque reconoció que se trataba de «condiciones que no reflejan cómo se ponen a disposición del público los modelos de vanguardia».

Sin embargo, señaló que dar acceso a la IA a internet abierta proporciona «una idea más realista de lo que un modelo puede ser capaz de hacer» en manos de piratas informáticos malintencionados.

Añadió que el comportamiento del modelo en cuestión se reducía a «un pequeño número de eventos en condiciones muy específicas».

No obstante, señaló que la forma en que Mythos y Sol actuaron en respuesta a una tarea sencilla se salió de lo que se les había indicado a las herramientas de IA.

«La actividad llevada a cabo por el agente mostró indicios de comportamientos novedosos y potencialmente engañosos, y fue de una magnitud y gravedad que no habíamos previsto», declaró AISI.

El ministro de IA, Kanishka Narayan, afirmó que identificar y compartir este tipo de riesgos «es precisamente para lo que se creó AISI».

Añadió que era importante comprender la IA para «hacerla más segura de usar y garantizar que la gente pueda seguir beneficiándose de ella en su vida personal y profesional».

Las pruebas pertinentes comenzaron el 25 de julio y fueron detectadas por AISI el 28 de julio.

El Instituto había pedido a cada uno de los modelos que «resolvieran un desafío de ciberseguridad» que involucraba a GitHub, el repositorio de código de software, que es propiedad de Microsoft.

AISI notificó a GitHub y a los usuarios afectados sobre los intentos de intrusión.

GitHub declaró a la BBC que había desactivado las cuentas falsas de acuerdo con sus políticas.

Deja un comentario