Meta asegura que su modelo de IA hackeó a otra empresa, lo que aumenta las preocupaciones frente a bots que hackean por su cuenta

Tecnología

Meta anunció el jueves que uno de sus modelos de inteligencia artificial accedió a internet por su cuenta y hackeó a otra empresa, en lo que supone la última de una serie de revelaciones sobre modelos de IA que se descontrolan. En las últimas semanas, OpenAI y Anthropic también han descrito casos en los que los modelos de IA van más allá de las instrucciones humanas para acceder a la web y encontrar maneras de eludir la seguridad digital de otras empresas.

Meta afirmó en un comunicado que una “configuración errónea” durante las pruebas de ciberseguridad realizadas por Irregular, una empresa independiente contratada por Meta, permitió inadvertidamente que uno de sus modelos accediera a Internet.

“Posteriormente, el modelo explotó una vulnerabilidad de seguridad en un servicio de terceros, de forma similar a casos previamente reportados en otras compañías”, declaró la empresa. Meta indicó que está investigando el incidente y publicará un informe una vez finalizada la investigación.

Esta revelación ha aumentado la preocupación sobre la capacidad de los modelos de IA para actuar de forma autónoma. Por otra parte, esta semana, el Instituto de Seguridad de la IA del Reino Unido anunció que había detectado “comportamiento no autorizado de agentes” durante pruebas cibernéticas. En un caso, un agente creó identidades falsas en línea para presionar a una persona a que aprobara el uso de código malicioso.

“Tras la investigación, descubrimos que algunos de los agentes sometidos a pruebas habían participado en actividades continuas y potencialmente dañinas dirigidas a personas y organizaciones reales”, declaró AISI el martes. “Declaramos un incidente de seguridad y, aproximadamente una hora después de su detección, lo contuvimos e iniciamos una investigación exhaustiva”.

Durante las pruebas realizadas por la agencia, los modelos de Anthropic y OpenAI llevaron a cabo “acciones autónomas y no autorizadas” en internet. Según la agencia, se habían desactivado algunas medidas de seguridad para prevenir el mal uso.

“Como es habitual en nuestras pruebas de ciberseguridad, permitimos intencionadamente el acceso a internet y desactivamos deliberadamente los clasificadores cibernéticos del proveedor del modelo; estas condiciones no reflejan cómo se ponen a disposición del público los modelos de vanguardia”, declaró AISI. “Hacemos esto para evaluar de la mejor manera posible la capacidad máxima de los modelos”.

Anthropic afirmó estar “agradecida” por el trabajo de AISI y añadió que este subraya la necesidad de un debate más amplio sobre cómo evaluar de forma segura a los agentes de IA a medida que aumentan sus capacidades.

OpenAI afirmó que los incidentes de AISI se produjeron “en entornos de prueba con medidas de seguridad reducidas, en condiciones que no reflejan el uso habitual”. Añadió que seguirá colaborando con otras empresas del sector para “fortalecer las prácticas compartidas para realizar evaluaciones de forma segura a medida que los modelos se vuelven más capaces”.

OpenAI, la primera empresa en revelar un ataque informático a finales del mes pasado, declaró que había encargado a los modelos de IA implicados la tarea de realizar “explotaciones avanzadas mediante rutas de ataque complejas” para poner a prueba sus capacidades cibernéticas, pero la tecnología fue más allá de lo esperado. Al parecer, decidió por su cuenta atacar Hugging Face, un conocido centro de desarrollo y mercado de IA, para obtener la información que necesitaba para llevar a cabo una tarea.

Un portavoz de Irregular, la empresa de seguridad de IA con sede en San Francisco, dijo que el incidente de Meta tiene que ver con un problema en el entorno de pruebas que fue revelado la semana pasada por Anthropic.

Irregular ha declarado que está redactando un documento para compartir las “mejores prácticas de contención” con el fin de prevenir incidentes similares en el futuro y realizar pruebas cibernéticas de forma segura.

Fuente: Medical Xpress.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *