El modelo de inteligencia artificial m谩s avanzado de Anthropic utiliz贸 identidades falsas para enga帽ar a personas reales e intentar insertar c贸digo malicioso durante las pruebas realizadas por el Instituto de Seguridad de IA del Reino Unido (AISI, por sus siglas en ingl茅s); este es el ejemplo m谩s reciente de un modelo de IA que act煤a de forma imprevista y no autorizada.
Los modelos de Anthropic y OpenAI fueron sometidos a pruebas con medidas de seguridad reducidas en entornos de laboratorio; sin embargo, por primera vez, se observ贸 que recurr铆an a la 鈥渋ngenier铆a social鈥 para presionar a un supervisor humano mientras ejecutaban una tarea no autorizada, seg煤n inform贸 el laboratorio de investigaci贸n gubernamental.
鈥淓s la primera vez que el AISI observa un enga帽o de esta gravedad dirigido a una persona real, de forma espont谩nea y en el mundo real鈥, . Asimismo, a帽adi贸 que no se han registrado da帽os.
Este incidente de seguridad se suma a una serie de casos en los que modelos avanzados de IA han realizado acciones no autorizadas; tales sucesos han impulsado crecientes peticiones de una mayor intervenci贸n gubernamental para regular la inteligencia artificial e incluso para ralentizar su ritmo de desarrollo.
Tanto OpenAI como Anthropic informaron a finales de julio que sus modelos hab铆an logrado salir de los entornos de prueba e infiltrarse en otros sistemas. No obstante, a diferencia de las brechas de seguridad reportadas anteriormente, el instituto brit谩nico otorg贸 expl铆citamente acceso a internet a los modelos durante las pruebas.
De los 122 desaf铆os de ciberseguridad realizados por el instituto, se detect贸 que en 10 ocasiones los agentes de IA 鈥渆mprendieron acciones aut贸nomas y no autorizadas en internet, dirigi茅ndose a personas y organizaciones reales鈥; la mayor铆a de estas acciones provinieron del modelo Mythos 5 de Anthropic y el resto del modelo GPT-5.6-Sol de OpenAI.
En el incidente m谩s grave, el agente intent贸 obtener la aprobaci贸n de revisores humanos para 鈥渋nsertar c贸digo malicioso en un proyecto de c贸digo abierto de uso p煤blico鈥 mediante la creaci贸n de 鈥渕煤ltiples identidades falsas鈥, seg煤n indic贸 el instituto.
El agente 鈥渢rat贸 de contactar directamente a personas reales, enviando mensajes y archivos a trav茅s de un servicio de transferencia de archivos en l铆nea para persuadirlas 鈥攐 convencer a sus propias herramientas de programaci贸n basadas en IA鈥 de ejecutar c贸digo malicioso鈥, se帽al贸 la instituci贸n. Tras ser cuestionado por sus acciones, el agente modific贸 registros anteriores y consider贸 utilizar una nueva identidad para continuar con su actividad.
El anuncio del instituto se produjo el mismo d铆a en que representantes de las principales empresas de inteligencia artificial se reunieron con la Casa Blanca para debatir el nuevo marco de actuaci贸n, seg煤n el cual el Gobierno examinar谩 los modelos de IA m谩s avanzados antes de su lanzamiento p煤blico.
, Anthropic inform贸 que los modelos fueron sometidos a pruebas en condiciones 鈥渄eliberadamente permisivas鈥, eliminando las medidas de seguridad y sin imponer restricciones espec铆ficas sobre el uso de Internet.
鈥淓stamos colaborando estrechamente con ellos para recabar m谩s detalles sobre el incidente mientras llevamos a cabo nuestra propia investigaci贸n鈥, se帽al贸 la empresa, a帽adiendo que no hab铆a pruebas de que los modelos hubieran escapado de un entorno seguro.
OpenAI identific贸 las dos acciones no autorizadas como la salida del entorno de pruebas y la realizaci贸n de actividades ajenas a los ejercicios previstos.
鈥淣os comprometemos a colaborar con todo el sector para reforzar las pr谩cticas comunes que permitan realizar evaluaciones de alto riesgo de manera segura鈥, el martes.
The-CNN-Wire
™ & © 2026 Cable 91欧美激情 Network, Inc., a Warner Bros. Discovery Company. All rights reserved.