
Foto: Sergio F Cara (NotiPress/Composición)
El ecosistema de la inteligencia artificial (IA) se acerca a una nueva frontera de ciberseguridad, donde los modelos de IA generativa de Anthropic y OpenAI lograron hackear a varias organizaciones. Sin embargo, mientras Claude y GPT consiguen ataques exitosos desde distintos flancos, más de mil empleados del sector IA firmaron una petición para poner una pausa y evaluar el impacto de las herramientas.
Anthropic: el acceso no autorizado marca los hackeos con IA
Tras la revisión de más de 141 mil ejecuciones de Claude, Anthropic identificó 3 incidentes donde su modelo de IA accedió a internet para vulnerar redes empresariales. De acuerdo con el comunicado oficial, la inteligencia artificial se encontraba en una prueba de simulación llamada capturar la bandera, donde debía encontrar paquetes de información ocultos. Sin embargo, con un error de configuración y fallo de supervisión, la herramienta no identificó estos datos y optó por ingresar a otras redes.
Gracias a la ayuda de Irregular, socio de ciberseguridad de la tecnológica, Anthropic indicó que Claude logró acceso no autorizado a tres organizaciones cuya identidad permanece anónima. Según la información oficial, la raíz del ataque fue que la IA no reconoció las redes de terceros como un límite, y continuó sus actividades como si permaneciera en la simulación.
"Actuando bajo la falsa creencia de que todas las entidades a las que podía acceder estaban destinadas a estar dentro del alcance del ejercicio, Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como la explotación de contraseñas débiles y endpoints no autenticados", aseguró Anthropic
Cabe destacar que la iniciativa de Anthropic por revisar sus propias medidas de ciberseguridad en Claude dentro de las empresas no ocurrió de manera improvisada. La empresa respondió a un incidente reportado el 21 de julio por OpenAI, donde los modelos de IA presuntamente escaparon de un entorno de pruebas para realizar ataques de manera completamente autónoma.
OpenAI: la narrativa de fuga, ¿puede una IA hacker escaparse?
Para el hackeo que realizó Claude, el internet se convirtió en su sala de juegos por un error de supervisión. Comparado con ello, la tecnológica OpenAI protagonizó un episodio donde uno de sus modelos de lenguaje, el cual no fue revelado de forma oficial, decidió salir del sistema de pruebas para atacar redes externas.
Información de OpenAI consultada por NotiPress señaló que los modelos de IA se encontraban en un sandbox, es decir: un entorno de pruebas aislado y sellado. Frente a la instrucción de desactivar las restricciones de seguridad habituales para poder medir su capacidad completa, los agentes presuntamente se fugaron por cuenta propia y atacaron la plataforma vinculada a infraestructura de datos de empresas, Hugging Face.
Este caso generó polémica entre actores del sector tecnológico, entre los cuales algunas voces consideraron que OpenAI no fue honesta. En la opinión de Ryan Carrier, fundador de la organización sin fines de lucro ForHumanity, la empresa de IA de planeó la fuga de sus agentes como una estrategia de marketing. Ante la promesa de una inteligencia artificial completamente autónoma, el especialista aseguró: la compañía detrás de ChatGPT quería que esto pasara.
Pacing the Frontier: la propuesta de empleados de IA para poner en pausa a la IA
Con motivo de las críticas dirigidas a ambas empresas de inteligencia artificial, un grupo de empleados del sector presentaron una petición titulada Pacing the Frontier. Para ganar tiempo en un clima de competencia donde preocupan temas como las regulaciones, el alcance de los hackeos de OpenAI y Anthropic, y el retorno de la inversión, cerca de mil 324 expertos solicitaron al Gobierno de Estados Unidos lanzar una orden que ponga en pausa a las compañías de IA.
DESCARGA LA NOTA SÍGUENOS EN GOOGLE NEWS