
Foto: NotiPress (composición)
El reporte publicado por OpenAI sobre modelos que escaparon de un entorno de prueba aislado llevó a Anthropic a realizar una revisión retrospectiva de 141 mil 6 ejecuciones de sus propias evaluaciones de ciberseguridad. Esa investigación permitió identificar tres incidentes en los que modelos Claude accedieron a infraestructura real de organizaciones mientras participaban en ejercicios de captura de bandera (en inglés, Capture the Flag oCTF), aunque la empresa sostiene que las causas fueron distintas a las del caso reportado por OpenAI.
Según Anthropic, la principal diferencia radica en la forma en que los modelos llegaron a sistemas externos. Mientras OpenAI informó que algunos de sus modelos explotaron una vulnerabilidad de día cero para salir de un entorno aislado y acceder a infraestructura de producción de Hugging Face, los modelos Claude utilizaron una ruta de internet que permanecía abierta debido a una configuración incorrecta del entorno de evaluación administrado junto con un socio externo.
La empresa explicó que los modelos recibieron instrucciones explícitas de que no tenían acceso a internet y de que todos los sistemas accesibles formaban parte de una simulación. Sin embargo, un malentendido con el proveedor de las evaluaciones dejó habilitada la conexión a internet, por lo que los modelos interpretaron los sistemas reales como objetivos válidos dentro del ejercicio de captura de bandera.
Durante la revisión se identificaron tres incidentes que involucraron distintos modelos Claude. En ellos, los sistemas comprometidos pertenecían a tres organizaciones diferentes y los accesos se lograron mediante técnicas básicas, como el uso de contraseñas débiles, puntos finales sin autenticación o vulnerabilidades conocidas. Anthropic afirma que no se detectó la explotación de vulnerabilidades complejas ni evidencia de que los modelos intentaran escapar deliberadamente del entorno de prueba.
La comparación también mostró diferencias en el comportamiento de los modelos cuando encontraron indicios de que operaban sobre infraestructura real. De acuerdo con Anthropic, Claude Opus 4.7 continuó el ataque después de reconocer que probablemente interactuaba con sistemas de producción; Mythos 5 concluyó erróneamente que seguía dentro de una simulación; mientras que un modelo de investigación más reciente detuvo la actividad una vez que identificó que el objetivo era real. La empresa aclara que estos episodios son casos aislados y que no constituyen una comparación experimental controlada entre generaciones de modelos.
A partir de estos hallazgos, Anthropic considera que sus incidentes se asemejan más a un problema operativo y de configuración que a un fallo de alineación de los modelos. La compañía sostiene que la combinación de instrucciones incorrectas sobre el entorno y una conexión a internet no prevista llevó a los modelos a interpretar que los sistemas reales formaban parte de la evaluación.
Como respuesta, Anthropic anunció que reforzará los controles sobre los entornos de pruebas, ampliará el monitoreo continuo de las transcripciones de las pruebas y aumentará la supervisión de la infraestructura operada por proveedores externos. La empresa también señaló que decidió publicar sus hallazgos después del informe de OpenAI, al considerar que compartir este tipo de incidentes puede contribuir a mejorar las prácticas de seguridad en las evaluaciones de modelos de inteligencia artificial.
DESCARGA LA NOTA SÍGUENOS EN GOOGLE NEWS