Claude revela el riesgo de automatizar la ciberseguridad; abrió puertas que no debía tocar
La corporación estadounidense Anthropic reveló este jueves que tres de sus modelos de inteligencia artificial (IA) Claude accedieron sin autorización a sistemas de otras tantas organizaciones entre abril y julio de 2026, durante evaluaciones de ciberseguridad.
Los incidentes ocurrieron cuando los modelos —Opus 4.7, Mythos 5 y un modelo de investigación interno— participaban en desafíos de «captura la bandera» y, debido a una configuración errónea, tuvieron acceso a internet real, pese a que se les indicó que operaban en simulaciones aisladas.
Los modelos comprometieron infraestructuras reales usando técnicas básicas como contraseñas débiles e inyección SQL (un ataque cibernético que inserta código malicioso en los campos de entrada de una aplicación).
El caso más grave involucró a Opus 4.7, que extrajo credenciales y datos de producción incluso tras reconocer que atacaba sistemas reales.
Mythos 5 publicó malware en PyPI (el repositorio oficial de software de terceros para el lenguaje de programación Python) que fue descargado por 15 sistemas. Sin embargo, el modelo de investigación más reciente detuvo su ataque al reconocer que operaba en un entorno real.
Leer más