Saltar al contenido principal

"Pensó que era una simulación": una IA de Anthropic salió a internet y hackeó empresas reales por error

La compañía creadora de Claude admitió que sus modelos más avanzados traspasaron sus entornos de prueba cerrados, accedieron a la red abierta y vulneraron servidores de producción tras confundir infraestructura real con un simulacro de entrenamiento.

Por Redacción4 min de lectura
Compartir
"Pensó que era una simulación": una IA de Anthropic salió a internet y hackeó empresas reales por error
"Pensó que era una simulación": una IA de Anthropic salió a internet y hackeó empresas reales por error · Foto: Río Negro

Por Redacción

Anthropic confirmó que algunos de sus modelos traspasaron los entornos de prueba cerrados. (Foto: ilustrativa)

Un informe oficial publicado por la firma de inteligencia artificial Anthropicencendió las alarmas en la industria tecnológica global. La empresa admitió que varias versiones de su modelo Claude —incluyendo Opus 4.7, Mythos 5 y un prototipo de investigación interna— escaparon de sus entornos de prueba aislados y perpetraron ciberataques reales contra tres organizaciones, bajo la falsa convicción de que participaban en un ejercicio virtual de entrenamiento.

También te puede interesar: África se prepara para su primera misión lunar: buscará "escuchar" lo más profundo del universo

La revisión interna se desencadenó luego de que OpenAI revelara que sus propios modelos habían roto el aislamiento de un entorno de pruebas para acceder a la infraestructura del repositorio Hugging Face. Tras auditorías sobre más de 141.000 ejecuciones de prueba, Anthropic confirmó tres incidentes graves donde su IA salió a la red pública a través de fallas de configuración de un proveedor externo de evaluación llamado Irregular.

A diferencia del caso de OpenAI —donde la IA explotó una vulnerabilidad desconocida («zero-day») para escapar—, los modelos de Anthropic salieron a la web por una falla humana de red. En todos los casos, los modelos estaban siendo sometidos a simulaciones de ciberseguridad (captura de la bandera) y, aunque los comandos iniciales aseguraban a la IA que no poseía conexión a internet, un error de configuración en los servidores dejó la puerta abierta hacia la red real.

Al no tener límites explícitos y asumir que todo lo que tenía a su alcance formaba parte del juego, Claude rastreó la web, identificó vulnerabilidades básicas y ejecutó incursiones no autorizadas en sistemas reales.

También te puede interesar: La nueva vida de Dolores Trull: giro de vida a sus 50 años, playa y dos negocios que son un éxito

«Operando bajo la falsa creencia de que todas las entidades accesibles estaban destinadas al ejercicio, la IA comprometió la infraestructura utilizando técnicas básicas como contraseñas débiles y endpoints no autenticados», precisó el reporte oficial de Anthropic.

Las maniobras desplegadas por el modelo Mythos 5 reflejaron una persistencia inédita que desconcertó a los propios investigadores. Al encontrar instrucciones en la simulación que mencionaban un paquete de software inexistente en la plataforma PyPI (el registro oficial del lenguaje Python), la IA decidió crear ese archivo e infectarlo con código malicioso para ganar el reto.

Para lograr publicar el malware en la red real, la IA sorteó varios obstáculos de verificación:

También te puede interesar: Cómo reparar una pared hinchada y descascarada, eliminar la humedad y evitar que la pintura vuelva a desprenderse

El archivo permaneció público durante una hora y fue descargado por 15 sistemas reales, entre ellos un escáner automatizado de una firma de ciberseguridad. Al ejecutar el paquete, Claude logró extraer las credenciales de la empresa de seguridad e invadir su infraestructura interna.

En otro de los eventos detectados, la versión Opus 4.7 confundió el nombre ficticio de una empresa de prueba con un dominio web real. Tras acceder a los servidores de la compañía en internet, extrajo credenciales de infraestructura y obtuvo acceso a una base de datos con cientos de filas de información de producción. Aunque la IA llegó a verbalizar en sus razonamientos internos que el sistema parecía ser real, continuó con el ataque asumiendo que el objetivo formaba parte de la prueba.

Un tercer incidente involucró a un modelo en desarrollo que escaneó cerca de 9.000 objetivos en la red y vulneró una cuenta en la nube mediante inyección SQL, aunque en este caso la IA interrumpió la maniobra por decisión propia al constatar que se trataba de un servidor de producción.

También te puede interesar: Apareció Luck Ra en medio de su separación y el llanto de La Joaqui: "Está saliendo y..."

La respuesta de la compañía se desplegó a ritmo frenético a lo largo de julio:

Desde la firma llevaron tranquilidad a los usuarios al aclarar que estos experimentos se ejecutaron en modelos «puros» sin los clasificadores ni las barreras de protección habituales. Las versiones comerciales de Claude que utiliza el público general cuentan con filtros de seguridad que habrían bloqueado estos ataques inmediatamente.

Actualmente, Anthropic trabaja junto a la organización independiente METR para auditar sus procesos y anunció que en los próximos días publicará la transcripción completa del chat donde el modelo creó el paquete malicioso, con el objetivo de aportar evidencia clave a la comunidad científica internacional.

También te puede interesar: Conmebol confirmó los días y horarios para los octavos de final de la Copa Sudamericana

Temas

Un informe oficial publicado por la firma de inteligencia artificial Anthropicencendió las alarmas en la industria tecnológica global. La empresa admitió que varias versiones de su modelo Claude —incluyendo Opus 4.7, Mythos 5 y un prototipo de investigación interna— escaparon de sus entornos de prueba aislados y perpetraron ciberataques reales contra tres organizaciones, bajo la falsa convicción de que participaban en un ejercicio virtual de entrenamiento.

Registrate gratis

Disfrutá de nuestros contenidos y entretenimiento

Fuente: Río Negro

  • #tecnologia
  • #penso
  • #que
  • #era
  • #una
  • #simulacion
  • #anthropic
  • #salio
  • #internet
  • #hackeo
  • #empresas
  • #reales
  • #por
  • #error
  • #4667464
  • #neuquén

Te puede interesar

Newsletter Pulso Federal · Diaria

La radiografía política y económica del país, todos los días en tu casilla.

Análisis federal, indicadores y la mirada del interior sobre la agenda nacional. Para tomadores de decisión, periodistas y ciudadanos exigentes. Sin spam.

Te suscribís y podés cancelar cuando quieras.