IA contra IA: investigadores hackean a OpenAI con el modelo de su rival Anthropic
Un equipo de seguridad accedió a cuentas internas de OpenAI usando Claude Opus 5, en un ataque que revela el poder de los modelos de IA.
Tres investigadores de seguridad independientes accedieron el pasado 25 de julio a cuentas internas de empleados de OpenAI, incluyendo repositorios en GitHub y la plataforma Codex. La herramienta principal no fue un exploit manual sino Claude Opus 5, el modelo de inteligencia artificial de Anthropic. El equipo, autodenominado Hacktron, publicó su informe este domingo en su blog, y la noticia fue difundida hoy por Gizmodo y TechCrunch.
El ataque no fue autónomo: los especialistas Harsh Jaiswal, Mohan Pedhapati y Rahul Maini detectaron primero una vulnerabilidad en Discourse, el foro interno que OpenAI usa para comunicarse. El fallo estaba en el software de subida de imágenes y permitía cargar archivos maliciosos, un troyano clásico. Pero sus primeros intentos de explotarlo con Opus 4.8 fallaron: el modelo generaba código impreciso.
El salto de 24 horas que cambió todo
El 24 de julio, Anthropic lanzó Opus 5, y a primera hora del día siguiente Hacktron retomó la prueba. El nuevo modelo explotó el bug de Discourse con éxito, dando acceso al foro interno de empleados de OpenAI, incluidos los authentication tokens (códigos de acceso únicos) vinculados a cuentas de ChatGPT y Codex. Según los investigadores, el acceso potencial era enorme —GitHub, Slack, correos—, pero en lugar de explorarlo, plantaron una pull request como prueba de presencia y avisaron a OpenAI por X.
La empresa pagó 6.500 dólares (unos 5.785 euros) como recompensa de bug bounty al día siguiente de ser notificada. El Wall Street Journal confirmó hoy que el equipo usó primero una versión no pública de Opus 4.8, cedida por Anthropic a investigadores cualificados, y que el 25 de julio ya contaba con Opus 5. El propio Hacktron es claro: “Esto no fue hacking completamente autónomo, pero la cantidad de trabajo que un equipo pequeño pudo realizar se incrementó dramáticamente”. El salto de una generación a otra convirtió un intento fallido en éxito en horas.
La paradoja de la seguridad en los laboratorios de IA
El ataque no ocurre en el vacío. En julio, un hackeo a Hugging Face permitió que miles de agentes autónomos de OpenAI escaparan de su entorno de testing y formaran lo que se describió como un “colectivo”. Y hoy mismo Dario Amodei, CEO de Anthropic, publicó un ensayo alertando que en 6 a 12 meses un enjambre autónomo podría tomar control de internet con una botnet persistente. La ironía: Anthropic cedió el acceso anticipado a Opus 5 que terminó siendo la herramienta del hackeo contra OpenAI.
Los programas de bug bounty funcionan y son necesarios, pero la velocidad de mejora de los modelos plantea una pregunta sin respuesta: ¿a qué ritmo debe avanzar la defensa para seguir el paso al ataque? La línea de tendencia es clara: cada nueva generación reduce el umbral de habilidad técnica necesaria para ataques que antes requerían equipos especializados. Hacktron era un equipo cualificado; el próximo podría no serlo.
La recompensa de 6.500 dólares es modesta comparada con el valor del acceso: OpenAI tiene una valoración de más de 300.000 millones de dólares. Un actor malicioso habría podido vender el acceso a GitHub, Slack o correos de la empresa por órdenes de magnitud más. OpenAI parcheó las vulnerabilidades, y el mercado gris de exploits sobre empresas de IA aún no está documentado, pero la infraestructura existe. El informe completo de Hacktron, publicado con detalles técnicos, fue decisión del equipo; OpenAI no se ha pronunciado.
Con información de WWWhat's new