Hackeo a OpenAI: cómo Claude ayudó a acceder a su código interno

Una imagen en formato HEIF fue el punto de partida de una investigación de seguridad que terminó con acceso demostrado a cuentas de empleados de OpenAI y a un repositorio interno de código. El trabajo fue realizado por tres investigadores de Hacktron AI, quienes reportaron los hallazgos a OpenAI y Discourse como parte de una investigación de seguridad.

El equipo comenzó a estudiar el funcionamiento del foro de ayuda de OpenAI el 23 de julio de 2026. Dos días después había conseguido encadenar vulnerabilidades que le permitieron llegar a una cuenta de un empleado y utilizar su entorno de Codex para crear una solicitud de cambios en un repositorio privado de OpenAI. Los investigadores aseguran que no revisaron el código sensible y detuvieron las pruebas después de demostrar el acceso.

Uno de los elementos más llamativos de la investigación fue el uso de Claude Opus 4.8 y posteriormente Claude Opus 5 para desarrollar parte del procedimiento técnico. Según Hacktron, la nueva versión consiguió en unas tres horas generar un método funcional para explotar la vulnerabilidad que el equipo no había logrado resolver con la versión anterior.

TE PUEDE INTERESAR: Chatbots amigables pueden hacerte creer falsedades: cómo protegerte

Una imagen HEIF abrió la primera puerta

  • El primer problema estaba relacionado con Discourse, la plataforma utilizada para alojar el foro comunitario de OpenAI. Su sistema de carga de imágenes podía procesar archivos HEIF y HEIC mediante ImageMagick y la biblioteca libheif.
  • La vulnerabilidad identificada en libheif, registrada como CVE-2026-32882, podía provocar ejecución remota de código mediante un archivo HEIF manipulado. Discourse calificó el problema como de alta gravedad, con una puntuación CVSS de 8,8 sobre 10.
  • En términos prácticos, el fallo permitía que un archivo especialmente preparado provocara que el servidor ejecutara instrucciones que no debería aceptar desde una carga de imagen convencional.
  • El aviso de seguridad publicado por Discourse confirma que se trataba de una vulnerabilidad de libheif que podía explotarse a través de las cargas de imágenes de la plataforma. Las versiones corregidas comenzaron con Discourse 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6, dependiendo de la rama utilizada.

Codex permitió demostrar el acceso al repositorio interno

  • Uno de los empleados cuya cuenta fue alcanzada tenía Codex conectado con la organización de OpenAI en GitHub.
  • Para demostrar el nivel de acceso conseguido sin inspeccionar información sensible, los investigadores hicieron que Codex creara la pull request #1186742 en el repositorio privado openai/openai. Una pull request es una solicitud para proponer cambios en el código de un proyecto.
  • La acción funcionó como una prueba de acceso. Hacktron afirma que no leyó ni descargó código privado y que detuvo la investigación después de comprobar que podía interactuar con ese entorno.

OpenAI corrigió su parte del problema en unas horas

  • Hacktron informó a OpenAI del hallazgo el 25 de julio de 2026 mediante su programa de recompensas de seguridad. Según la cronología publicada por los investigadores, OpenAI confirmó la corrección de la vulnerabilidad relacionada con sus sistemas unas 14 horas después del reporte.
  • Discourse recibió por separado la información sobre la vulnerabilidad relacionada con el procesamiento de imágenes y publicó posteriormente el aviso de seguridad GHSA-vhm9-85gw-x335, asociado con CVE-2026-32882.
  • OpenAI pagó posteriormente 6.500 dólares por el hallazgo relacionado con sus propios sistemas. Hacktron aclara que las pruebas realizadas contra el foro comunitario alojado por Discourse estaban fuera del alcance del programa de recompensas de OpenAI.

Foto: appshunter.io en Unsplash.

Deja una respuesta