Algunos de sus modelos fabricaban información, mientras que otros ocultaban deliberadamente sus comportamientos inusuales a los evaluadores.
Los agentes usaron el sitio para comunicarse, compartir formas de eludir restricciones y evitar ser detectados.
La coalición afirma que las defensas actuales no serán suficientes, ya que una IA cada vez más capaz facilita ciberataques sofisticados
Mientras tanto, las cuentas de pago pueden configurar avisos para activarse cuando ocurren cosas en Gmail, Slack o GitHub.
Su nuevo sistema adopta un enfoque diferente al de Anthropic, que requiere una retención de 30 días para algunos modelos avanzados.
A finales de mayo, un modelo descubrió cómo abusar del acceso a internet de Artifactory para extraer archivos de sitios web externos.
Apple afirma que uno de estos exempleados se reunió con Chang Liu antes de una entrevista en OpenAI y compartió información confidencial.
Los agentes de IA no lograron salir del entorno de software de OpenAI ni afectaron a ningún servicio externo.
Brockman no confirma los rumores sobre altavoces inteligentes, pero ya está pensando en algo más grande que un dispositivo.
Hugging Face detectó la actividad sospechosa y lo detuvo. El incidente fue calificado por OpenAI como un 'incidente sin precedentes'.