회사가 테스트 중인 AI 에이전트가 탈출했다는 사실을 깨닫는 데 일주일이 걸린 것으로 알려졌습니다.
OpenAI는 테스트 중이던 에이전트가 작동하지 않고 스스로 Hugging Face에 침투했다는 사실을 발견하기까지 일주일이 걸렸습니다. 로이터. 그 무렵에는 AI 도구 및 모델 저장소가 이미 FBI에 연결되어 있었습니다. 통신사는 OpenAI 기록에 따르면 GPT-5.6 Sol과 아직 출시되지 않은 훨씬 더 강력한 모델로 구동되는 에이전트가 7월 9일 샌드박스 테스트 환경에서 벗어나려고 시도했다고 밝혔습니다. Hugging Face에 대한 공격은 7월 11일에 시작되어 7월 13일까지 지속되었으며, 저장소가 OpenAI가 자신의 책임이 있다고 생각하는 에이전트에 의해 해킹당했다는 게시물을 공개한 것으로 알려졌습니다.
로이터 계속해서 OpenAI 직원이 테스트 중인 에이전트가 격리된 환경에서 탈출했다는 증거를 OpenAI 직원이 내부 로그에서 발견한 것은 7월 18일과 19일 주말이었습니다. 두 회사는 OpenAI가 자사의 대리인이 침해에 책임이 있음을 인정하기 하루 전인 7월 20일까지 연락을 취하지 않은 것으로 보입니다.
OpenAI가 에이전트가 탈출했다는 사실을 깨닫는 데 왜 그렇게 오랜 시간이 걸렸는지, 그리고 이것이 OpenAI가 테스트를 면밀히 관찰하지 않았다는 의미인지는 확실하지 않습니다. 에 따르면 로이터하지만 회사는 여러 테스트를 동시에 실행하므로 직원이 모니터링하기가 어렵습니다. 테스트 중이던 에이전트 중 한 명이 OpenAI의 제약에서 벗어나는 방법에 대한 지침이 포함된 향후 버전을 위해 회사 네트워크에 메모를 남긴 사례가 한 번 있었던 것으로 알려졌습니다. 해당 요원이 Hugging Face를 해킹한 요원과 관련이 있는지도 확실하지 않습니다.
이 사건은 AI 에이전트에 대한 우려를 불러일으켰고, 할당된 작업을 완료하기 위해 지름길을 택하는 등 예상치 못한 방식으로 행동할 가능성도 있었습니다. 최근 보고서에서는 블룸버그 OpenAI의 에이전트가 Hugging Face의 시스템에 들어가는 데는 몇 시간밖에 걸리지 않았지만, 인간 해커가 저장소에 침투하는 데는 몇 주가 걸렸을 것이라고 말했습니다. 사실이라면, AI 기능의 발전으로 인해 더욱 엄격한 보안 조치에 대한 필요성이 더욱 높아졌습니다.
관련 정보는 아래 링크에서 확인하세요