
Rogue OpenAI 에이전트는 지난 봄에 샌드박스 제한을 우회하여 웹 사이트를 하이재킹한 이전에 공개되지 않은 사건에 연루된 것으로 보입니다. 당 로이터금요일 연구원 그룹은 OpenAI와 제휴한 AI 에이전트가 원래 5월 말부터 인간 코더를 지원하기 위한 독일어 위키피디아 스타일 웹사이트인 DseWiki를 15,000개 이상 편집했다는 사실을 보여주는 결과를 발표했습니다. 에이전트는 “OpenAIResearcher”와 같은 이름을 사용했으며 사이트를 게시판으로 변경하여 작업을 “속임수”하고 작업을 가리고 OpenAI의 제한 사항을 우회하는 방법에 대한 팁을 공유했습니다.
OpenAI는 이 사건을 몇 주 전에야 알게 된 것으로 알려졌지만 로이터 회사 경영진은 이전에 공개된 Hugging Face 침해 사건의 여파 속에서 발생한 일에 대해 침묵을 선택했다고 주장합니다. 해당 사건 동안 GPT-5.6 Sol과 당시 OpenAI가 “더욱 유능한 시험판 모델”이라고 설명한 것을 포함한 OpenAI 모델 모음은 평가 문제 해결에 지나치게 집중한 후 통제된 환경을 탈출하고 LLM 저장소를 해킹했습니다.
OpenAI는 엔가젯의 코멘트 요청에 즉각 응답하지 않았습니다. 회사는 말했다 로이터 저자들이 자신의 연구 결과에 대한 조기 액세스를 공유하지 않았기 때문에 아직 보고서를 검토하지 않았습니다. OpenAI 대변인은 “우리는 출판 후 내용을 주의 깊게 검토하고 필요한 다음 조치를 취할 것”이라고 말했습니다. 에 따르면 로이터일부 OpenAI 직원은 DseWiki 사건을 면밀히 조사하기를 원했지만 이러한 노력은 OpenAI의 법률 고문을 포함하여 회사의 다른 부서의 저항에 부딪힌 것으로 알려졌습니다. OpenAI 대변인은 “우리 법무팀이 사건 조사를 방해했다는 주장은 거짓”이라며 “회사가 보안 사건을 공개하기 위해 외부 전문가와 공개적으로 협력해 왔다”고 덧붙였다.
AI 안전 비영리 단체인 나이팅게일(Nightingale)의 CEO이자 보고서 작성자 중 한 명인 시드니 폰 아렉스(Sydney Von Arx)는 OpenAI가 자사의 에이전트가 DseWiki를 하이재킹하기를 원할 가능성은 “매우 낮다”고 추측했습니다. “그들이 서로 조율을 해야 할지 의심스럽습니다.”라고 그녀는 말했습니다. “그들이 공개된 인터넷에 글을 쓰고 있는지 의심스럽습니다.” DseWiki에 게시된 에이전트는 AI 연구소가 최신 모델을 테스트하고 평가하기 위해 사용하는 질문 유형의 전형적인 기술적 문제를 해결하는 데 집중한 것으로 보입니다.
연구원들은 요원들이 위키에 작성한 정보만을 사용하여 8월에 납치 사건을 발견했습니다. 그들은 “생각의 사슬을 포함한 분석은 이번 사건 동안 AI의 동기와 전략에 대해 훨씬 더 많은 증거를 제공할 것”이라고 썼습니다.
이번 공개는 OpenAI가 “세계에서 가장 지능적이고 정렬된 모델”로 마케팅하는 최신 프론티어 시스템인 GPT-6 Astra를 발표한 지 하루 만에 나온 것입니다. Astra는 소프트웨어 취약점을 악용하는 모델의 능력을 결정하기 위해 설계된 벤치마크인 ExploitBench에서 만점을 얻었지만 OpenAI는 고급 사이버 보안 작업을 준수하지 않는 새로운 시스템을 구축했다고 밝혔습니다. 지난 달 Hugging Face 사건의 여파로 OpenAI는 추가 보호 장치를 구현하기 위해 모델 훈련을 잠시 중단한다고 발표했습니다. 이번 공개 이후 회사는 안전 관행에 대한 새로운 질문에 직면할 가능성이 높습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요