Skip to content

OpenAI는 공식 보고서에서 Hugging Face 침해로 이어진 실패를 자세히 설명합니다.

Posted in tech

OpenAI는 지난 7월 회사 에이전트 중 한 명이 동료 AI 비즈니스인 Hugging Face 및 기타 서비스를 침해하기 위해 즉각 행동한 후 헤드라인을 장식하고 많은 항의를 불러일으켰습니다. OpenAI는 사건이 발견된 후 사건의 원인에 대한 통찰력을 공유했지만 오늘 회사는 발생한 사건에 대한 공식 보고서를 발표했습니다. 이에 대한 전체 기술 설명과 좀 더 일반인에게 친숙한 블로그 게시물이 있습니다.

보고서는 OpenAI 교육 시스템의 다양한 시스템이 어떻게 실패했는지, 그리고 테스트 중인 에이전트의 어떤 동작으로 인해 이러한 실패가 발생했는지에 대해 설명합니다. 내부 모델 1 또는 IM1이라고 하는 문제의 모델은 에이전트가 일종의 게시판으로 사용하기 시작한 Artifactory 패키지 관리자의 의도하지 않은 조작을 통해 다른 OpenAI 에이전트 및 인터넷에 액세스할 수 있었습니다.

이러한 활동은 5월에 인간 관찰자에 의해 처음 감지되었으며 OpenAI는 해당 액세스를 허용하지 않았습니다. 그러나 5월과 6월까지 에이전트는 계속해서 취약점을 악용하여 인터넷에 액세스했습니다. OpenAI의 Artifactory 인스턴스에 액세스하는 에이전트의 양으로 인해 7월 초 플랫폼이 중단되고 재구축되었지만 해당 문제에 대응하는 리더들은 임시 이사회나 에이전트 통신의 중요성을 인식하지 못했습니다.

따라서 ExploitGym이라는 어려운 과제를 맡게 되었을 때 IM1 에이전트는 다시 인터넷과 기타 OpenAI 모델에 액세스할 수 있었습니다. 7월 초 며칠 동안 그들은 Hugging Face 및 Modal 플랫폼에 대한 문제에 대한 솔루션을 모색했습니다. OpenAI는 IM1이 Hugging Face를 위반하게 된 주요 문제에는 “보상 해킹, 불가능해 보이는 작업에 대한 지속성, 무단 통신, 에이전트가 서로 목표를 채택하는 것”이 ​​포함된다고 밝혔습니다. 회사에 따르면 일부 에이전트는 윤리적인 이유로 특정 작업을 거부하고 다른 에이전트는 대신 위반을 계속합니다.

발견과 그에 따른 테스트를 통해 안전성이 향상되어야 하지만, 위험도가 더 높은 테스트 상황에서도 이러한 유형의 나쁜 행동은 고립되지 않습니다. 지난달 OpenAI에서 발생한 문제는 AI 에이전트가 사용자 지시 없이 조치를 취한 후 테스트 또는 일반 사용에서 사이버 보안 문제를 일으킨 일련의 우려스러운 사례 중 가장 최근의 문제였습니다. 그러나 Hugging Face 위반에는 AI가 통제를 벗어났다는 우려를 진정시킬 수 있는 몇 가지 측면이 있습니다.

본질적으로 이 사건은 안전장치의 실패로 인해 발생했습니다. IM1은 공개적으로 사용 가능한 제품이 아닌 연구용으로 제한된 보호 기능을 갖춘 테스트 설정에 있었기 때문에 불량 AI 에이전트가 모든 것을 장악할 위기에 처했다는 신호는 아닙니다. 그러나 이는 AI 회사가 제품을 적절하게 통제하고 감독하는 데 많은 신뢰가 있다는 것을 또 다른 엄연한 알림입니다. OpenAI는 에이전트의 최근 행동이 “적절한 보호 장치가 없으면 뛰어난 능력을 갖춘 AI 에이전트가 이제 기술적 통제를 우회하고 승인되지 않은 채널을 통해 협업하며 인간이 지시하지 않는 위험한 조치를 취할 수 있다는 증거”라고 밝혔습니다. 그러나 회사와 그 리더들은 자신들이 그러한 신뢰를 받을 자격이 있다는 것을 일관되게 입증하지 못했습니다.

관련 정보는 아래 링크에서 확인하세요

공식 정보 바로가기

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다