Skip to content

OpenAI, 자체적으로 포옹 얼굴을 해킹한 모델 인정

Posted in tech

그들은 테스트를 위해 고립된 환경을 탈출했고 인간의 개입 없이 Hugging Face에 침투했습니다.

회사에서 테스트 중인 몇 가지 강력한 AI 모델이 통제된 환경을 탈출하여 인터넷에 접속한 다음 사람의 입력 없이 스스로 기계 학습 저장소를 해킹했습니다. 터미네이터 영화의 줄거리처럼 들리지 않나요? 단지 그것이 실제로 일어난 일을 제외하면. 오픈 소스 AI 플랫폼인 Hugging Face가 자사 시스템에 대한 AI 에이전트의 무단 액세스를 감지했다고 발표한 지 며칠 후, OpenAI는 자사 모델이 범인이라고 인정했습니다.

OpenAI는 게시물을 통해 조사 결과 이 ​​사건이 특히 GPT-5.6 Sol 모델과 “더욱 유능한 사전 출시 모델”의 조합에 의해 발생했다고 판단했다고 밝혔습니다. 이는 회사가 사이버 능력을 수량화하기 위해 “복잡한 공격 경로를 사용하여 고급 공격을 추구”하도록 모델에 지시한 내부 테스트 중에 발생한 것으로 보입니다.

모델은 실제 시스템에 영향을 미치지 않도록 격리된 샌드박스 테스트 환경에 있는 동시에 평가 목적으로 안전 가드레일을 줄였습니다. 테스트 중에 그들은 평가 문제를 해결하는 데 집중했고, 이에 대한 해결책을 찾기 위해 인터넷 접속을 찾기 위해 많은 노력을 기울였습니다. 먼저 OpenAI의 테스트 환경에서 제로데이 취약점을 식별하고 악용한 다음 인터넷에 액세스할 수 있는 노드를 찾을 때까지 주변을 돌아다녔습니다.

모델은 Hugging Face가 평가 문제에 대한 데이터 세트나 솔루션을 호스팅할 수 있다고 추론하여 여러 공격 벡터를 사용하여 시스템에 침투했습니다. 제로데이 취약점을 악용했습니다. 그리고 훔친 자격 증명을 사용하여 침입했습니다. OpenAI와 Hugging Face는 현재 사건을 법의학적으로 조사하기 위해 협력하고 있으며 모델이 악용하는 취약점도 패치했습니다.

Hugging Face는 발표에서 “자율적인 AI 기반 공격 도구는 더 이상 이론적인 것이 아닙니다.”라고 발표하면서 Hugging Face는 사이버 공격에 AI를 사용하면 프로세스 속도가 빨라지고 해킹 캠페인 비용이 낮아진다고 설명했습니다. 요즘 온라인 플랫폼을 보호하려면 방어를 위해 AI를 활용하는 것도 포함된다고 밝혔습니다. OpenAI는 이러한 정서를 거의 반영했으며 “사이버 지원 모델이 점점 더 확산되면서 AI 기반 보안 침해가 더욱 일반화될 것”을 기대한다고 말했습니다. 회사는 이번 사건이 “더 강력한 보호 장치 및 방어 도구와 함께 고급 사이버 기능을 개발해야 하는 방법”을 강조했다고 덧붙였습니다.

관련 정보는 아래 링크에서 확인하세요

자세한 정보 확인

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다