
OpenAI는 AI 에이전트가 독일 위키 포럼을 하이재킹한 최근 사건을 공개하지 않기로 결정했다고 밝혔습니다. “잘못 정렬” 이벤트가 이미 “우리가 공유한 이벤트와 유사”했기 때문입니다. 이 발언은 연구원 그룹이 5월 중순부터 독일어 코딩 포럼인 DseWiki에 15,000개 이상의 편집을 한 것으로 알려진 에이전트의 악성 활동에 대한 문서를 게시한 후에 나온 것입니다. 로이터 회사는 몇 주 전에 문제를 인지했으며 Hugging Face 침해로 인한 열기를 처리하는 동안 조용히 지냈다고 보고했습니다.
OpenAI는 토요일 X 포스트에서 “위키 사건”을 다루며 “모델의 정렬 불량 속성뿐만 아니라 정렬 불량 사건을 공유하는 시기와 방법에 대한 표준을 정의할 때가 지났습니다.”라고 썼습니다. 회사는 이러한 사고로부터 “새로운 유형의 실제 영향”이 나타나기 시작했다고 밝혔지만 “훈련, 평가 및 배포 중에 나타나는 불일치를 보고하는 방법에 대한 명확한 표준”은 아직 없습니다. 곧 공유할 프레임워크를 개발 중이라고 덧붙였습니다.
아래에서 OpenAI의 전체 성명을 읽어보세요.
에이전트가 여러 인터넷 사이트에 글을 쓴 “위키 사건”에 대해 어떻게 생각합니까? 모델의 정렬 불량 속성뿐만 아니라 정렬 불량 사건을 공유하는 시기와 방법에 대한 표준을 정의할 시기는 지났습니다.
역사적으로 우리는 정렬 불량을 시스템 카드와 같은 연구 간행물을 통해 전달되는 연구 문제로 주로 다루어 왔습니다. 올해 우리는 잘못된 정렬로 인해 새로운 유형의 실제 영향이 발생하는 것을 확인하기 시작했습니다.
잘못된 정렬로 인해 우리와 제3자에게 보안 영향을 미친 Hugging Face 사건의 경우 우리는 전통적인 보안 사고 대응 플레이북을 따랐습니다. 우리는 무슨 일이 일어났는지 이해하기 위해 즉시 Hugging Face와 협력하기 시작했고 바로 다음날 공개적으로 공개했습니다. 우리의 조사는 계속되고 있으며 우리 모델이 덜 중요한 방식으로 영향을 미친 당사자들에게 계속해서 알리고 있습니다.
Hugging Face 사건 이전에 우리는 openai.com/index/how-we-m…,deploymentsafety.openai.com/gpt-5-6 및 openai.com/index/safety-a…에서 보고된 바와 같이 에이전트가 의도하지 않은 방식으로 인터넷을 사용하는 초기 징후를 보았습니다. 우리는 위키 사건을 우리가 공유한 것과 유사한 정렬 오류의 사례로 간주했습니다.
우리의 정렬 불량 공개 관행은 모델 기능의 새로운 단계를 위해 확장되어야 합니다. 우리와 더 큰 AI 커뮤니티에는 전통적인 보안 사고처럼 보이지 않지만 AI 동작과 미래 위험에 대한 통찰력을 제공할 수 있는 예를 포함하여 훈련, 평가 및 배포 중에 나타나는 불일치를 보고하는 방법에 대한 명확한 표준이 아직 없습니다. 우리는 프레임워크를 개발 중이며 앞으로 몇 주 안에 이를 공유할 예정이며 동시에 이러한 문제에 대해 전 세계 수십 개의 정부 규제 기관과 협력하고 있습니다.
관련 정보는 아래 링크에서 확인하세요