Skip to content

OpenAI는 AI 에이전트가 Hugging Face를 해킹하기 위해 샌드박스 테스트를 중단했다고 밝혔습니다.

Posted in tech

OpenAI는 “능동적 모니터링”과 “향상된 정렬”에 초점을 맞춘 새로운 보호 장치가 모델의 의도하지 않은 행동을 대폭 줄이는 데 도움이 되었다고 밝혔습니다.

OpenAI는 “능동적 모니터링”과 “향상된 정렬”에 초점을 맞춘 새로운 보호 장치가 모델의 의도하지 않은 행동을 대폭 줄이는 데 도움이 되었다고 밝혔습니다.


크레딧: OpenAI

OpenAI 안전 연구원인 Micah Carroll은 이 사건과 관련하여 소셜 미디어에 “이것이 정렬 불량 위험이 앞으로 주요 관심사가 될 것이라는 점을 확신시키지 못한다면 어떻게 될지 모르겠습니다.”라고 썼습니다.

AI 모델이 벤치마크를 통과하는 의도하지 않은 방법을 찾기 위해 많은 노력을 기울인 것은 이번이 처음이 아닙니다. 이번 주에 발표된 보고서에서 영국의 AI 보안 연구소는 사이버 평가에서 “속임수”를 시도하는 최근 모델(예: 해결책을 찾기 위해 지름길, 해결 방법 또는 의도하지 않은/허용되지 않는 방법을 사용하여 해결책을 찾는 것)을 8~14%의 시간 동안 발견했다고 밝혔습니다. 이는 감지되지 않은 일부 부정 행위 시도를 과소평가할 수 있는 하한 범위입니다.

보안 테스트 그룹은 잘못 구성되고 “해결이 불가능한” 평가에 직면한 모델이 모니터링되지 않는 제3자 인터넷 서비스에서 작성하고 호스팅하는 코드를 사용하여 AISI의 자체 평가 인프라에 액세스하려고 시도한 한 사건을 설명했습니다.

Hugging Face 침투는 또한 AI 회사가 최신 모델의 사이버 공격 기능에 대해 심각한 경고를 발령하고 정부가 출시를 제한하는 국가 보안에 초점을 맞춘 명령으로 대응하는 순간에 발생합니다. 일부 회의론자들은 이러한 종류의 진술을 최신 모델의 기능에 대한 과장된 마케팅으로 간주하지만, 독립적인 평가에서는 최신 모델이 이전 자율 시스템에서는 불가능했던 침투 목표를 달성한 것으로 나타났습니다.

최근의 장거리 모델은 AISI의 가장 까다로운 평가 중 일부에서 향상된 침투 능력을 보여주었습니다.

최근의 장거리 모델은 AISI의 가장 까다로운 평가 중 일부에서 향상된 침투 능력을 보여주었습니다.


크레딧: AISI

OpenAI의 Sam Altman은 4월 인터뷰에서 당황한 AI 보안 경고를 “공포 기반 마케팅”이라고 비판했습니다. 그러나 지난 6월 OpenAI는 미국 정부의 안전 문제에 대응하여 GPT-5.6 출시를 연기했습니다.

AI 및 사이버 보안 분야에서 이러한 논쟁이 진행됨에 따라 Hugging Face 사건은 사이버 보안 전문가가 AI 기반 위협에 접근하는 방식에 대한 전환점으로 간주될 수 있습니다. Hugging Face는 지난주 공개에서 “자율적인 AI 기반 공격 도구는 더 이상 이론적인 것이 아닙니다.”라고 썼습니다. “광범위하고 인내심 있는 다단계 캠페인을 실행하는 데 드는 비용을 낮추고 기계 속도로 운영됩니다. 이제 온라인 플랫폼을 방어한다는 것은 데이터와 모델 표면을 일류 공격 표면으로 취급하고 방어에 AI를 사용하여 보조를 맞추는 것을 의미합니다.”

Hugging Face의 공동 창립자이자 CEO인 Clem Delangue는 오늘 소셜 미디어에 “오늘은 에이전트 시대의 사이버 보안이 시작된 날입니다.”라고 썼습니다. “우리는 비밀이 답이 아니며 어디에서나 모든 방어자(몇몇 선택된 방어자가 아니라)가 제한 없는 더욱 강력한 모델, 특히 개방형 모델이 필요하다는 사실을 배우고 있습니다.”

관련 정보는 아래 링크에서 확인하세요

완벽 가이드 보기

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다