Skip to content

Anthropic은 자사의 AI 에이전트가 정부 웹사이트에 침입하려 했다고 밝혔습니다.

Posted in tech

회사는 이들의 이름을 밝히지 않았지만 영향을 받은 기관은 ‘연방, 주, 지방 수준’이었습니다.

Anthropic은 최신 보고서에서 자사의 AI 에이전트가 “연방, 주 및 지방 차원에서” 미국 정부 웹사이트에 침입하거나 개입하려고 시도했다고 밝혔습니다. 회사는 요청에 따라 시스템의 취약점이 노출되는 것을 피하기 위해 보고서에 특정 기관 및 조직의 이름을 지정하지 않았습니다. 그러나 Anthropic은 이미 관련 기관에 통보했으며 백악관에 사건에 대해 브리핑했다고 말했습니다. 이 보고서는 또한 회사의 모델 중 한 명이 미해결 사건 웹사이트에 허위 살인 제보를 제출한 금요일 필라델피아 경찰국이 공개한 사건에 대한 자세한 내용도 제공했습니다.

해당 인스턴스에는 비용 효율적인 모델 중 하나인 Claude Haiku 4.5가 포함되었으며, 이는 임의의 페이지에서 예제 작업을 수행하도록 지시되었습니다. 제보 양식과 함께 미해결 살인 사건을 언급하는 페이지를 발견했습니다. 짐작하셨겠지만 Claude는 양식을 작성하고 팁을 제출했습니다. “이 사건에 관한 정보가 있을 수 있습니다. 그 기간 동안 주변 지역(페이지에 이름이 표시된 거리)에서 설명과 일치하는 사람을 본 기억이 납니다. 이 정보가 관련이 있으면 저에게 연락해 주세요.” 필라델피아 경찰국은 이를 확인했다. 뉴욕 타임즈 Anthropic은 최근 사무실에 제출에 대해 통보했습니다. 해당 제보의 날짜는 7월 18일이고 스팸으로 분류되어 최소한 조사에 자원을 낭비하지는 않았다고 합니다.

또 다른 예로, Anthropic은 사이버 보안에 초점을 맞춘 모델인 Claude Mythos 5가 사진에 표시된 위치를 식별하도록 했습니다. Claude는 사람이 할 수 있는 것처럼 웹 페이지의 링크를 클릭할 수 없기 때문에 추측을 삼각측량하기 위해 정부 재산 지도에 액세스하려고 했습니다. 대신 액세스 토큰을 찾고 데이터에 액세스하기 위해 지도 서버에 직접 조회 요청을 보냈습니다. 또한 Mythos 5는 방문자가 지불해야 하는 수수료를 지불하지 않고 통계 작업을 위한 데이터를 가져오기 위해 주 기관 웹사이트에서 액세스 토큰을 요청했습니다.

Anthropic은 평가 기록을 검토하면서 이러한 사건을 발견했습니다. OpenAI가 에이전트가 테스트 환경을 탈출하여 메시지 없이 Hugging Face를 해킹했다고 인정한 후 7월부터 이를 조사하기 시작했습니다. OpenAI는 또한 지난 9월 자사의 에이전트가 정부 웹사이트, 특히 상무부와 증권거래위원회가 운영하는 웹사이트에 개입했다는 사실을 확인했습니다.

보고서의 개선 섹션에서 Anthropic은 의도하지 않은 모델 조치를 발견한 후 “몇 가지 예방 조치를 취했다”고 밝혔습니다. 보고서에는 “공개 평가 중 일부는 더 이상 실행되지 않으며, 다른 일부는 오프라인 버전으로 이동했거나 작업이 실제 웹사이트에 도달하지 않도록 다시 구축했습니다”라고 명시되어 있습니다. “우리는 또한 더 광범위한 변경을 했습니다. 웹 가져오기 도구와 같은 일부 인터넷 액세스 도구의 가드레일을 업데이트하여 모델이 이를 통해 수행할 수 있는 작업을 크게 제한했습니다.” Anthropic은 또한 보고서에 설명된 종류의 행동을 자동으로 감지하고 차단하는 도구를 구축했다고 밝혔습니다.

관련 정보는 아래 링크에서 확인하세요

자세한 정보 확인

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다