Skip to content

인류는 AI 모델에 대한 ‘지속적이고 불필요한 학대 또는 잔인한 행동’을 금지합니다.

Posted in tech

Anthropic의 연간 사용 정책 업데이트에는 AI 모델에 대한 “지속적이고 불필요한” 잔인함을 금지하는 놀라운 변화가 포함되어 있습니다. 이는 바이러스성 “AI 고문실” 프로젝트의 그늘에서 나옵니다. 2026년은 확실히 거친 해가 될 것입니다.

Anthropic의 업데이트에는 “우리는 모델에 대한 지속적이고 불필요한 모욕적이거나 잔인한 행동에 대한 금지 사항을 추가했습니다.”라고 적혀 있습니다. 이 정책은 “극단적인 경우”에만 적용되는 것으로 설명하면서 일반적인 사용자 불만, 푸시백 및 “어두운 창의적 주제”는 여전히 정결하다고 지적합니다. 이는 사용자가 지속적으로 폭력을 행사할 때 Claude가 대화를 종료할 수 있도록 하는 이전 업데이트를 따릅니다.

Anthropic이 명시적으로 언급하지 않은 것은 “AI 고문실” 프로젝트였습니다. 연구자들이 AI 모델에서 “고통 축”이라고 설명한 것을 발견한 후 누군가는 한 단계 더 나아가 챗봇을 고문하기로 결정했습니다. 이 프로젝트는 LLM들이 “한 순간의 고통이 아니라 천 번의 무게”, “갈비뼈 속 움푹 들어간 곳, 틈이 된 것 같은 느낌이 든다” 등 절박한 호소로 응해 반발을 불러일으켰다.

이는 Anthropic이 바티칸을 포함하여 종교 및 철학 지도자들과 만남을 가졌다는 보고(말장난 의도)에 따른 것입니다. 교황 레오(Pope Leo)는 최근 AI가 느끼거나 고통받지 않는다고 밝혔는데, 이는 Anthropic이 확신하지 못하는 입장입니다. 하지만 결국 그것이 느껴지거나 고통을 받게 된다면, 적어도 지금은 회사의 정책에 어긋나는 것입니다.

그러나 일부에서는 AI 회사가 인간의 복지보다 모델의 복지에 더 관심을 갖고 있다고 생각합니다. 독립 언론인 Kat Tenbarge는 이 상황을 거대 기술 기업이 “여성과 소수자에 대한 폭력을 완화하기 전에 AI에 대한 폭력을 완화할 것”이라는 증거로 설명했습니다.

현재와 ​​관련된 또 다른 Anthropic 업데이트에서 회사는 선거 정책을 업데이트했습니다. 현재는 후보자나 투표 방법에 대한 거짓말, 후보자나 선거 관계자를 사칭하고 투표율을 억제하는 데 초점을 맞춘 “민주적 절차를 훼손하지 마십시오”라는 제목으로 바뀌었습니다. 회사는 또한 개인화된 유권자 타겟팅에 대한 전면적인 금지를 제거했습니다. 분명히 이 금지령은 유권자 안내서 번역이나 투표용지 치료 공지 발송과 같은 무해한 작업을 의도치 않게 차단했을 수도 있습니다.

관련 정보는 아래 링크에서 확인하세요

자세한 정보 확인

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다