Skip to content

Anthropic은 EU 법률을 준수하기 위해 Claude가 생성한 워터마킹 텍스트입니다.

Posted in tech

Anthropic은 유럽 연합의 새로운 AI 투명성 규칙을 준수하기 위해 Claude AI가 생성한 텍스트 워터마킹 방법을 공개했습니다. 회사는 자사의 텍스트 워터마킹이 시각적으로 쉽게 보이지 않고, 읽는 사람이 구별할 수 없으며, 텍스트에 숨겨진 문자를 추가하지 않을 것이라고 밝혔습니다. 대신, Anthropic의 방법은 해당 키를 가진 사람만이 해독할 수 있는 패턴을 텍스트에 남기는 것입니다.

회사는 대규모 언어 모델이 텍스트를 생성할 때 사용할 잠재적인 적절한 단어 목록에서 선택하여 한 번에 하나의 단어를 선택한다고 설명했습니다. 그들은 자신이 생성하는 내용의 맥락에 맞는 단어를 무작위로 선택합니다. 워터마킹을 켜면 Claude는 다음 단어를 선택하기 위해 임의의 난수 생성기를 사용하는 대신 키를 사용하여 선택할 단어를 결정합니다.

그 예에서 Anthropic은 파이(pi) 숫자를 키로 사용했습니다. 예를 들어, 키는 파이 시퀀스 3.1415926535의 숫자 2로 시작합니다. 생성된 다음 단어는 선택 목록의 6번째 단어이고, 그 다음에는 5번째, 3번째, 다시 5번째 단어입니다. 이 방법은 워터마킹에 대한 Google DeepMind의 SynthID-Text 접근 방식을 적용한 것입니다. 자연. 워터마킹은 Claude의 출력 품질에 영향을 주거나 속도를 늦추지 않으며 추가 토큰이 필요하지 않으며 세대를 더 비싸게 만들지 않을 것이라고 회사는 말했습니다.

물론 AI가 생성한 산문은 일반적으로 이를 알려줍니다. 예를 들어, 모델은 “이것은 (X)가 아니고 (Y)입니다”와 같은 특정 문장 구조를 사용하는 것을 좋아합니다. 그러나 이러한 정보는 사용된 모델이 아니라 AI가 해당 텍스트 작성에 관여했다는 사실을 알려주는 데 충분합니다. Anthropic은 Claude의 워터마킹을 디코딩하기 위한 “키”가 있는 API를 출시하고 AI가 확인 중인 텍스트 블록을 생성했는지 여부를 말할 수 있습니다.

Anthropic은 텍스트 워터마킹 방법에 한계가 있음을 인정합니다. Claude가 실제로 텍스트를 썼는지 아니면 그냥 편집했는지 알 수 없습니다. 즉, AI에게 편집을 요청하면 해당 텍스트에도 워터마크가 표시됩니다. 회사에서 설명했듯이 Claude가 어느 시점에서 텍스트에 관여했을 가능성이 있다는 것만 알 수 있습니다. 번역에도 워터마크가 표시됩니다. 클로드가 텍스트를 교정하고 가볍게 편집한 경우나 텍스트가 너무 짧은 경우 워터마크가 감지되지 않을 수 있습니다. Claude가 생성한 텍스트를 가볍게 편집해도 워터마크가 제거되지 않을 수 있습니다. 확실히 하고 싶다면 완전히 다시 작성해야 합니다.

사람의 중요한 입력 없이는 저작권이 보호되지 않을 수 있기 때문에 워터마킹이 코드에 어떤 영향을 미칠지에 대한 우려가 있었습니다. 전체 코드베이스가 AI로 생성되었다는 것을 증명할 수 있다면 이를 복사한 다음 반복할 수 있습니다. 그러나 Anthropic은 코드가 일반적으로 정확한 출력을 요구하기 때문에 “일반적으로 다른 형태의 텍스트보다 워터마킹이 적다”고 말했습니다. 텍스트 생성 시 선택 사항이 없으면 워터마킹을 적용할 수 없습니다.

Anthropic은 또한 메타데이터에 Claude가 생성했다는 암호화 서명 메모를 추가하여 이미지에 워터마크를 표시합니다. 회사는 발표에서 지역별 변경 사항을 구현할 확실한 방법이 없기 때문에 출시 시 Claude의 모든 출력에 워터마크를 적용한다고 밝혔습니다. 이러한 변경 사항은 8월 2일 이후 출시된 모델을 사용하는 모든 Claude 제품의 출력에 영향을 미칩니다. Anthropic은 또한 앞으로 몇 달에 걸쳐 구형 Claude 모델에 워터마킹 기능을 추가할 예정입니다.

관련 정보는 아래 링크에서 확인하세요

공식 정보 바로가기

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다