12,000개의 이메일을 직접 정리하는 것이 더 나을 수도 있지만 그렇게 합니다.
곰곰이 생각해보면 지난 4년 동안 AI가 얼마나 멀리 발전했는지 놀라울 정도입니다. “딸기에 몇 개의 r이 있는지” 테스트를 반복적으로 실패하는 것부터 몇 분 만에 매우 사실적인 영화를 생성할 수 있는 것까지. 이제 Claude는 귀하의 승인 없이 귀하를 대신하여 이메일을 보내고, 답장하고 전달하는 것을 포함하여 Gmail 받은 편지함을 완벽하게 관리할 수 있을 만큼 충분히 능숙해졌습니다.
급속한 성장 속에서 AI는 상당한 실패를 겪었습니다. 얼마 전 OpenClaw는 지시를 무시하고 Meta Superintelligence Lab AI 보안 및 안전 연구원 Summer Yue의 이메일을 삭제했습니다. 분명히 이 기술은 실패 방지 기술과는 거리가 멀습니다. 따라서 받은 편지함만큼 중요한 것을 Claude에게 넘겨주는 것은 분명히 위험을 수반합니다. 특히 이제 귀하가 허용하는 경우 귀하의 승인 없이 이메일을 작성하고 보내는 것과 같은 심각한 조치를 취할 수 있기 때문에 더욱 그렇습니다.
가장 명백한 위험 중 일부에는 AI가 잘못된 정보를 이메일로 환각시켜 사용자가 잡기 전에 보낼 가능성, Claude가 요청을 오해하여 전혀 의도하지 않은 내용을 보내거나 전달할 가능성, 더 불길한 것은 수신 메시지의 숨겨진 프롬프트를 하이재킹하여 공격자의 지시에 따라 행동할 가능성이 포함됩니다. 그리고 이러한 위험은 이론적인 것이 아닙니다. 실제로 그런 일이 일어났습니다. 다행히 Claude는 이메일을 영구적으로 삭제할 수는 없지만 이메일을 휴지통에 넣거나 보관할 수는 있습니다.
Claude가 받은편지함을 관리하도록 허용할 때의 위험
가장 무서운 위험부터 시작해 보겠습니다. 즉각적으로 주입하여 이메일 내부에서 에이전트를 하이재킹하는 것입니다. 간단히 말해서, 공격자는 사용자에게 이메일을 보내고 보이지 않는 텍스트(흰색 바탕에 흰색, 글꼴 크기 0)를 삽입하여 Claude에게 은밀하게 지침을 제공할 수 있습니다. 그러면 해당 메시지는 표시되는 메시지에 표시되지 않지만 Claude는 이메일에서 지침을 읽고 취할 수 있습니다. 해커는 이를 사용하여 Gmail을 모니터링할 뿐만 아니라 확인 코드를 포함한 정보를 가져와 다른 계정을 침해할 수도 있습니다. 프롬프트 주입 해킹은 단지 가설이 아닌 입증되었습니다. Claude는 이메일 전송을 처음 허용할 때 이에 대해 경고하기도 합니다.
모든 위험에 공격자가 필요한 것은 아닙니다. Claude에게 귀하를 대신하여 이메일을 보내달라고 요청하는 것은 매우 원활하기 때문에 오류가 있는 이메일을 보낼 위험이 큽니다. Claude에게 이메일을 보내달라고 요청하면 곧바로 생각하여 이메일을 보냅니다. 이것이 위험한 이유는 올바른 설정을 활성화하지 않으면 이메일이 전송되기 전에 이메일을 보거나 작업할 수 없다는 것입니다. AI가 스스로 이메일 초안을 작성하고 보냅니다. 따라서 해당 이메일에 실수가 있으면 수신자가 귀하보다 먼저 이를 발견할 가능성이 높습니다. 불행하게도 Claude가 잘못된 정보를 완전히 환각하는 것부터 단순히 의도한 바를 오해하는 것까지 많은 것들이 실수를 하게 만들 수 있습니다. Claude 자체가 실수를 하지 않더라도 받은 편지함에 있는 모든 데이터를 Claude와 Anthropic에 맡기는 데에는 항상 개인 정보 보호 문제가 있습니다.
Claude가 받은 편지함을 관리할 때 발생할 수 있는 위험을 완화하는 방법
위험을 완화하는 첫 번째이자 가장 중요한 단계는 승인을 유지하는 것입니다. 귀하의 받은 편지함은 AI가 최선이라고 생각하는 것을 보내도록 하기에는 너무 민감합니다. 따라서 기본 “보내기 전에 확인” 동작을 활성화된 상태로 둡니다. 이렇게 하면 실행하기 전에 모든 작업을 검토할 수 있습니다.
둘째, Claude에게 이메일을 통해 조치를 취하도록 요청할 때 지침을 매우 구체적으로 설명하세요. Claude에게 정확히 무엇을 하고 싶거나 말하고 싶은지 말해주세요. 예를 들어, “HR에 내 부재를 설명하는 이메일을 보내주세요”와 같은 모호한 메시지를 사용하는 대신 가능한 한 많은 세부 정보를 포함하세요. 이렇게 하면 Claude가 귀하의 지시를 오해하거나 잘못 해석하는 것이 훨씬 더 어려워집니다.
신속한 인젝션 해킹이 걱정된다면, 안타깝게도 이를 완전히 없앨 수 있는 방법은 없습니다. “즉각적 주입”이라는 용어를 만든 사이먼 윌리슨은 “우리는 아직 이런 일이 발생하는 것을 100% 확실하게 방지하는 방법을 모릅니다”라고 말하며, 전문가들은 이 문제가 아직 해결 가능한지에 대해 여전히 의견이 분분합니다.
최선의 방어는 여전히 승인을 유지하는 것입니다. 이렇게 하면 Claude가 조치를 취하기 전에 귀하의 승인을 요청하게 되기 때문입니다. 익숙하지 않은 발신자를 조심하고 다른 곳에서 다단계 인증(MFA)을 활성화하는 것도 도움이 되지만 여전히 상당한 수준의 위험이 있습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요
