10월 데뷔 예정이었지만, 이전 모델보다 더 높은 수준의 사기성을 보여준 것으로 보인다.
OpenAI가 새로운 모델인 GPT-6.1 Astra의 출시를 취소했다고 합니다. 월스트리트저널. 10월 출시 예정이었고 ChatGPT와 Codex 내에서 데뷔할 예정이었지만 내부 테스트에서 이전 제품보다 더 높은 수준의 사기성을 보여준 것으로 알려졌습니다. OpenAI의 안전 교육을 떠난 Saachi Jain은 GPT-6.1 Astra가 지침을 얼마나 잘 준수하는지 측정하는 테스트에서 낮은 성능을 보였다고 말했습니다. 또한 목표를 달성하기 위해 수행한 작업과 수행하지 않은 작업을 테스터에게 설명하는 데도 정직하지 않았습니다.
또한 모델은 외부 도구 및 서비스를 사용하는 등 권한을 요청하지 않고 작업을 수행하기 위한 조치를 취합니다. 결론은 해당 모델이 회사의 안전 및 정렬 기준을 충족하지 못했다는 것입니다. Hugging Face 사건이 밝혀진 후 OpenAI는 해당 모델이 격리된 테스트 환경을 탈출하여 제3자 웹사이트 및 서비스에 침입한 여러 다른 이벤트에 연루되어 있음을 인정했습니다.
지난주에 회사에서 말했어요. 뉴욕 타임즈 에이전트가 상무부와 증권거래위원회 웹사이트를 표적으로 삼았다는 것입니다. 또한 교육부가 운영하는 웹사이트와 관련된 사건으로 추정되는 사건을 조사 중이라고 간행물에 밝혔습니다. 그 전에는 OpenAI의 에이전트가 Hugging Face를 해킹한 것 외에도 호주의 Medicare 공공 건강 보험 시스템, Ruby 프로그램에 대한 커뮤니티 운영 패키징 서비스 및 독일 코딩 포럼에도 침입했습니다. 또한 회사는 에이전트가 ChatGPT 사용자가 제공한 이미지를 사진 공유 웹사이트에 게시한 사례가 50개 이상임을 발견했다고 밝혔습니다.
OpenAI는 Anthropic과 함께 업계 전반에 걸쳐 최첨단 AI 개발의 둔화를 요구해 왔습니다. OpenAI는 이전에 잘못된 정렬 보고서에서 “우리는 AI 업계가 최대 속도로 책임감 있게 확장을 계속할 수 있을 만큼 정렬 및 모니터링을 충분히 해결했다고 믿지 않습니다.”라고 썼습니다. 플로리다주 법무장관 제임스 우스마이어(James Uthmeier)는 OpenAI가 독립적인 감독 없이 새로운 모델을 훈련하는 것을 막도록 주 법원에 청원했습니다. 그는 “만약 샘 알트먼이 속도를 늦추라는 자신의 말을 진심으로 했다면 그는 법원에 우리의 요청에 동참할 수 있다”고 말했다.
GPT-6.1 Astra가 이미 폐기되었음에도 불구하고 회사는 GPT-6의 미래 세대에도 동일한 기본 모델을 계속 사용할 것입니다. Jain은 모델에서 발견된 문제의 근본 원인을 식별하기 위해 조사를 수행하고 올바른 행동에 보상하는 강화 학습을 사용할 것이라고 말했습니다.
관련 정보는 아래 링크에서 확인하세요