
오늘 Anthropic은 무엇보다도 최근 코딩 및 기타 소프트웨어 개발 작업에서 인기 있는 선택이 된 모델의 최신 업데이트인 Opus 5를 출시했습니다.
이는 Opus의 주목할만한 상승이지만 에이전트 코딩 성능에 있어서 Opus 4.5 수준의 획기적인 발전은 아닌 것 같습니다.
Frontier-Bench 및 DeepSWE와 같은 다양한 벤치마크가 포함된 차트(Anthropic에서 제작)는 Opus 5가 코딩 작업에 대한 Anthropic의 Fable 모델의 성능과 거의 동일한 수준 또는 약간 앞선 성능을 보여줍니다. 표면적으로는 거의 모든 종류의 작업에서 Opus 4.8과 OpenAI의 경쟁 GPT-5.6-Sol을 능가합니다.
다양한 벤치마크에서는 반복적인 성능 향상을 보여주지만 급격한 도약은 아닌 반면, 주요 주장은 약 절반의 비용으로 Fable에 뒤지지 않는 기능을 제공하는 모델이라는 것입니다.
또한 Anthropic은 특히 Opus 5에 사이버 보안 작업에 대한 최첨단 교육을 제공하는 것을 피했기 때문에 그 점에서 Fable 및 Mythos보다 훨씬 뒤처져 있다는 점도 언급할 가치가 있습니다. Anthropic은 사이버 보안 취약점을 찾는 데 상대적으로 뛰어나다고 주장하지만, 모델 훈련 과정에서 내려진 결정으로 인해 “상대적으로 Mythos 5보다 뒤쳐져 있습니다. 착취 그 취약점 중 하나입니다.”
따라서 Opus 5에는 사고 발생 시 30일 동안 검토를 위해 데이터를 보관하는 정책 등 Fable과 동일한 논란의 여지가 있는 보호 기능이 모두 없습니다.
관련 정보는 아래 링크에서 확인하세요