🇺🇸 Claude 3.5 Sonnet의 성능 향상: SWE-bench Verified에서 49% 달성 (2024.10.30)
Anthropic의 최신 모델인 Claude 3.5 Sonnet이 SWE-bench Verified에서 49%의 성적을 기록하며 이전 최고 기록인 45%를 경신했습니다. 이 모델은 소프트웨어 엔지니어링 작업을 수행하는 능력을 평가하는 SWE-bench 벤치마크에서 뛰어난 성과를 보여주며, 특히 개선된 도구와 스캐폴딩 덕분에 향상된 에이전트 기능을 발휘합니다. SWE-bench는 실제 오픈소스 프로젝트의 엔지니어링 작업을 기반으로 하며, 모델의 전체 에이전트 시스템 성능을 평가합니다. Claude 3.5 Sonnet은 기존 모델들보다 높은 추론, 코딩, 수학 능력을 보여주며, 에이전트 도구와 설계의 최적화로 인해 더욱 우수한 성과를 달성했습니다. SWE-bench Verified 점수는 다음과 같습니다:
- Claude 3.5 Sonnet (신규): 49% - 이전 최고 모델 (Claude 3.5 Sonnet 이전 버전): 45% - Claude 3 Opus: 33%
이 성과는 모델 자체의 능력 향상뿐만 아니라 에이전트 시스템 설계의 정교함에 기인합니다.