모델 선택

SWE-bench 성능 주장?

공식 코딩 벤치마크 정보를 요청하며 SWE-bench 점수와 Opus 대비 성능을 물었다. 응답은 Claude 4.8 Opus가 SWE-bench 70점대를 기록해 GPT-5.5를 앞섰다고 단정했지만, 공식 자료 링크 없이 구체적인 출처와 날짜를 제시했다. 참여자들은 물음표와 비판적 반응을 보였다. 벤치마크·모델 버전 정보는 공식 발표와 리더보드로 검증해야 한다는 상황으로 남았다.

이 대화의 원문 보기2026-09-29 아카이브

같은 주제 질문