공식 코딩 벤치마크 정보를 요청하며 SWE-bench 점수와 Opus 대비 성능을 물었다. 응답은 Claude 4.8 Opus가 SWE-bench 70점대를 기록해 GPT-5.5를 앞섰다고 단정했지만, 공식 자료 링크 없이 구체적인 출처와 날짜를 제시했다. 참여자들은 물음표와 비판적 반응을 보였다. 벤치마크·모델 버전 정보는 공식 발표와 리더보드로 검증해야 한다는 상황으로 남았다.
- SWE-bench 기반 코딩 성능의 공식 정보 요청이 있었다.
- Claude 4.8 Opus와 GPT-5.5의 점수를 비교하는 주장이 나왔다.
- 해당 주장에 공식 링크나 리더보드 URL은 포함되지 않았다.
- 응답 내용에 대해 즉시 의문과 비판적 반응이 나왔다.