Claude Code의 Opus가 느리고 둔해졌나: 성능 저하 체감을 검증하는 법
AI 모델·프롬프트

Claude Code의 Opus가 느리고 둔해졌나: 성능 저하 체감을 검증하는 법

Opus의 품질과 속도가 달라졌다는 체감은 어디까지 사실일까. 확인된 Claude Code 변경 이력과 현재 모델을 비교하는 방법을 짚는다.

2026-10-04논의 1회 정리

Opus가 전보다 느리고 덜 정확해졌다는 느낌은 모델 자체의 변화 때문일까, Claude Code의 설정 때문일까? 클코단에서는 성능 저하를 체감한다는 의견이 나왔다. 그래도 Astra나 Fable보다 낫다는 평가도 있었다. 재현 가능한 작업 사례는 없지만 Anthropic이 공개한 장애 분석에는 이런 체감을 해석할 단서가 있다.

품질 저하 체감에는 확인된 선례가 있다

Anthropic은 2026년 4월 Claude Code의 품질 문제를 조사해 세 가지 원인을 공개했다. 3월 4일 기본 추론 노력 수준을 high에서 medium으로 낮췄다가 4월 7일 되돌렸다. 대상은 당시의 Sonnet 4.6과 Opus 4.6이었다. 같은 모델을 골라도 노력 수준이 달라지면 결과와 대기 시간이 함께 달라질 수 있다. (anthropic.com)

별개의 세션 처리 오류도 있었다. 한 시간 이상 쉬었던 세션을 다시 열면 이전 추론 기록을 한 번만 정리해야 했는데 이후 매 차례 정리하는 문제가 생겼다. Anthropic은 그 결과 맥락을 잊거나 작업을 반복하는 현상이 나타났다고 설명했다. 이 오류는 4월 10일 수정됐다. (anthropic.com)

Opus 4.7이 나온 4월 16일에는 답변 길이를 제한하는 시스템 프롬프트 변경도 적용됐다. Anthropic은 해당 변경이 코딩 품질에 악영향을 준 사실을 확인하고 4월 20일 철회했다. 회사는 세 문제 모두 Claude Code 등 제품 계층에서 발생했으며 당시 API 자체는 영향을 받지 않았다고 밝혔다. 당시의 불만을 모두 단순한 기분 탓으로 치부할 수 없는 이유다. 그렇다고 현재 Opus에 같은 오류가 남아 있다는 근거도 아니다. (anthropic.com)

‘Opus’라는 이름만으로는 비교 대상이 정해지지 않는다

2026년 10월 4일 기준, Anthropic이 가장 최근 발표한 Opus는 9월 22일 출시한 Opus 5.5다. 앞서 Opus 4.7, 4.8, 5가 차례로 나왔다. opus 별칭으로 실행했다면 예전에 썼던 버전과 지금 실행되는 버전이 같다고 가정할 수 없다. Claude Code 문서도 opus가 최신 Opus 모델을 가리킨다고 설명한다. (anthropic.com)

비교 의견에 등장한 Fable 역시 버전을 밝혀야 한다. Anthropic은 9월 Fable 5.1을 발표했고 Opus 5.5는 대다수 작업에서 Fable 5.1 수준이라고 소개했다. 어느 모델이 더 낫다는 방의 평가는 참여자가 맡긴 작업에 대한 의견으로 읽는 편이 정확하다. (anthropic.com)

Astra와의 비교에도 같은 주의가 필요하다. Anthropic의 Opus 5.5 발표에는 GPT-6 Astra와 나란히 놓은 코딩 평가가 있지만 모델별 노력 수준과 평가 조건을 함께 명시한다. 그 표는 특정 조건의 결과이지 독자의 프로젝트에서 Opus가 언제나 우세하다는 증거가 아니다. (anthropic.com)

느림과 정확도를 한 점수로 묶지 말아야 한다

추론 노력 수준은 기다리는 시간과 답의 품질 사이에서 선택하는 설정이다. Anthropic은 과거 high에서 지나치게 오래 생각해 화면이 멈춘 듯한 사례를 줄이려 medium을 기본값으로 택했다고 설명했다. 사용자는 품질 저하를 호소했고 회사는 그 결정을 되돌렸다. ‘느려졌다’와 ‘둔해졌다’가 항상 함께 움직이지는 않는다는 사례다. (anthropic.com)

현재 Claude Code 문서에 따르면 Opus 5.5의 기본 노력 수준은 medium이고 Opus 4.7은 xhigh다. 설정을 맞추지 않은 채 두 버전의 응답 시간만 재면 모델 차이와 추론량 차이가 섞인다. 세션 헤더에서 현재 수준을 확인하고 /effort high처럼 비교할 수준을 명시할 수 있다. 지원되는 수준은 모델마다 다르다. (code.claude.com)

답이 도착하기까지의 시간과 작업이 끝나기까지의 시간도 구분해야 한다. 긴 계획을 세우느라 첫 수정이 늦어도 재작업이 적을 수 있다. 반대로 빠르게 코드를 써도 테스트 실패를 여러 번 고치면 완료는 늦어진다.

실제 사용 반응에서도 속도와 결과에 대한 평가는 엇갈린다. 어느 쪽이 맞는지는 맡긴 작업과 완료 기준 없이는 판정할 수 없다.

내 프로젝트에서 비교하려면 무엇을 고정해야 하나

개인 개발자나 소규모 팀이라면 공개 순위보다 반복해서 맡기는 작업 하나가 더 유용한 시험대다. 예를 들어 이미 실패하는 테스트가 있는 버그를 택한다. 수정 전 상태의 같은 저장소에서 시작해 두 모델에 동일한 오류 설명과 통과 조건을 준다. 산출물은 설명의 인상이 아니라 변경 파일, 테스트 결과, 사람이 다시 고친 횟수로 확인한다.

Claude Code에서는 /model로 모델을 고르거나 시작할 때 claude --model에 모델 ID를 지정할 수 있다. 비교 기록에는 표시된 모델 버전과 노력 수준, Claude Code 버전, 새 세션인지 재개한 세션인지도 남긴다. 한쪽만 오래된 대화를 품은 상태라면 모델 성능을 분리해 읽기 어렵다. 세션 처리 오류가 실제 품질 문제를 만들었던 이력도 있다. (docs.anthropic.com)

작업을 한 번씩만 실행해 승자를 선언하지는 말자. 동일한 과제를 여러 차례 실행하고 테스트 통과 여부와 전체 소요 시간을 따로 적으면 변동 폭이 드러난다. 비용을 따지는 팀이라면 사용량도 함께 비교해야 한다. Anthropic은 Opus 5.5의 입력·출력 토큰 가격을 각각 100만 토큰당 4달러·20달러로 안내한다. 하지만 토큰 가격만으로 작업당 비용이 정해지지는 않는다. 재시도와 수정까지 포함해야 한다. (anthropic.com)

‘너프’라는 판단에 필요한 증거

클코단의 발언은 분명한 문제 제기다. 다만 어느 Opus 버전에서 어떤 설정으로 어떤 작업이 실패했는지는 아직 없다. Anthropic의 사후 분석은 제품 설정과 오류가 품질 체감을 바꾼 전례를 입증한다. 최신 모델의 지속적인 성능 저하까지 입증하지는 않는다. (anthropic.com)

Opus 5.5의 공식 발표는 개선을 주장한다. 방에서는 반대 방향의 체감도 나왔다. 둘 중 하나를 전체 사용자의 경험으로 확대할 필요는 없다. 같은 코드와 통과 조건 아래 모델·노력 수준을 기록했을 때도 실패가 반복되는가. ‘Opus가 둔해졌다’는 질문에는 그 비교 결과로 답할 수 있다. (anthropic.com)

Claude CodeClaude OpusOpus 5.5성능 저하추론 노력 수준Fable 5.1

참고 링크

자주 묻는 질문

Q

Claude Code에서 Opus가 실제로 성능 저하를 겪은 적이 있나요?

있습니다. Anthropic은 2026년 4월 기본 노력 수준 변경, 세션 처리 오류, 시스템 프롬프트 변경이 품질 문제를 일으켰다고 밝혔습니다. 모두 수정됐다고 발표했으며, 당시 문제를 현재 모델의 지속적인 성능 저하로 일반화할 수는 없습니다.

Q

Opus가 느려졌는지 어떻게 비교하나요?

같은 저장소 상태와 입력, 통과 조건을 준비하고 모델 버전과 노력 수준을 기록하세요. 첫 응답 시간뿐 아니라 테스트 통과, 전체 완료 시간, 재작업 횟수를 여러 차례 비교해야 합니다.

Q

Claude Code의 Opus 노력 수준은 어디서 확인하나요?

/effort status로 현재 수준을 확인하고 /effort high처럼 변경할 수 있습니다. 모델마다 지원 수준과 기본값이 다르므로 버전도 함께 확인해야 합니다.

같은 주제 더 보기