Claude Code에서 토큰을 가장 먼저 줄일 수 있는 방법은 무엇인가요?
관련 없는 작업으로 넘어갈 때 /clear를 사용하고, 탐색 업무를 Haiku subagent로 분리하는 방법이 효과적이다. 복잡한 설계와 최종 검토에만 Opus를 쓰면 고비용 문맥의 반복 처리를 줄일 수 있다.
고성능 모델의 사용량 폭증을 줄이면서 수정 비용까지 통제하는 Claude Code 작업 분배법
ChatGPT Plus에서 복잡한 코딩 작업을 몇 번 돌렸을 뿐인데 사용량이 바닥났다는 경험이 늘고 있다. 그렇다면 싼 모델과 절약 플러그인을 붙이면 해결될까. 토큰 수보다 비싼 모델이 읽고 판단할 범위를 줄이는 게 핵심이다.
ChatGPT Plus의 월 구독료는 API 토큰을 일정량 사는 방식이 아니다. OpenAI의 설명에 따르면 Work와 Codex는 같은 사용량 풀을 공유한다. 모델과 추론 수준, 입출력 크기, 단계 수에 따라 소진량도 달라진다. 일부 계정에는 5시간 한도와 주간 한도가 함께 적용된다. (help.openai.com)
2026년 9월 공식 안내에 나온 Plus 기준 예상치는 GPT-6 Astra가 5시간당 5~45개 로컬 메시지다. GPT-5.6 Luna는 250~2,000개로 제시된다. 고성능 모델에 저장소 탐색부터 구현까지 모두 맡기면 체감 차이가 커질 수밖에 없다. 다만 해당 수치는 고정된 메시지 한도가 아니라 작업량 추정치다. (help.openai.com)
세션이 길어질수록 매 요청의 입력도 커진다. 코드 검색 결과와 테스트 로그뿐 아니라 실패한 시도까지 문맥에 남기 때문이다. Anthropic도 Claude Code 비용이 컨텍스트 크기에 따라 늘어난다고 설명하며 /clear, /compact, /usage를 관리 수단으로 제시한다. (code.claude.com)
모델 라우팅은 어려운 질문을 무조건 싼 모델에 넘기는 방식이 아니다. 파일 목록 수집, 심볼 검색, 로그 분류, 테스트 초안처럼 정답을 검사하기 쉬운 단계부터 분리해야 한다. 아키텍처 결정과 원인 불명의 버그, 최종 검토는 강한 모델이 맡는다.
공급사의 안내도 이 구분과 비슷하다. OpenAI는 Luna를 추출·분류·짧은 수정에, Astra를 낯선 문제와 어려운 디버깅에 권한다. Anthropic은 대부분의 코딩에 Sonnet을 쓰되 복잡한 구조 판단과 다단계 추론에는 Opus를 남겨두라고 안내한다. 간단한 subagent에는 Haiku를 지정할 수 있다. (help.openai.com)
써본 사람들 사이에서는 저가 모델이 만든 패치를 고치느라 오히려 호출이 늘었다는 반응도 있다. 탐색과 보일러플레이트만 넘겼을 때는 품질 저하가 작았다는 경험도 나온다. 가격표보다 중요한 지표는 ‘작업 완료까지 든 총 호출’과 ‘사람이 다시 고친 시간’이다.

Claude Code에서는 .claude/agents/ 아래에 Markdown 파일을 두어 프로젝트 전용 subagent를 만들 수 있다. YAML frontmatter의 model에는 haiku, sonnet, opus 같은 별칭을 지정하고, tools로 읽기 전용 권한만 줄 수도 있다. (code.claude.com)
첫 단계는 repo-scout.md다. model: haiku, tools: Read, Grep, Glob를 넣고 관련 파일과 호출 관계, 기존 테스트, 불확실한 부분만 반환하게 한다. 산출물 형식을 파일 경로와 근거 중심으로 고정하면 상위 모델이 저장소 전체를 다시 훑는 일을 줄일 수 있다.
---
name: repo-scout
description: Finds relevant files and tests before implementation
tools: Read, Grep, Glob
model: haiku
---
Return relevant paths, symbols, tests, and unresolved questions.
Do not edit files or propose code without file evidence.
두 번째 단계에서는 Sonnet이 조사 결과와 요구사항을 받아 구현한다. 요청할 때는 수정 허용 범위와 통과해야 할 테스트, 바꾸지 않을 인터페이스를 함께 적는다. 실패 로그 전체를 보내기보다는 실패한 테스트와 핵심 스택만 다시 전달하는 편이 낫다.
Opus는 세 번째 단계에서만 부른다. 여러 파일에 걸친 설계 충돌과 보안 경계, 반복 실패의 근본 원인을 검토하게 한다. 단순 포맷 수정이나 테스트 재실행까지 Opus에 남겨두면 라우팅의 이점이 사라진다.
DeepSeek API는 2026년 9월 현재 DeepSeek-V4.1-Flash와 V4-Pro를 제공한다. 공식 가격표에 따르면 Flash의 입력 비용은 캐시 미적중 기준 100만 토큰당 0.15~0.30달러다. 출력은 0.60~1.20달러이며 시간대별로 가격이 다르다. 같은 앞부분을 반복하면 자동 컨텍스트 캐시도 적용된다. (api-docs.deepseek.com)
Ox Alpha 웹사이트는 100만 토큰 컨텍스트와 무료 웹 채팅을 내세운다. 가입 없이 시험할 수 있지만 메시지는 응답 생성을 위해 상위 모델 API로 처리된다. 민감한 저장소를 통째로 넣기보다는 공개 코드 분석이나 재현 가능한 문제에 대한 두 번째 의견을 구할 때 적합하다. (oxalpha.com)
두 도구를 Claude Code의 완전한 대체재로 볼 필요는 없다. 저가 모델에는 오류 로그 분류와 구현 계획 초안을 맡기고 결과를 handoff.md 같은 짧은 문서로 넘길 수 있다. Claude Code는 해당 문서와 실제 파일을 대조해 구현한다. 최종 판정자는 테스트 결과다.
토큰 절약 플러그인은 긴 도구 출력과 오래된 문맥을 삭제하거나 압축한다. 제대로 작동하면 입력이 줄어든다. 하지만 관련 파일과 실패 원인까지 사라지면 모델은 같은 탐색을 반복한다. 중간에 멈추거나 잘못된 범위를 고치는 비용도 함께 계산해야 한다.
우선 Claude Code의 기본 기능으로 문맥을 관리하는 편이 예측하기 쉽다. 작업이 바뀌면 /clear를 쓰고 /compact Focus on test output and code changes처럼 보존 대상을 지정한다. 세션마다 자동으로 들어가는 CLAUDE.md에는 필수 규칙만 남긴다. 특정 업무 지침은 호출할 때만 불러오는 skills로 옮길 수 있다. Anthropic은 CLAUDE.md를 약 200줄 이하로 유지하도록 권한다. (code.claude.com)
고성능 모델 하나로 모든 단계를 밀어붙이면 편하지만 사용량 변동이 크다. 반대로 싼 모델만 연결하면 검증과 재작업이 쌓인다. 실용적인 경계는 명확하다. 탐색은 싸게, 구현은 균형 있게, 되돌리기 어려운 판단은 비싸게 처리해야 한다.
관련 없는 작업으로 넘어갈 때 /clear를 사용하고, 탐색 업무를 Haiku subagent로 분리하는 방법이 효과적이다. 복잡한 설계와 최종 검토에만 Opus를 쓰면 고비용 문맥의 반복 처리를 줄일 수 있다.