Grok·DeepSeek 토큰, 3MB 게임 번역은 왜 한도를 녹이나
AI 모델·프롬프트

Grok·DeepSeek 토큰, 3MB 게임 번역은 왜 한도를 녹이나

파일 크기와 토큰은 어떻게 다르며, Claude Code에서 대용량 번역 비용을 통제하려면 무엇을 바꿔야 할까

2026-09-21논의 1회 정리

3MB짜리 고전 게임의 영어 텍스트를 한국어로 옮겼더니 Grok 사용량이 바닥났다는 경험이 나왔다. 반면 같은 서비스를 오래 썼다는 평가도 있었다. 체감이 이렇게 다른 이유는 무엇일까. DeepSeek처럼 저렴한 API를 Claude Code에 연결하면 문제가 풀릴까.

3MB는 작지만 모델에는 작은 문서가 아니다

파일 탐색기에 보이는 용량은 토큰 수가 아니다. LLM은 텍스트를 단어와 부분 문자열, 문장부호 같은 단위로 쪼갠다. 같은 글도 모델의 토크나이저와 언어에 따라 토큰 수가 달라진다.

영문 위주의 3MB 파일은 내용에 따라 수십만 토큰을 훌쩍 넘길 수 있다. 여기에 지시문과 용어집, 대화 이력, 한국어 출력까지 더해진다. 한국어처럼 영문과 분절 방식이 다른 언어는 출력 토큰도 별도로 측정해야 한다. 한국어 특화 토크나이저가 생성 안정성과 효율을 높일 수 있다는 연구도 나왔다. (arxiv.org)

컨텍스트 창과 사용량 한도도 구분해야 한다. 컨텍스트 창은 한 번의 요청에서 모델이 다룰 수 있는 범위다. 구독 한도는 일정 기간 제공되는 연산량에 가깝다. 큰 파일이 창 안에 들어가더라도 번역 결과를 길게 생성하면 사용량은 빠르게 줄 수 있다.

현재 xAI 문서상 Grok 4.6의 컨텍스트는 50만 토큰이다. 입력은 100만 토큰당 2달러, 출력은 6달러다. 프롬프트가 20만 토큰을 넘으면 장문 요율이 적용된다. 소비자용 Grok의 막대와 API 과금은 별도 체계이므로 둘을 같은 ‘토큰 잔액’으로 해석하면 안 된다. (docs.x.ai)

한 번에 넣을수록 두 번째 요청부터 더 비싸진다

대용량 번역에서 가장 흔한 실수는 원문 전체를 대화에 붙인 뒤 수정 요청을 이어가는 방식이다. 두 번째 요청에는 원문과 이전 번역, 수정 지시가 다시 포함될 수 있다. 대화가 길어질수록 새 문장 몇 줄을 고칠 때도 거대한 과거 문맥을 읽힌다.

써본 사람들 사이에서는 새 대화를 열었더니 사용량 감소가 완만해졌다는 반응이 나온다. 반면 초기 상태에서도 큰 폭으로 줄었다는 불만도 있다. 두 경험은 충돌하지 않는다. 선택한 모드와 출력 길이, 첨부 파일, 추론 강도, 누적 문맥이 다르면 요청 한 번의 연산량도 달라진다.

xAI는 API 응답의 usage 객체에 입력·출력 토큰과 실제 청구 비용을 돌려준다. 여러 차례 이어진 대화의 비용은 요청별 값을 직접 합산해야 한다. 컨텍스트 압축은 다음 호출의 입력량을 줄이지만 압축 작업 자체도 토큰을 소비한다. (docs.x.ai)

그래서 사용량 막대만 바라보는 구독형 서비스보다 API가 대량 작업을 예측하기 쉽다. 일부를 먼저 번역한 뒤 입력 토큰과 출력 토큰, 재시도율을 기록하면 총비용의 범위를 잡을 수 있다.

게임 번역은 파일이 아니라 문자열 묶음으로 처리한다

실전에서는 원본 파일을 그대로 던지지 않는다. 먼저 JSON, CSV, PO 같은 구조에서 번역할 값만 추출한다. ID와 분기 코드, 제어문자, {player_name}이나 %s 같은 플레이스홀더는 별도 필드로 보호한다.

다음 순서가 재현하기 쉽다.

  1. 원본을 복사하고 문자열마다 변하지 않는 ID를 붙인다.
  2. 등장인물명, 아이템명, 말투를 담은 용어집을 만든다.
  3. 작업량에 맞춰 묶음을 나눈다.
  4. 각 묶음에 ID와 원문을 넣고 id, ko, note 형식으로 받는다.
  5. 결과를 ID 기준으로 원래 파일에 병합한다.
  6. 플레이스홀더, 따옴표, 줄바꿈, 인코딩을 자동 검사한다.

묶음마다 새 요청을 보내되 이전 번역 전체를 대화 이력에 싣지 않는 것이 중요하다. 공통으로 필요한 용어집과 규칙만 앞부분에 고정하면 캐시도 활용하기 좋다. 실패한 묶음만 다시 보내므로 중간 중단에도 강하다.

PO 파일이라면 GNU gettext의 msgfmt --check 계열 검사를 활용할 수 있다. 원문과 번역문의 형식 인자가 맞지 않으면 실행 전에 오류를 찾는다. 현지화 문서들도 %s 같은 변수를 번역 과정에서 바꾸지 말라고 명시한다. (docs.translatehouse.org)

DeepSeek를 Claude Code에 연결하면 바뀌는 것

2026년 9월 21일 기준 DeepSeek 공식 API의 deepseek-flash는 100만 토큰 컨텍스트를 제공한다. Flash의 피크 요금은 입력 100만 토큰당 0.30달러, 출력 1.20달러다. 캐시 적중 입력은 0.006달러이며 비혼잡 시간에는 절반 요율이 적용된다. 충전액은 토큰 묶음이 아니라 이 사용료에서 차감되는 잔액이다. (api-docs.deepseek.com)

Claude Code에 붙이는 절차도 공식 문서에 공개돼 있다. Claude Code를 설치한 뒤 ANTHROPIC_BASE_URL을 DeepSeek의 Anthropic 호환 주소로 설정한다. 이어 ANTHROPIC_AUTH_TOKEN과 모델 환경변수를 지정하고 프로젝트 폴더에서 claude를 실행하면 같은 터미널 인터페이스로 DeepSeek 모델을 호출한다. (api-docs.deepseek.com)

여기서 사용하는 것은 Claude 모델이 아니라 Claude Code라는 실행 도구다. 모델의 번역 품질과 지시 준수, 도구 호출 방식은 달라질 수 있다. 저렴한 모델로 초벌 번역을 만들고 중요한 대사나 UI만 상위 모델과 사람이 검수하는 구성이 현실적이다.

Claude Code 자체는 Pro 월 20달러, Max 월 100달러와 200달러 요금제에 포함된다. Console 계정으로 쓰면 API 토큰 요금이 별도로 붙는다. 대화식 개발은 구독제가 편하지만 수백 개 묶음을 순차 처리하는 번역은 사용량을 기록할 수 있는 API 방식이 관리하기 쉽다. (code.claude.com)

싼 모델보다 재번역이 적은 흐름이 오래 버틴다

저렴한 단가는 큰 파일 앞에서 매력적이다. 그러나 용어가 흔들리거나 태그가 깨지면 수정 요청과 재생성이 늘어난다. 번역료가 낮아도 검수 시간이 길어지면 개인 개발자에게는 더 비싼 선택이 된다.

비교 기준은 ‘얼마를 충전했는가’가 아니다. 샘플 묶음의 총 토큰과 통과한 문자열 비율, 수정에 든 시간, 플레이스홀더 오류 수를 함께 봐야 한다. 같은 작업도 에이전트 실행 경로에 따라 토큰 소비가 크게 달라진다. 더 많이 쓴다고 정확도가 계속 오르지는 않는다는 연구 결과도 있다. (arxiv.org)

3MB 번역에서 먼저 사라지는 것은 크레딧이 아니라 작업 구조다. 원문 전체를 한 대화에 쌓으면 어떤 모델도 빠르게 무거워진다. 문자열을 추출해 작은 묶음으로 번역하고 요청별 비용과 검수 실패를 남기면 Grok과 DeepSeek의 차이도 막연한 체감이 아닌 계산 가능한 선택지가 된다.

Grok 토큰DeepSeek APIClaude Code게임 번역LLM 비용토큰 최적화

참고 링크

자주 묻는 질문

Q

3MB 영어 텍스트는 대략 몇 토큰인가요?

파일 형식과 모델의 토크나이저에 따라 크게 달라 정확한 환산은 어렵습니다. 번역 전 실제 모델의 토큰 계산 기능으로 샘플을 측정하고, 한국어 출력과 지시문 비용까지 따로 더해야 합니다.

Q

DeepSeek 크레딧을 충전하면 Claude Code에서 쓸 수 있나요?

DeepSeek가 제공하는 Anthropic 호환 API 주소와 키를 Claude Code 환경변수에 설정하면 됩니다. 인터페이스는 Claude Code지만 실제 응답과 요금은 선택한 DeepSeek 모델을 따릅니다.

Q

게임 텍스트를 한 번에 번역하면 왜 위험한가요?

긴 원문과 이전 응답이 후속 요청마다 다시 처리될 수 있고, 출력도 별도 토큰을 소비합니다. 문자열 ID를 유지한 작은 묶음으로 나누면 비용 측정, 실패 재시도와 자동 검수가 쉬워집니다.

같은 주제 더 보기