Ox Alpha는 지금도 무료인가요?
Ox Alpha라는 무료 스텔스 시험은 끝났고 정체는 GLM-5.3-Flash로 공개됐다. OpenRouter에서는 현재 유료 토큰 가격이 표시되므로 호출 전에 최신 가격을 확인해야 한다.
무료 스텔스 모델의 정체는 GLM-5.3-Flash였다. 성능 수치와 연동법, 실전 한계를 다시 확인했다.
Ox Alpha를 Claude Code에 연결하면 값비싼 프런티어 모델을 대신할 수 있을까. 무료 스텔스 모델로 등장했던 정체는 밝혀졌다. 다만 답은 모델 이름보다 벤치마크 조건과 에이전트 호환성에 달려 있다.
Ox Alpha는 2026년 8월 20일 OpenRouter에 등장했다. 당시 모델 ID는 stealth/ox-alpha였으며 개발사 이름은 공개되지 않았다. 104만8576토큰 컨텍스트와 텍스트·이미지·영상 입력을 지원했고 무료로 제공됐다.
Z.ai는 8월 26일 Ox Alpha가 GLM-5.3-Flash였다고 공식 발표했다. 익명 배포 기간에는 OpenRouter와 OpenCode의 실제 트래픽으로 모델과 추론 인프라를 시험했다고 설명했다. 현재는 옛 스텔스 ID보다 z-ai/glm-5.3-flash를 쓰는 편이 안전하다.
GLM-5.3-Flash는 전체 3200억 개, 활성 180억 개 매개변수를 가진 MoE 모델이다. 선형 어텐션과 희소 어텐션을 결합했으며 가중치는 MIT 라이선스로 공개됐다. 직접 구동할 수는 있지만 기본 FP8 체크포인트만 약 306GiB여서 개인용 GPU 한 장에 올릴 모델은 아니다.
무료 체험으로 화제를 모았지만 현재 OpenRouter 가격표에는 입력 100만 토큰당 0.075달러, 출력은 0.25달러로 표시돼 있다. 여전히 저렴하다. 그러나 ‘영구 무료 Claude Code’라는 초기 설명은 더 이상 정확하지 않다.
Ox Alpha를 유명하게 만든 수치는 코딩 과제 성공률 80%였다. 그러나 해당 시험은 DeepSWE 과제 10개 중 8개를 해결한 소규모 실행이었다. 한 문제만 달라져도 점수가 10%포인트 움직이기 때문에 전체 순위로 해석하기 어렵다.
공개된 별도 평가 저장소에서는 DeepSWE v1.1의 113개 과제를 실행해 73개를 통과했고 64.6%를 기록했다. Z.ai의 자체 평가도 DeepSWE v1.1에서 63.4점이었다. 재현 가능한 범위는 80%라는 첫인상보다 60%대 중반에 가깝다.
제조사 평가에서 Terminal Bench 2.1은 84.3점, 도구 사용을 측정하는 Toolathlon Verified는 78.4점이었다. 모두 Z.ai가 공개한 수치다. 다른 회사 모델과 비교하려면 하네스와 추론 설정도 함께 확인해야 한다. GLM-5.3-Flash는 reasoning_effort를 지정하지 않을 경우 max로 작동하므로 시간과 출력 토큰도 늘어난다.
사용자들 사이에서는 긴 코드 리뷰와 여러 파일을 잇는 수정에 강하다는 반응이 나온다. 반면 단순 작업에서도 오래 추론하거나 도구 호출 중 오류가 나서 작업이 멈춘다는 경험도 있다. 강한 모델이 곧 안정적인 코딩 에이전트라는 뜻은 아니다.
Claude Code는 모델 자체가 아니라 파일 읽기, 편집, 셸 실행을 묶은 에이전트 하네스다. OpenRouter가 Anthropic Messages 호환 엔드포인트를 제공하므로 백엔드를 GLM-5.3-Flash로 바꿀 수 있다. 별도 프록시는 필요하지 않다.
다음 환경변수를 같은 터미널에서 설정한 뒤 claude를 실행한다.
export OPENROUTER_API_KEY="sk-or-..."
export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_AUTH_TOKEN="$OPENROUTER_API_KEY"
export ANTHROPIC_API_KEY=""
export ANTHROPIC_MODEL="z-ai/glm-5.3-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="z-ai/glm-5.3-flash"
export ANTHROPIC_DEFAULT_SONNET_MODEL="z-ai/glm-5.3-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="z-ai/glm-5.3-flash"
export ANTHROPIC_DEFAULT_FABLE_MODEL="z-ai/glm-5.3-flash"
export CLAUDE_CODE_SUBAGENT_MODEL="z-ai/glm-5.3-flash"
claude
베이스 URL 끝에는 /v1을 붙이지 않는다. 기존 Anthropic 로그인이 남아 있다면 /logout 후 다시 실행한다. /status에서는 OpenRouter 주소를 확인한다. 모든 기본 모델과 서브에이전트에 같은 ID를 지정하지 않으면 보조 작업이 유료 Claude 모델로 넘어갈 수 있다.
OpenRouter 역시 Claude Code와 비 Anthropic 모델의 조합을 완전히 보장하지 않는다. 지연 로딩 도구 같은 Claude 전용 동작은 400 오류를 일으킬 수 있다. MCP가 많거나 서브에이전트를 자주 쓰는 프로젝트라면 작은 과제부터 실행해 도구 호출을 검증해야 한다.
긴 컨텍스트가 저장소 전체를 무조건 넣어도 된다는 뜻은 아니다. 파일이 늘수록 입력 비용이 커지고 주의도 분산된다. 개인 개발자는 독립된 worktree에서 실제 이슈 하나를 맡긴 뒤 수정 파일과 테스트 결과를 비교하는 방식으로 평가할 수 있다.
먼저 버그 재현 절차와 관련 디렉터리, 실행할 테스트 명령을 준다. 이후 원인 조사, 수정, 테스트 실행, diff 검토를 차례로 요구한다. 산출물은 설명문이 아니라 통과한 테스트와 검토 가능한 패치여야 한다.
Ox Alpha 시절에는 제공자가 프롬프트와 응답을 보관한다고 OpenRouter가 명시했다. 현재는 개발사가 공개됐지만 호출 경로별 데이터 정책은 따로 확인해야 한다. 고객 저장소나 비밀키가 든 파일은 가격과 관계없이 외부 모델에 보내지 않는 편이 맞다.
GLM-5.3-Flash는 저렴한 장문 코딩 모델로서 경쟁력이 충분하다. 반복적인 테스트 작성, 대규모 코드 탐색, 초안 리팩터링처럼 검증 가능한 작업에서는 비용 면에서도 유리하다. 오픈 가중치라 특정 API 사업자에게만 묶이지 않는다는 장점도 있다.
다만 Claude Code의 시스템 프롬프트와 도구 설계는 Claude에 맞춰 발전했다. 모델 점수가 비슷하더라도 도구 선택과 오류 복구에서는 차이가 생긴다. Ox Alpha가 남긴 가장 유용한 답은 ‘무료라서 바꾼다’가 아니다. 같은 이슈를 두 작업 공간에 맡기고 어느 쪽 패치가 실제 테스트를 통과하는지 확인하라는 것이다.
Ox Alpha라는 무료 스텔스 시험은 끝났고 정체는 GLM-5.3-Flash로 공개됐다. OpenRouter에서는 현재 유료 토큰 가격이 표시되므로 호출 전에 최신 가격을 확인해야 한다.
OpenRouter API 키와 Anthropic 호환 베이스 URL을 설정한 뒤 모델 ID를 z-ai/glm-5.3-flash로 지정한다. 보조 모델과 서브에이전트도 같은 ID로 매핑해야 의도하지 않은 Claude 호출을 줄일 수 있다.
긴 코드 탐색과 검증 가능한 구현 작업에는 유력한 저비용 대안이다. 다만 Claude Code의 일부 도구 기능은 비 Anthropic 모델에서 다르게 작동하므로 전면 전환보다 프로젝트별 비교가 적합하다.