GPT-6 Astra와 Claude Fable 5.1 중 코딩 비용은 어느 쪽이 낮나요?
두 모델의 API 기본 입력·출력 단가는 같다. 실제 비용은 캐시 재사용, 추론량, 도구 호출과 재시도 횟수에 따라 달라지므로 작업 단위로 비교해야 한다.
기획과 코딩을 나눠 쓰자는 경험담부터 토큰 비용과 코드 비대화 논쟁까지, 실제 프로젝트에서 모델을 고르는 기준을 짚는다.
Claude Code를 쓰던 개발자가 GPT-6 Astra로 옮기면 코딩 결과도 나아질까? Fable 5.1의 만족도, Astra의 새 작업 처리 능력, Opus 5.5의 간결함을 두고 평가가 갈린다. 답을 찾으려면 모델 점수뿐 아니라 완성된 패치와 그 비용을 함께 봐야 한다.
Anthropic은 9월 1일 Claude Fable 5.1을 출시했다. OpenAI의 GPT-6 Astra는 이틀 뒤 등장했다. 두 모델의 API 기본 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 같다. 가격표만 봐서는 어느 쪽이 더 경제적인지 가릴 수 없다. (platform.claude.com)
클코단 논의에선 Fable의 전반적인 만족도와 토큰 대비 효용이 낫다는 의견이 나왔다. 처음부터 만드는 작업에는 Astra를 쓰겠다는 구분도 있었다. 비교 대상인 Fable이 Claude Code에서 실행됐는지, Codex를 거쳐 실행됐는지도 중요하다. 도구와 작업 방식까지 달라지면 모델만 바꾼 비교가 아니기 때문이다.
캐시 조건도 계산에 넣어야 한다. Anthropic 문서상 Fable 5.1의 캐시 읽기는 100만 토큰당 0.25달러다. OpenAI 문서의 Astra 캐시 입력 가격은 1달러다. 같은 자료를 반복해서 읽는 작업이라면 기본 입력·출력 단가가 같아도 청구액은 달라질 수 있다. 다만 캐시가 실제로 얼마나 재사용됐는지는 작업 기록으로 확인해야 한다. (platform.claude.com)
9월 22일 출시된 Claude Opus 5.5는 Fable 5.1보다 기본 단가가 낮다. Anthropic 문서의 가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러다. Anthropic은 일반적인 작업에서는 Opus 5.5부터 고르고 더 까다로운 장기 작업에 Fable 5.1을 검토하라고 안내한다. Fable이 만족스럽다는 경험과 모든 코딩 작업에 Fable이 경제적이라는 판단은 별개다. (platform.claude.com)
클코단에는 같은 엑하 설정에서 Astra가 필요 이상으로 많은 코드를 만들었다는 사례가 공유됐다. 해당 작업에서는 Opus 5.5가 더 짧은 수정으로 끝났다는 평가다. 한 사례만으로 Astra의 고정된 성향이나 제품 하자를 단정할 수는 없다. 다른 사용자들 사이에는 Astra가 지시를 더 잘 따른다는 반응도 있고 Opus 쪽이 작업에 착수하기 전 지나치게 신중하다는 불만도 있다.
공식 평가도 한 줄로 정리되지는 않는다. Anthropic이 공개한 Terminal-Bench 4.0 결과는 Opus 5.5가 66.4%, Fable 5.1이 55.8%다. 표에 실린 Astra의 57.9%는 OpenAI가 보고한 수치라고 Anthropic이 명시했다. 반대로 OpenAI는 Terminal-Bench Science 0.1에서 Astra가 Fable 5.1보다 높은 결과를 냈다고 발표했다. 평가 과제와 실행 조건이 다르므로 어느 숫자 하나를 자신의 코드베이스에 대한 승리 선언으로 읽기는 어렵다. (anthropic.com)

Astra와 Claude 모델은 모두 xhigh 노력 수준을 지원한다. 그러나 노력 수준은 정확한 토큰 예산이 아니라 추론 깊이를 조절하는 신호다. Anthropic도 모델별 노력 수준의 이름이 같은 사고량을 보장하지 않는다고 설명한다. 같은 엑하를 선택한 비교는 유용한 출발점이지만 소비 토큰까지 같게 만든 실험은 아니다. (platform.claude.com)
Claude Code와 Codex를 번갈아 썼다면 실행 환경도 기록해야 한다. 어떤 파일을 읽었는지, 테스트를 몇 번 돌렸는지, 도구 호출과 재시도가 얼마나 있었는지가 최종 비용에 영향을 준다. 모델이 작성한 코드 줄 수만 세면 문제를 푸는 데 필요한 변경과 불필요하게 넓어진 변경을 구분하지 못한다.
작은 팀이라면 진행 중인 저장소의 수정 과제 하나와 새 기능 과제 하나를 골라 비교할 수 있다. 동일한 저장소 상태에서 요구사항과 수정 범위, 통과할 테스트를 먼저 적는다. 각 모델에는 같은 입력을 준다. 완성 뒤에는 테스트 결과와 변경 파일, 추가된 의존성, 재작업 횟수, 사용량을 남긴다. 산출물은 감상이 아니라 검토 가능한 패치와 실행 기록이어야 한다.
클코단에서는 기획을 Astra에, 구현을 Fable에 맡기자는 의견도 나왔다. 장점은 두 모델의 결과를 서로 검토할 수 있다는 점이다. 하지만 첫 모델이 모호한 계획을 내놓으면 다음 모델이 그 빈칸을 임의로 채울 수 있다. 분업 자체보다 두 단계 사이에 무엇을 넘기는지가 중요하다.
예를 들어 기획 단계에는 사용자 동작과 손대면 안 되는 파일, 완료 조건을 입력한다. 다음 단계에는 장문의 대화 대신 확정된 요구사항과 테스트 조건을 전달한다. 구현 모델이 돌려준 패치는 처음 정한 범위와 대조한다. 그러면 기획·코딩 분업이 시간을 아꼈는지, 두 모델을 오가느라 검토가 늘었는지도 확인할 수 있다.
Astra만 비싸다고 느껴진다면 같은 계열의 Sol·Luna도 비교 대상이다. OpenAI는 9월 22일 GPT-6 Sol과 Luna를 공개했고 API 입력·출력 단가를 각각 2·10달러와 0.10·0.50달러로 안내한다. 낮은 단가가 낮은 작업 비용을 보장하지는 않는다. 실패와 재시도가 잦은 과제라면 가격 차이를 다시 계산해야 한다. (openai.com)
OpenAI는 Astra를 복잡한 코딩과 다단계 작업을 위한 주력 모델로 소개한다. Anthropic은 Opus 5.5가 자사 에이전트 코딩 평가에서 더 적은 호출과 토큰으로 작업을 끝냈다고 발표했다. 둘 다 검토할 근거지만 어느 발표도 특정 팀의 저장소에서 생길 수정 비용을 대신 측정해 주지는 않는다. (developers.openai.com)
클코단의 엇갈린 경험은 그래서 유용하다. Fable의 사용감, Astra의 지시 이행, Opus 5.5의 간결함 중 무엇이 우선인지는 과제에 따라 바뀐다.
Astra로 옮길지 결정하는 기준은 첫 응답의 인상이 아니다. 같은 요구사항에서 테스트를 통과하고 불필요한 변경을 줄이며 감당할 비용으로 끝낸 패치가 어느 쪽인지다.
두 모델의 API 기본 입력·출력 단가는 같다. 실제 비용은 캐시 재사용, 추론량, 도구 호출과 재시도 횟수에 따라 달라지므로 작업 단위로 비교해야 한다.
Anthropic은 일반적인 작업에 Opus 5.5를 먼저 권하고, 더 어려운 장기 작업에는 Fable 5.1을 검토하도록 안내한다. 자신의 저장소에서는 같은 과제의 테스트 결과와 최종 비용을 비교하는 편이 정확하다.
같은 이름의 설정을 맞출 수는 있지만, xhigh는 고정된 토큰 예산이 아니다. 저장소 상태와 요구사항을 통일하고 사용량·재시도·최종 패치까지 기록해야 비교에 가까워진다.