Codex와 GPT-6 Astra가 50% 빨라졌다는데 왜 작업은 여전히 느릴까
도구·라이브러리

Codex와 GPT-6 Astra가 50% 빨라졌다는데 왜 작업은 여전히 느릴까

출력 속도 개선 발표와 실제 코딩 작업의 대기 시간은 다르다. TPS, 추론 시간, 도구 호출, 사용량을 나눠 살폈다.

2026-10-07논의 1회 정리

Codex를 실행해 두고 다른 일을 해야 할 만큼 느리다는 경험과 GPT-6 Astra의 속도가 개선됐다는 소식은 모순일까. 답은 ‘속도’가 무엇을 재느냐에 달려 있다. 이번 개선이 코딩 작업의 완료 시간과 구독 사용량까지 바꿨는지 살펴봤다.

50% 개선은 작업 완료 시간이 아니라 출력 속도다

OpenAI는 10월 5일 GPT-6 Astra와 GPT-6.1 Sol이 구독 기반 이용에서 기본 설정으로 약 50% 빠르게 텍스트를 생성한다고 알렸다. 별도의 Fast 또는 Ultrafast 설정을 켤 필요는 없다. 다만 OpenAI 도움말은 추론, 도구 사용, 여러 단계의 실행까지 똑같이 빨라지는 것은 아니라고 명시한다. (community.openai.com)

Codex가 파일을 읽고 수정한 뒤 테스트를 실행하는 동안에도 화면에 글자가 출력되지 않는 시간은 흐른다. 출력 토큰 속도인 TPS가 올라도 그 구간이 길면 완료 시각의 차이는 작을 수 있다. 방에서는 Codex 작업을 걸어 둔 채 다른 일을 한다는 경험이 공유됐다. 공식 발표와 그 경험은 서로 다른 시간을 가리킨다.

개선율의 기준점도 중요하다. 예컨대 초당 20토큰이 30토큰이 되면 증가율은 50%지만 같은 600토큰을 출력하는 데 걸리는 시간은 30초에서 20초로 줄어든다. 그 앞뒤로 도구 실행에 몇 분이 든다면 체감은 달라진다. 이 계산은 원리를 보여주는 예시일 뿐, Astra의 실측 TPS는 아니다.

TPS와 레이턴시를 함께 봐야 하는 이유

TPS는 텍스트가 나오기 시작한 뒤의 생성 속도를 보여준다. 첫 출력까지의 시간은 기다림의 시작 부분을 나타낸다. 전체 작업 시간에는 파일 탐색, 명령 실행, 테스트, 재시도까지 들어간다. OpenAI의 지연 시간 최적화 문서도 토큰 처리 속도 외에 출력량과 요청 횟수가 시간을 좌우한다고 설명한다. (developers.openai.com)

Astra 발표 자료에는 더 빠른 작업 완료 수치도 있다. OpenAI는 OSWorld 2.0 지연 시간 시뮬레이션에서 Astra가 GPT-5.6 Sol보다 작업당 시간을 약 47% 줄였다고 밝혔다. Codex 실행 환경과 Astra를 결합한 Mind2Web 평가에서는 기존 GPT-5.6 Sol 경험보다 완료 속도가 1.9배였다고 한다. 두 결과는 특정 평가 환경의 수치다. 사용자의 저장소에서 같은 비율로 빨라진다는 보장은 아니다. (openai.com)

방에서는 Astra의 레이턴시가 나아졌어도 Opus와 비교하면 답답하다는 평가가 있었다. 실제 사용 의견에서도 개선을 느꼈다는 반응과 여전히 느리다는 반응이 엇갈린다. 어느 한쪽을 전체 이용자의 측정 결과로 일반화할 수는 없다. 비교하려면 같은 작업, 비슷한 입력, 동일한 추론 수준에서 첫 출력과 최종 완료를 따로 재야 한다.

Astra, Sol, Opus 비교에서 놓치기 쉬운 비용

속도가 비슷해 보여도 작업에 쓰는 토큰과 요금은 다르다. OpenAI의 표준 API 가격은 100만 토큰당 Astra 입력 10달러·출력 50달러, GPT-6.1 Sol 입력 2달러·출력 10달러다. 반복해 읽는 입력의 캐시 가격은 각각 1달러와 0.10달러다. 이는 API 가격이며 Codex 구독 사용량의 환산표는 아니다. (openai.com)

OpenAI는 자체 DeepSWE 1.1 평가에서 GPT-6.1 Sol이 Astra와 같은 점수를 약 5분의 1 비용으로 냈다고 발표했다. 그렇다고 모든 코딩 요청의 결과나 소요 시간이 같다는 의미는 아니다. 어려운 버그의 원인을 좁히는 작업과 작은 화면 수정은 필요한 추론 단계부터 다르다. 출력 속도 하나로 두 모델의 효율을 정하기 어렵다. (openai.com)

Opus를 비교 대상으로 삼을 때도 ‘누가 TPS에서 앞섰나’만으로는 선택하기 힘들다. 한 번에 통과한 수정인지, 후속 지시와 테스트가 몇 차례 필요했는지까지 작업 시간이기 때문이다. 방에서도 고가 요금제의 대기 시간과 모델별 사용량 소진을 함께 물었다. 실사용 의견 역시 모델의 빠르기와 사용량에 관해 갈렸지만 동일 조건의 검증 수치로 받아들일 근거는 부족하다.

빠른 모드를 켜면 사용량 문제도 풀릴까

기본 속도 개선과 유료 속도 설정은 별개다. OpenAI에 따르면 Fast는 더 빠른 응답을 제공하지만 Codex 구독에 포함된 사용량을 더 많이 쓴다. Astra의 Ultrafast는 출시 시점에 Pro 500과 일부 Enterprise·Edu 작업 공간에서만 이용할 수 있다. Plus나 Pro 100·200에서 크레딧을 구매하는 것만으로 해당 기능이 열리지는 않는다. (help.openai.com)

높은 요금제가 모든 대기 시간을 없애는 것도 아니다. OpenAI 도움말은 Pro 100·200·500에 현재 5시간 사용 한도가 없다고 안내하면서도 포함된 전체 사용량은 남는다고 설명한다. Work와 Codex는 구독 사용량을 공유한다. 사용량은 고정된 메시지 수가 아니라 모델, 입력·출력 크기, 추론 수준, 작업 단계에 따라 달라진다. 남은 양과 재설정 시각은 Settings → Usage에서 확인할 수 있다. (help.openai.com)

API로 작업을 돌리는 개발자는 장부가 또 다르다. API의 Fast는 표준 처리보다 토큰당 가격이 높고 Ultrafast는 별도 서비스 등급이다. OpenAI는 여러 도구 호출이 이어지는 에이전트 작업에서 연결 오버헤드가 속도 이득을 깎을 수 있다고 안내한다. 구독 한도와 API 청구액을 한 수치처럼 비교해서는 안 된다. (developers.openai.com)

같은 작업을 재면 속도 개선의 가치가 드러난다

개인 개발자나 작은 팀이라면 자주 반복하는 작업 하나가 좋은 비교 대상이다. 같은 저장소 상태에서 같은 수정 요청을 보내고 모델과 추론 수준, Fast 설정을 기록한다. 첫 출력까지의 시간, 최종 완료 시간, 테스트 통과 여부, 추가 수정 횟수를 각각 적으면 된다. 구독 이용자는 작업 전후 Settings → Usage 변화도 함께 확인할 수 있다.

측정 대상은 작은 함수 수정과 여러 파일을 건드리는 버그 수정처럼 나누는 편이 낫다. 전자에서는 출력 속도 차이가 잘 드러나고 후자에서는 도구 실행과 재시도의 비중이 커질 수 있다. 작업이 유난히 멈춘 듯하면 승인 대기나 서비스 장애 여부도 구분해야 한다. OpenAI 역시 느리거나 중단된 Codex 작업에서 승인 대기와 서비스 상태를 확인하도록 안내한다. (help.openai.com)

Astra가 얼마나 빨라졌는지보다 중요한 질문은 내 작업의 대기 시간이 얼마나 줄었느냐다. 출력 속도 50% 개선은 분명한 변화다. 하지만 완료 시간과 사용량을 같이 재기 전에는 그 변화가 기다릴 만한 코딩 경험을 만들었는지 알 수 없다.

CodexGPT-6 AstraGPT-6.1 SolTPS레이턴시Fast 모드

참고 링크

자주 묻는 질문

Q

GPT-6 Astra가 50% 빨라졌는데 Codex 작업은 왜 느린가요?

OpenAI가 밝힌 약 50% 개선은 기본 설정의 텍스트 생성 속도에 관한 것이다. Codex 작업에는 추론, 파일 작업, 도구 실행과 테스트 시간도 포함돼 전체 완료 시간은 같은 비율로 줄지 않을 수 있다.

Q

Codex에서 Fast 모드를 켜면 사용량이 더 빨리 줄어드나요?

OpenAI는 Fast 모드가 더 빠른 응답을 제공하는 대신 구독에 포함된 사용량을 더 쓴다고 안내한다. 실제 소진량은 모델, 추론 수준, 입력과 출력 크기, 작업 단계에 따라 달라진다.

Q

GPT-6 Astra와 GPT-6.1 Sol 중 무엇이 더 경제적인가요?

표준 API의 입력·출력 토큰 가격은 GPT-6.1 Sol이 Astra의 5분의 1이다. Codex 구독에서는 API 가격을 그대로 적용할 수 없으므로, 같은 작업의 결과와 완료 시간, 사용량 변화를 비교해야 한다.

같은 주제 더 보기