Codex 앱 기본값은 258k 토큰을 넘으면 이전 대화를 압축해 GPT-5.4의 1M 컨텍스트를 못 쓴다. ~/.codex/config.toml의 auto-compact 한도를 올리면 90만 토큰까지 압축이 없다. 272K 초과 요청은 사용량이 2배로 계산되므로 대규모 리팩토링에만 켠다.
이 글은 2026년 3월 기준이다. GPT-5.4 출시 직후 가장 많이 들린 말은 100만 토큰이었다. 그런데 우리가 3월 13일에 정리한 설정법의 출발점은 모델이 아니라 앱이다. Codex 앱을 설치한 그대로 쓰면 258k 토큰에서 자동 압축이 걸리고, 모델이 받을 수 있는 양의 4분의 1 언저리에서 대화가 잘린다. Pro 구독료를 내면서 모델 사양의 일부만 쓰는 상태다.
컨텍스트 크기는 이전 대화와 이번 입력을 합쳐 모델이 한 번에 받아들일 수 있는 상한이다. Gemini와 Claude는 이미 1M이었고, ChatGPT가 이번에 그 수준을 따라왔다. Codex는 ChatGPT 쪽에서 쓰는 에이전트 도구이고, 이 상한이 실제로 얼마나 열리는지는 모델이 아니라 도구의 설정값이 정한다.
그래서 이 글의 질문은 "5.4가 얼마나 좋아졌나"가 아니다. 좋아진 사양을 내 Codex가 실제로 쓰고 있는가, 쓰게 하려면 어느 파일의 어느 줄을 고쳐야 하는가, 그리고 그 대가는 무엇인가다.
1M을 막는 것은 모델이 아니라 Codex의 auto-compaction 기본값이다
5.3과 5.4를 외부 벤치마크와 공식 문서로 비교하면 차이는 두 축으로 정리된다. 얼마나 깊게 생각하는가, 그리고 얼마나 많이 기억하는가다.
| 항목 | GPT-5.3-Codex | GPT-5.4 |
|---|---|---|
| 성격 | CLI·터미널 워크플로우에 특화된 개발 도구 | 코딩을 넘어선 통합 추론 모델 |
| 컨텍스트 상한 | 400K | 1M(100만 토큰) |
| 강점 | 속도 | 프로젝트 전체 소스를 넣고 아키텍처 단위 조언, GDPval 기준 팩트 체크 |
한도를 정하는 쪽은 도구다. Codex 앱에는 대화가 길어져 시스템이 무거워지는 것을 막는 auto-compaction이 기본으로 켜져 있고, 그 기준선이 258k 토큰이다. 이 선을 넘는 순간 앞쪽 대화는 요약본으로 줄어들거나 통째로 버려진다. 모델은 1M을 받을 수 있어도 도구가 25만 토큰 부근에서 앞 대화를 잘라내므로, 프로젝트 소스 전체를 한 번에 읽히겠다는 5.4의 용도는 설치 직후 상태에서 성립하지 않는다.
해제는 ~/.codex/config.toml의 값 다섯 개이고, 재시작 전에는 적용되지 않는다
고칠 파일은 ~/.codex/config.toml 하나다. 설정 오버라이드가 이 표준 파일에서 로드된다는 점은 codex --help 출력에서 확인된다. 여기에 덮어쓰거나 추가할 값은 다섯 개다.
| 키 | 값 | 역할 |
|---|---|---|
| model | gpt-5.4 | 5.3-Codex가 아닌 5.4를 쓴다 |
| model_reasoning_effort | xhigh | 추론 깊이. 우리가 5.4를 다 쓰는 조건으로 꼽는 값 |
| model_context_window | 1000000 | 컨텍스트 창을 1M으로 선언 |
| model_auto_compact_token_limit | 900000 | 90만 토큰까지 압축을 미룬다 |
| personality | pragmatic | 응답 성향 |
다섯 값을 넣고 나면 압축이 시작되는 지점이 258k에서 90만 토큰으로 밀려나고, 그 전까지는 앞 대화가 그대로 남는다. 다만 우리가 강조하는 줄은 컨텍스트 두 줄이 아니라 model_reasoning_effort의 xhigh다. 창만 넓히면 기억은 늘지만 추론 깊이는 그대로라서, 이 값을 빼면 5.4를 다 쓰는 상태가 아니다.
조건이 둘 더 있다. 값을 저장해도 앱을 재시작하기 전에는 반영되지 않는다. 그리고 설정 파일 경로가 안 잡히거나 터미널이 낯선 사람을 위해 같은 절차를 SKILL.md로 묶어 원문 글에 첨부해 두었다. 그 파일을 Codex에 건네며 "내가 전달한 md file 을 skill 에 등록하고 실행해줘"라고 하면 되고, 사용법은 함께 올린 README.md에 정리돼 있다.
272K를 넘는 요청은 사용량이 두 배로 계산된다
비용 조건을 빼고 이 설정을 권할 수는 없다. OpenAI 공식 안내 "Introducing GPT-5.4"는 Codex의 1M 컨텍스트를 실험적 기능으로 분류하고, 표준 272K 토큰을 넘는 요청에는 사용량을 2배로 매긴다고 적었다. 같은 작업량이라도 Pro 요금제 한도가 그만큼 빨리 줄어든다.
그래서 우리 결론은 상시 켜 두기가 아니라 작업을 둘로 나누는 것이다. 코드 몇 줄을 빨리 받는 일은 5.3-Codex 쪽이 비용 대비 낫고, 1M 설정은 리포지토리 전체를 갈아엎는 리팩토링이나 로직을 처음부터 다시 짜는 일에만 건다. 그 조건에서 달라지는 것은 AI가 먼저 끼어드는 장면이다. "아까 그 파일에서 봤던 로직이랑 꼬이는데요?" 같은 지적은 파일 하나가 아니라 프로젝트 전체를 기억한 상태에서만 나온다.
가져갈 것
-
~/.codex/config.toml에model_context_window = 1000000과model_auto_compact_token_limit = 900000이 적혀 있는가 -
model = "gpt-5.4"와model_reasoning_effort = "xhigh"도 같은 파일에 있는가 (창만 넓히고 추론 깊이를 안 올린 상태가 아닌가) - 값을 저장한 뒤 Codex 앱을 재시작했는가
- 지금 맡길 작업이 272K를 넘길 만큼 큰가 — 코드 한두 줄이면 5.3-Codex로 돌린다
- 272K 초과분이 2배로 계산돼 Pro 한도가 빨리 줄어든다는 점을 팀이 알고 켜는가
안 되는 경우
- 코드 한두 줄을 고치는 짧은 작업에는 성립하지 않는다. 이 경우 5.3-Codex가 비용 대비 낫고, 272K 아래에서 끝나는 작업이면 2배 계산도 1M도 쓸 일이 없다.
- 한도 소모 이야기는 ChatGPT Pro 요금제 기준이다. 다른 요금제에서도 1M 실험 기능이 열리는지, 2배 계산이 같은지는 확인하지 않았다.
- 자동 압축 기본값 258k와 과금 기준 272K가 왜 다른지, 압축 한도를 900,000으로 잡은 근거는 3월 글에서 따로 밝히지 않았다.
- 1M은 OpenAI가 실험적 기능이라고 못 박은 상태다. 검증한 Codex 앱 버전을 적어 두지 않았으므로 설정 키 이름과 기본값은 이후 버전에서 달라질 수 있다.
이번 주에 바꿀 것은 새 모델을 켜는 순서다. 대규모 리팩토링에 5.4를 쓰기로 했다면 프롬프트를 쓰기 전에 ~/.codex/config.toml을 먼저 열어 auto-compact 한도가 258k에 머물러 있는지 확인하고, 272K 초과분이 2배로 계산된다는 조건을 팀의 요금제 한도와 같은 자리에서 검토한다. 모델을 바꿀 때마다 도구의 기본값을 같이 읽는 습관이 AX 전환에서 모델 선택보다 먼저 온다. 사업영역 →