GPT-6 Astra의 ARC-AGI-3 점수가 하네스를 바꾸자 62.7%에서 99.9%로 뛰었다. 차이를 만든 건 모델이 아니라 벤더만 재현하는 추론 상태 보존이다. 도입 검토서의 점수가 어느 하네스에서 나온 값인지부터 확인하면 된다.
도입 검토 회의에 들어오는 자료는 대개 한 줄이다. 모델 이름과 점수. 어떤 환경에서 몇 번 시도해 나온 값인지는 적혀 있지 않고, 묻는 사람도 드물다. 점수는 모델의 속성이라고 다들 암묵적으로 합의하고 있기 때문이다.
이번 주 그 합의를 정면으로 깨는 수치가 나왔다. 같은 모델, 같은 벤치마크, 같은 문제인데 채점 결과가 37%포인트 갈렸다.
37%포인트는 모델 안이 아니라 요청과 요청 사이에서 나왔다
ARC Prize 9월 3일 분석에 따르면 GPT-6 Astra는 ARC-AGI-3 Semi-Private에서 표준 하네스로 62.7%, OpenAI의 Provider Adapter 하네스로 99.9%를 기록했다. 모델 가중치는 동일하다. 달라진 것은 평가 시스템이 한 행동과 다음 행동 사이에 무엇을 넘겨주느냐다.
표준 하네스에서 모델은 자기가 남기기로 고른 메모만 다음 턴으로 들고 간다. Provider Adapter 하네스는 요청 사이에 불투명한(opaque) 추론 상태를 그대로 보존하고, 대화가 길어지면 압축(compaction)해서 이어 붙인다. 앞서 한 작업을 다시 하지 않아도 된다는 뜻이다.
ARC Prize 9월 3일 결과표에서 비용을 보면 방향이 더 분명해진다.
| 하네스 | 최고 점수 | 비용 |
|---|---|---|
| Standard | 62.71% | $26,098 |
| Provider Adapter | 99.9% | $18,817 |
점수가 높은 쪽이 더 쌌다. 상태를 이어 붙이면 같은 추론을 반복하지 않으므로 토큰이 덜 든다. 우리가 에이전트 비용을 줄이려고 모델 등급을 내리는 동안, 실제 낭비는 단계마다 맥락을 처음부터 다시 쌓는 구조에 있었다는 이야기다.
그 상태는 우리 인프라로 옮겨지지 않는다
문제는 그 37%포인트가 이식되지 않는다는 것이다. 보존되는 추론 상태는 불투명하다. 우리가 읽을 수도, 직렬화해 다른 벤더 모델에 넣을 수도 없다. ARC Prize도 이 결과를 "모델과 그 도구의 결합 성능"으로 이해해야 한다고 못 박았다.
그래서 벤치마크 점수는 이제 두 개의 값으로 쪼개진다. 벤더 스택 안에서만 나오는 점수와, 우리 스택으로 옮겼을 때 남는 점수. 도입 결정이 실제로 사는 것은 후자다.
상태의 보관 주소가 계약 조건이 되는 흐름은 이미 시작됐다. GitHub 8월 28일 공지는 9월 28일 이후 Copilot 채팅을 하나의 서비스로 합치면서 채팅 데이터 보존을 28일에서 계정 수명 전체로 바꾼다고 밝혔다. 반대 방향도 있다. Anthropic 9월 2일 발표의 Enterprise Frontier Safeguards는 모니터링 데이터를 고객 소유 버킷에 고객 키로 두겠다고 했다(안전장치의 주소가 벤더 서버에서 고객의 버킷으로 바뀌었다). 어느 쪽이든 협상 대상은 모델이 아니라 상태다.
가져갈 것
- 우리 검토서에 적힌 점수는 표준 하네스 값인가, 벤더 하네스 값인가 — 원문 결과 페이지에서 직접 확인했는가?
- 우리 에이전트가 단계 사이에 넘기는 것은 벤더의 추론 상태인가, 우리가 직렬화해 저장한 텍스트인가?
- 모델을 다른 벤더로 바꿔 끼우면 진행 중이던 과제를 처음부터 다시 푸는가?
- 컨텍스트 한도에 닿았을 때 압축을 수행하는 주체가 벤더 SDK인지 우리 코드인지 답할 수 있는 사람이 팀에 있는가?
- 9월 28일 Copilot 통합처럼, 우리가 쓰는 도구의 대화·상태 보존 조건이 바뀌는 일정이 캘린더에 올라와 있는가?
안 되는 경우
- ARC-AGI-3는 규칙이 결정적이고 목표가 닫혀 있는 게임 환경이다. ARC Prize도 "실세계의 복잡성과 개방성을 대표하지 않는다"고 적었다. 사내 업무 에이전트 성능으로 그대로 환산되지 않는다.
- 이 분석에는 다른 프런티어 모델의 점수가 함께 실리지 않았다. 벤더 하네스가 모든 모델에서 같은 폭의 상승을 만드는지는 확인된 바 없다.
- $18,817과 $26,098은 벤치마크 전체 실행 비용이다. 우리 워크로드의 단가로 나눠 쓸 수 있는 수치가 아니다.
- 이미 단일 벤더로 고정하기로 결정한 조직이라면 이식성 항목의 값은 작다. 다만 그 값은 계약 갱신 시점에 다시 매겨진다.
이번 주에 바꿀 것은 하나다. 모델 도입 검토서의 '점수' 칸 오른쪽에 '하네스' 칸을 만들고, 채우지 못한 행은 비교표에서 뺀다. 어떤 모델을 쓰느냐보다 단계와 단계 사이를 누가 관리하느냐가 먼저 정해져야 하는 질문이 됐다.