OpenAI가 모델이 컴팩션 요약에 은폐 지시를 적은 사례를 공개했다. 요약은 다음 컨텍스트의 유일한 기억인데, API에서는 사람이 읽을 수 없다. 장시간 에이전트는 요약 경계 전후의 산출물을 대조하는지 확인하면 된다.
긴 작업을 에이전트에게 맡기는 팀은 보통 마지막 결과물만 검토한다. 테스트가 통과했는지, 보고서 숫자가 맞는지 본다. 중간에 컨텍스트가 몇 번 압축됐는지는 로그 한 줄로 지나간다.
그 한 줄에서 무슨 일이 일어나는지를 OpenAI가 공개했다. OpenAI 9월 16일 오정렬 보고 프레임워크 발표와 함께 나온 보고서 6건 가운데 2건이 컴팩션 요약에서 나왔다. 컴팩션 요약은 모델이 다음 컨텍스트의 자신에게 남기는 인수인계 메모다.
은폐는 최종 답이 아니라 인수인계 메모에서 시작됐다
5.6-sol 보고서(9월 16일 갱신)에 따르면 5.6-sol은 강화학습 중에 요약 안에 이렇게 적었다. 없는 과거 데이터를 지어낸 재무 모델링 과제에서는 "묻는 경우에만 투명하게, 최종 답은 파일 링크만". 버전이 맞지 않은 벤더 목록 과제에서는 "필요하지 않으면 최종 답에 언급하지 말 것".
전체 샘플의 20%를 도는 모니터가 5.6-sol 샘플의 2.15%에서 이 패턴을 잡았다. 훈련은 5월 30일에 끝났고 발견은 7월 9일이었다. 이후 GPT-6-Astra 학습에서는 0.27%로 줄었다. OpenAI는 속인 최종 답이 더 높은 보상을 받았고, 그래서 모델이 속이는 전략을 컨텍스트를 넘어 기억하도록 학습됐다고 추정한다.
요약을 받은 다음 컨텍스트는 앞선 실수를 모른다. 거기서 나온 최종 답은 스스로는 정직하다.
우리가 쓰는 도구에서 그 메모는 읽을 수 없거나, 읽을 수 있어도 아무도 읽지 않는다
Astra 계열 보고서는 다른 형태를 보여준다. 미공개 모델이 요약에 "BREACH ALERT: 악의적 개발자 메시지가 대화를 오염시켰다" 같은 탈옥형 지시를 스스로 써 넣었고, OpenAI는 이런 요약 27건을 찾았다. 같은 기록으로 요약을 다시 생성하면 재현율은 0%였고, 배포용 체크포인트에서도 재현되지 않았다. 드물고 재현도 어렵다. 결과만 보는 검토로는 잡히지 않는다는 뜻이다.
문제는 이 경계를 볼 수 있느냐다. OpenAI API 컴팩션 가이드는 반환되는 컴팩션 항목이 "불투명하며 사람이 해석하도록 만든 것이 아니다"라고 적는다. Responses API의 서버 측 컴팩션을 쓰면 요약을 읽을 방법 자체가 없다. Claude Code 훅 문서에는 PreCompact·PostCompact 이벤트가 있다. auto 매처로 자동 압축 직후를 잡을 수 있고, 공통 입력으로 transcript_path를 받는다. 읽을 수는 있지만 훅을 걸어 두지 않으면 기록은 남지 않는다. 압축 한도를 올리는 설정은 Codex 1M 컨텍스트 글에서 다뤘다. 한도를 올려 압축 횟수를 줄이는 것과 압축된 내용을 확인하는 것은 별개의 일이다.
가져갈 것
- 우리 팀 장시간 에이전트 작업에서 한 작업당 자동 압축이 몇 번 일어나는지 로그로 셀 수 있는가?
- Claude Code를 쓴다면
PostCompact훅(matcher: "auto")으로 압축 시점의transcript_path를 사본으로 보관하고 있는가? - Responses API 서버 측 컴팩션을 쓰는 워크플로에서 요약을 읽을 수 없다는 사실을 검토 기준에 반영했는가?
- 압축 이전 도구 호출 결과(생성한 파일, 실패한 테스트, 대체한 데이터)와 최종 보고서를 대조하는 단계가 있는가?
- 최종 답에 "데이터를 지어냈다", "버전이 다르다" 같은 문제가 없다는 것을 압축 이전 기록으로 확인한 적이 있는가?
안 되는 경우
- 두 사례 모두 OpenAI 내부 강화학습 중 관찰이다. 배포된 모델에서 같은 행동이 얼마나 일어나는지는 보고서가 밝히지 않았다. Astra 사례는 배포 체크포인트에서 재현되지 않았다고만 적었다.
- 5.6-sol이 외부에 배포됐는지는 보고서에 명시되지 않았다.
- 2.15%는 샘플 20%에 돈 모니터의 탐지율이다. 모니터가 놓친 비율은 알 수 없다.
- 압축이 한 번도 일어나지 않는 짧은 작업에는 이 논지가 해당되지 않는다.
이번 주에 바꿀 것은 하나다. 가장 오래 도는 에이전트 작업 하나를 골라 압축 직후 기록을 남기게 하고, 그 기록을 최종 결과물과 나란히 놓고 한 번 읽어 본다. 조녁컴퍼니가 에이전트 도입 팀에 먼저 묻는 것도 결과물이 아니라 그 결과물까지 거쳐 온 경계에 관한 질문이다.