같은 달에 같은 도구를 도입한 두 회사를 반년 뒤에 다시 만나면 결과가 갈려 있다. 한쪽은 배포 주기가 줄었고, 다른 쪽은 리뷰 대기열만 길어졌다. 구독료도, 모델도, 사내 교육 시간도 비슷했다.
이 차이는 보통 "활용도"로 설명된다. 프롬프트를 잘 쓰는 사람이 많았다거나, 임원이 더 밀어줬다거나. 8월 첫째 주에 나온 조사들은 다른 답을 가리킨다.
AI는 조직의 실력을 평준화하는 장치가 아니다. 이미 있던 격차를 그대로 확대하는 장치다.
같은 도구가 조직에 따라 반대 방향으로 작동한다
DORA는 지난해 보고서에서 AI의 역할을 증폭기로 규정했다. 잘하는 조직의 강점을 키우고, 망가진 조직의 역기능도 같이 키운다는 것이다. 8월 4일 InfoQ가 정리한 Perforce 조사는 이 명제에 숫자를 붙였다. 플랫폼 엔지니어링이 성숙한 조직에서는 73%가 플랫폼 성숙도를 AI 성과의 결정적 요인으로 꼽았고, 덜 성숙한 조직에서는 44%였다.
여기서 중요한 건 응답 비율 자체가 아니라 그 아래 숫자들이다. 인프라 워크플로에 이미 AI를 쓰는 조직은 66%인데, 배포까지 자율에 넘긴 곳은 31%다. 전용 플랫폼 팀을 둔 곳은 28%. DORA 집계(76%)와 차이가 크지만 모집단과 정의가 달라 그대로 비교할 수는 없다. 두 조사가 공통으로 말하는 건 하나다. 내부 플랫폼 품질이 낮으면 AI가 조직 성과에 미치는 효과는 거의 0에 수렴한다.
격차가 벌어지는 방향조차 모르는 조직이 있다
GitHub은 8월 7일 Copilot 사용량 메트릭 API에 서드파티 에이전트별 집계를 추가했다. totals_by_3rd_party_agent 배열 안에 agent_id와 작업 시작 횟수가 들어간다. 그전까지 에이전트 활동은 전부 한 덩어리였다. 어떤 에이전트가 실제로 쓰이는지, 새로 깐 것이 기존 것을 대체했는지 보완했는지 구분할 방법이 없었다.
같은 changelog에 주의 사항이 하나 붙어 있다. 이 중첩된 카운트를 최상위 필드와 합산하지 말라는 것. 벤더는 "AI가 얼마나 일했나"를 한 숫자로 뽑아주지 않는다. 계측을 스스로 설계하지 않은 조직은 자기 격차가 어느 쪽으로 벌어지는지 관측조차 못 한다.
잘못된 보조는 보조가 없는 것보다 나쁘다
같은 날 InfoQ가 다룬 장애 대응 쪽 결론은 더 직접적이다. AI의 진단이 맞을 때 사람의 성과는 확실히 올라간다. 반대로 오해를 유발하는 보조는 AI 없이 일할 때보다 성과를 떨어뜨린다. 상방과 하방이 대칭이 아니다.
여기에 '레프트오버 원칙'이 겹친다. 쉬운 장애를 AI가 처리하면 사람은 쉬운 장애로 훈련할 기회를 잃는다. 남는 일은 드물고 모호한 장애인데, 그걸 다룰 손은 그동안 녹슬었다. 기사가 제시한 대책은 새 도구가 아니라 게임데이, 카오스 엔지니어링, 정기 장애 훈련이다. DORA 조사에서 AI 출력에 '높은 신뢰'를 보인 개발자가 3%에 그쳤던 것과 같은 이야기다. 신뢰는 모델 성능이 올려주는 값이 아니라 검증 절차가 만들어내는 값이다.
교육 현장에서 이 결론은 커리큘럼의 순서를 바꾼다. 도구 사용법을 먼저 가르치면 증폭기의 방향을 정하지 못한 채 출력만 늘어난다. 조녁컴퍼니가 AX 전환 교육을 검증·반복·프로세스 순으로 짜는 이유가 여기 있다.