GPT-5.5 vs Opus 4.6 vs Opus 4.7 조직 맥락 벤치마크: 모델별 사용처와 행동 차이 분석
Benchmarked GPT-5.5 vs Opus 4.6 vs Opus 4.7 on organizational context. If you want to understand where to use each model and the difference in their behavior then this is for you.
핵심 요약
하네스 설계에 따라 GPT-5.5와 Opus 모델들의 성능 순위가 뒤바뀌며, 모델별 최적의 워크플로우가 다름을 입증함.
- 하네스의 영향력 — 모델 자체의 체급보다 명시적인 가이드라인과 증거 분류 체계인 하네스가 성능 순위를 결정함.
- GPT-5.5의 특성 — 명시적인 절차적 스캐폴딩과 도구 프로토콜이 주어질 때 잠재력이 극대화되는 모델임.
- Opus 4.6의 강점 — 하네스가 부족한 상황에서도 의도를 스스로 파악하고 복잡한 추론을 수행하는 능력이 뛰어남.
- 맞춤형 아키텍처 — 모델별 약점에 맞춘 스캐폴딩을 제공하는 '모델 프로필 기반 워크플로우' 구축이 핵심임.
나는 GPT-5.5, Opus 4.6, Opus 4.7 세 가지 모델을 대상으로 조직 메모리(organizational-memory) 벤치마크를 진행해 왔어.
이 벤치마크는 일반적인 상식 퀴즈 평가가 아니야. 에이전트가 가상의 SaaS 회사를 위한 시간적 지식 그래프(temporal knowledge graph)를 사용하고 다음과 같은 실제 업무 질문에 답할 수 있는지를 테스트해:
- "이 이슈가 공식적으로 어디서 추적되고 있는가?"
- "어떤 이벤트가 먼저 발생했는가?"
- "이 고객 에스컬레이션이 제품 로드맵에 어떤 영향을 미쳤는가?"
- "이 임원의 주장이 다른 증거들과 일치하는가?"
- "영업, CS, 제품, 엔지니어링, 재무 부서 간에 정보가 어떻게 이동했는가?"
흥미로운 점은, 하네스(harness)를 바꿨을 때 리더보드가 극적으로 변했다는 거야.
V2 결과
Opus 4.6: 84.5%
Opus 4.7: 76.2%
GPT-5.5: 74.6%
이 시점에서 GPT-5.5는 가장 약했어. Opus 4.6이 확실히 앞서 있었지.
그 후 V3 하네스 개선 사항을 추가했어. 모델 변경이 아니라, 증거 분류에 관한 더 나은 프로토콜을 적용한 거야.
주요 추가 사항은 다음과 같은 것들 사이의 엄격한 구분이었어:
- 주요 기록(Primary records): 질문받은 내용을 추적하거나 결정하기 위해 특별히 생성된 기록.
- 보조 기록(Secondary records): 다른 것을 추적하면서 해당 내용을 단순히 언급만 한 기록.
- 비공식 증거(Informal evidence): Slack, DM, 1:1 노트, 무심코 던진 언급.
- 액션 아이템 또는 보류 중인 기록: 완료의 증거가 아님.
이게 중요한 이유는 에이전트들이 인접한 언급만 보고 "공식 추적" 중이라고 환각(hallucinate)을 일으키는 경우가 많기 때문이야.
V3 결과
GPT-5.5: 86.1%
Opus 4.7: 84.9%
Opus 4.6: 84.9%
GPT-5.5가 꼴찌에서 1등이 됐어.
이 결과는 내가 모델 선택을 생각하는 방식을 바꿔놓았지.
GPT-5.5
GPT-5.5는 명시적인 절차적 스캐폴딩(scaffolding)에 매우 민감하게 반응하는 것 같아. V2에서는 암시적인 평가 규칙, 특히 지식 공백 탐지에서 어려움을 겪었어. 하네스가 숨겨진 규칙을 명시적으로 만들자마자 가장 큰 폭으로 개선되었지.
이것은 애플리케이션이 다음과 같은 것들을 제공할 수 있을 때 GPT-5.5가 특히 강력할 수 있음을 시사해:
- 명확한 도구 프로토콜
- 명시적인 증거 규칙
- 구조화된 답변 요구사항
- 검증 및 재시도 루프
- 카테고리별 지침
작업을 엄격한 워크플로우로 운영할 수 있을 때 GPT-5.5를 사용할 것 같아.
Opus 4.6
Opus 4.6은 추가적인 스캐폴딩이 없었을 때 가장 강력했어. 이는 모델 스스로 숨겨진 작업 구조를 더 많이 추론해냈음을 의미해.
하네스가 덜 규정적일 때 광범위한 종합과 지저분한 추론에 능숙해 보여. 하지만 정확한 시간 순서와 날짜 고정(date anchoring)에 있어서는 여전히 약점이 있었어.
나는 Opus 4.6을 다음과 같은 경우에 사용할 거야:

