또 다른 '하네스가 중요하다'는 글 (Codex CLI > pi 및 opencode)
Another "Harness matters" post (codex cli > pi and opencode)
핵심 요약
로컬 LLM 구동 시 모델만큼이나 하네스 선택이 성능에 큰 영향을 미친다는 경험담입니다.
- 하네스 중요성 — 모델 성능을 제대로 끌어내려면 적합한 하네스 선택이 필수적임.
- Codex CLI 성능 — 기존 도구 대비 로컬 모델의 작업 수행 능력을 비약적으로 향상함.
- 도구 최적화 — 컨텍스트 내 도구 수를 제한하는 것이 모델의 집중력 유지에 효과적임.
- 커뮤니티 반응 — 하네스 차이를 모델 성능 문제로 오해하는 경우가 많다는 공감대가 형성됨.
난 OpenAI 구독도 하면서 내 LLM도 직접 돌리는 중임. DeepSeek(최신 플래시 버전)도 써봤고. 내 2x3090 + 램 환경에서 Qwen 3.8 flash Next 돌려봤는데 속도 진짜 미쳤더라!
근데 로컬 LLM은 내가 오랫동안 LLM 테스트용으로 써먹던 "3D 마리오 게임, 멀티스테이지 만들어줘" 같은 데모 말고는 실전에서 써먹은 적이 없음. 진지하게 작업할 때는 GPT 5.2나 최근 나온 5.6 Luna 같은 애들이랑 비교 자체가 안 됐거든. 벤치마크 점수는 Luna가 더 낮긴 해도 말이야.
근데 어젯밤에 일이 터짐! GPT 5.6 Luna한테 로컬 LLM용 codex cli 설정해달라고 시켰거든! (그전까진 pi.dev랑 opencode 썼음) 근데 결과 보고 진짜 지렸다! 갑자기 AA 벤치마크가 왜 그렇게 나왔는지 이해가 가더라고!
첫 번째 테스트: Codex Cli에서 3D 마리오 프롬프트 돌려봤는데 진짜 압살함. 지금까지 써본 것 중에 최고임!
근데 진짜 차이는 실무에서 드러나지! Luna가 며칠 동안 붙잡고 있던 프로젝트를 똑같이 가져와서 둘 다한테 동시에 시켜봤거든? 근데 Qwen 3.8 Flash Next가 Luna를 그냥 가지고 놀더라. 예전엔 이 프로젝트에서 Qwen이랑 DeepSeek 둘 다 결과물 제대로 못 내놨었거든.
이제는 이게 내 주력 모델이라고 자신 있게 말할 수 있음!
추신: 웹 서치 관련해서 pi-smart-web-search를 codex 스킬로 포팅해달라고 시켜봤는데, 이것도 개쩜! (나중에 깃허브에 올려야지.)
어쩌면 내가 pi.dev를 잘못 쓰고 있었던 걸지도 모르겠네. 혹시 Codex Cli랑 똑같은 퀄리티 내주는 확장 프로그램 아는 사람 있음?

