어떤 모델과 어떤 하네스를 써야 할까? 데이터 가져왔음.
Which model, which harness? I have data for you.
핵심 요약
로컬 LLM 에이전트의 성능과 속도를 비교한 벤치마크 데이터를 공유하고, 하네스 선택의 중요성을 강조함.
- 벤치마크 결과 — 하네스에 따라 동일 모델도 성능 차이가 큼
- 성능 비교 — 로컬 모델이 특정 조건에서 클라우드 모델과 대등함
- 추천 조합 — 안정성은 opencode/omp, 속도는 qwen3.8-flash-next-strata 조합
- 데이터 기여 — 웹사이트를 통해 누구나 자신의 환경을 테스트하고 공유 가능
실제 작업들(기초 수학, 비전, 컴퓨터 사용(이메일 읽기, 스토어 탐색), 코딩)로 하니스(harness)랑 모델 셋업을 계속 테스트 중임. 벤치마크랑 리더보드도 만들었으니까 여기서 확인해 봐: https://airbench.ai/leaderboard?k=poL
이건 성능(각 작업별 성공률 %)이랑 속도를 측정함.
참고로 Claude Code Opus 5.5는 100% (14분 26초) 찍음.
로컬에서도 zcode/4xRTX6k/glm-5.3-flash-NVFP4 쓰면 똑같은 점수 가능함: 100% (31분 13초). 퀄리티는 같은데 좀 더 느릴 뿐임.
약간의 오차를 감수하면 속도를 더 올릴 수 있음:
-
DSHv0.2rc2/RTXPRO6000WS/qwen3.8-flash-next-NVFP4: 98% (23분 30초)
-
qwen3.8-flash-next-iq3_xxs-strata가 속도 면에선 갑임: opencode에서 96% (7분 41초), omp에서 94% (11분 31초). 그래, Claude Code보다 빠름!!!!
기타 발견한 점들:
1) 로컬 하드웨어에서는 모델만큼이나 하니스가 중요함. 똑같은 5090에서 똑같은 strata 양자화 모델을 돌려도 하니스에 따라 점수가 22%에서 96%까지 널뛰기함.
2) 이제 로컬도 독점 모델(proprietary models)이랑 비벼볼 만함. 두 가지 예시:
3) 최고의 모델 (RTX 5090 단일 카드 기준)
-
swift-1.5-qwen3.8-27b-q6_k가 제일 안정적임. pi / omp / opencode에서 각각 96 / 94 / 92% 찍었고, 5개 하니스 평균 82%로 테스트한 모델 중 최고임.
-
qwen3.8-flash-next-iq3_xxs-strata는 속도 원툴: opencode에서 7분 41초에 96%, omp에서 11분 31초에 94% 나옴.
-
qwen3.8-27b-nvfp4도 96%까지 가능하긴 한데, 1시간 40분에서 1시간 50분 걸리고 하니스빨을 엄청 탐(37%에서 96%까지).
-
성능 깎아먹는 주범: MTP 변형 모델들은 쓸 때마다 성능이 떨어짐(nvfp4-mtp 평균 52% vs 없는 버전 70%; swift는 pi에서 MTP 쓰면 96%에서 55%로 떡락). 65k 컨텍스트도 성능 저하 유발함(45–61%). Gemma-4-26b는 빠르긴 한데 47%가 한계임.
4) 최고의 하니스
공정한 비교를 위해 5개 하니스 모두 동일한 5090에서 돌린 모델 3개(swift q6_k, flash-next-strata, 27b-nvfp4)를 기준으로 비교함:
-
opencode: 평균 94% (92 / 96 / 94)
-
omp: 91% (94 / 94 / 86)
-
pi: 71% (96 / 80 / 37)
-
hermes: 67% (82 / 22 / 96)
-
openclaw: 56% (45 / 53 / 69)

