Qwen3.6-27B를 3단계 크리틱 하네스로 돌려보는 중. 하네스가 생각보다 훨씬 중요하네
Been running Qwen3.6-27B through a 3-critic harness. The harness matters more than I thought
핵심 요약
Qwen3.6-27B 모델에 3단계 크리틱 하네스를 적용해 보니, frontier 모델과 견줄만한 성능을 보여줌.
- 모델 성능 — Qwen3.6-27B는 벤치마크대로 레포 수준의 추론과 코드 생성 능력이 뛰어남
- 하네스 역할 — 3단계 크리틱 파이프라인이 모델의 실수를 보완해 최종 품질을 크게 향상함
- 최적 조합 — 복잡한 계획은 frontier 모델이, 대량의 구현은 Qwen이 담당하는 것이 효율적임
- 실행 환경 — vLLM 등 서빙 환경 설정에 따라 모델의 반복 루프 현상이 발생할 수 있음
Qwen3.6-27B (8-bit) 모델을 며칠 동안 GLM5.2와 함께 내 코딩 하네스에서 돌려보는 중이야. 이 하네스는 코드 리뷰, 테스트 리뷰, Playwright e2e라는 3개의 크리틱을 사용하는데, 출력을 수락하기 전에 각각 새로운 컨텍스트를 사용해.
Qwen3.6은 27B 밀집 모델치고는 진짜 괜찮아. 벤치마크가 거짓말한 게 아니었어. 레포 수준의 추론도 처리하고 꽤 괜찮은 코드를 만들어내. 물론 frontier 모델보다는 실수가 좀 더 많긴 해. 예상했던 바지.
예상치 못했던 건 frontier 모델을 위해 만든 3-크리틱 파이프라인이 여기서도 아주 잘 맞는다는 거야. 크리틱들이 추가적인 실수들을 잡아내거든. 하네스가 흐름을 깨지 않고 재시도 오버헤드를 처리해 줘. 크리틱들이 작업을 마친 후의 출력물은 최종 품질 면에서 frontier 모델이 돌린 것과 차이를 거의 못 느낄 정도로 좋아. 그냥 과정이 좀 더 시끄러울 뿐이지.
한 가지, 이번 실행 계획은 Qwen3.6이 아니라 GLM5.2가 작성했어. 내 생각엔 추론이 가장 중요한 곳엔 frontier 모델을 쓰고, 하네스가 에러를 잡아주는 대량 구현 작업에는 Qwen3.6을 쓰는 게 최적의 조합인 것 같아.

