Pacman 벤치마크: Qwen 3.6 27b로 드디어 실현 가능한 로컬 에이전트 코딩
The pacman benchmark: finally a viable local agentic coding agent with Qwen 3.6 27b
핵심 요약
Qwen 3.6 27b F16 모델을 활용해 복잡한 코딩 에이전트 작업을 성공적으로 수행한 사례와 팁 공유.
- 양자화 차이 — 16비트와 8비트 양자화 사이에는 성능상 큰 격차가 존재함.
- 채팅 템플릿 — 모델 성능을 최대로 끌어내기 위해 공식 템플릿 수정이 필수적임.
- MTP 디코딩 — 코딩 같은 결정론적 작업에서 속도 향상 효과가 뚜렷함.
- 하드웨어 요구사항 — 27B 모델의 F16 성능을 온전히 활용하려면 96GB 이상의 VRAM이 권장됨.
새로운 모델을 테스트하는 방법 중 하나는 고전 아케이드 게임인 팩맨을 단일 웹페이지로 복제하는 코드를 한 번의 프롬프트(one-shot)로 작성하게 하는 것입니다. 보통 3번 시도해서 가장 좋은 결과를 남기죠. 지금까지 Anthropic, ChatGPT, Google 모델을 포함해 모두 실패했고, 대부분 처참했습니다. 지금까지는 GLM 5.1이 최고였죠.
하지만 Qwen 3.6 27b F16으로 시도했을 때는 달랐습니다. 3번 시도 중 2번이 압도적으로 좋았고, 최고 결과물은 사소한 오류만 있었죠! 하지만 8비트 양자화로 낮추자마자 5번 넘게 시도해도 좋은 결과를 재현할 수 없었습니다. 이는 제가 경험을 통해 오랫동안 말해온 것을 증명합니다. 대부분의 사람이 손실이 없거나 거의 없다고 주장하지만, 16비트와 8비트 양자화 사이에는 엄청난 차이가 존재합니다.
결과가 너무 좋았고, 마침 제 자체 양자화 모델으로 llama.cpp MTP 추측 디코딩 PR(당시엔 아직 병합 전)을 테스트 중이었으며, Qwen 3.5/3.6을 위한 자체 고정 jinja 채팅 템플릿을 개발 중이었기에, Qwen 3.6 27b F16을 제대로 된 에이전트 코딩 워크플로우에 넣어보기로 했습니다. 결과는 정말 훌륭했고, 그 자체로 증명된다고 생각합니다. 전체 단일 페이지 게임은 여기서 해볼 수 있습니다:
배운 점과 관찰한 내용:
-
좋은 채팅 템플릿은 필수입니다. 공식 채팅 템플릿은 vLLM만을 타겟으로 해서 다른 도구에서는 오류가 많아 사용할 수 없었습니다. 커뮤니티 템플릿으로 시작했는데 개선은 되었지만 여전히 기이한 점이 많았죠. 그래서 공식 템플릿의 버그를 하나씩 수정하고 천천히 개선하기 시작했습니다. 에이전트 세션 초기에는 기이한 동작과 오류 때문에 고통스러웠지만, 템플릿을 잘 조정하고 나니 모델의 새로운 지능 수준이 잠금 해제된 느낌이었습니다.

