Qwen3.6 27B 모델을 활용한 GitHub Copilot, Pi, Claude Code, OpenCode의 동일 작업 비교
Same task in github-copilot, pi, claude-code, and opencode with Qwen3.6 27B
핵심 요약
동일한 모델을 사용해도 코딩 에이전트 하네스에 따라 성능 차이가 극명하게 갈린다는 점을 확인한 실험기입니다.
- 코딩 에이전트 비교 — 동일한 모델을 사용해도 하네스에 따라 결과물과 성능 차이가 크게 발생함.
- OpenCode 강점 — 인터넷 검색 기능과 웹 개발 결과물 생성 능력이 다른 도구들에 비해 뛰어남.
- GitHub Copilot 문제 — 파일 편집 도구 사용 시 LLM이 반복적인 오류를 일으켜 작업 속도가 매우 느려짐.
- 평가 방식 고민 — 주관적인 판단을 넘어 자동화된 메트릭 평가 시스템을 구축하기 위해 노력 중임.
코딩 에이전트의 성능이 모델 자체에서 나오는지, 아니면 하네스(harness)에서 나오는지 궁금해서 여러 에이전트 하네스와 모델 조합을 동일한 작업으로 테스트할 수 있는 환경을 만들어 봤습니다. 위에 있는 모든 이미지는 동일한 모델을 사용했지만, 하네스만 다르게 적용한 결과입니다.
주관적인 의견이 아닌 자동화된 메트릭 평가 방식을 도입하려고 작업 중입니다.
이미지에는 나타나지 않은 몇 가지 특징을 발견했습니다:
- Opencode는 기본적으로 인터넷 검색이 가능합니다. 이 덕분에 일부 작업에서 결과가 훨씬 좋았습니다. 예를 들어 3D 프린터 필라멘트 온도 설명 페이지 등에서 구체적인 수치를 나열했습니다.
- 웹 개발 분야에서 Opencode는 정말 좋은 결과를 보여줬습니다. 여기서 직접 상호작용할 수는 없지만, 아주 잘 작동하는 멋진 인터랙티브 위젯을 만들어냈습니다.
- 모델이 GitHub Copilot과 함께 사용할 때 정말 고전합니다. 파일을 작성하는 데 보통 대여섯 번의 시도가 필요합니다. Copilot의 파일 편집 도구를 계속 망가뜨리거든요. 다른 하네스에서는 이런 문제가 없습니다. Claude Code, Pi, Opencode는 모두 pelican.svg를 만드는 데 LLM 요청이 4번이면 충분합니다. 하지만 GitHub Copilot은 13번이나 걸립니다! 편집 도구를 시도하고, bash를 시도하고, 다시 편집 도구를 시도하는 식이죠. 어떤 도구 스키마를 사용하는지는 모르겠지만, 제 테스트에서는 LLM이 정말 힘들어합니다. 같은 diff를 계속해서 다시 생성해야 하니 작업이 매우 느려집니다.
- Qwen3-vl-4는 OpenCode에서 무한 루프에 빠져서 pelican.svg 파일을 디스크에 쓰지도 못했습니다.


