OpenCode와 자체 호스팅 LLM(Qwen, Gemma 등) 성능 테스트 결과
Tested how OpenCode Works with SelfHosted LLMS: Qwen 3.5 & 3.6, Gemma 4, Nemotron 3, GLM-4.7 Flash...
핵심 요약
다양한 자체 호스팅 LLM을 OpenCode로 테스트하여 코딩 작업 성능과 속도를 비교 분석함.
- 성능 테스트 — Qwen 3.5, Gemma 4 등 여러 모델의 코딩 작업 효율성 검증
- 하드웨어 최적화 — RTX 4080 환경에서 모델별 추론 속도 및 리소스 사용량 측정
- 모델 추천 — Qwen 3.5 27b와 Gemma 4 26b가 코딩 작업에 우수한 성능을 보임
- 설정 공유 — llama.cpp 및 unsloth 양자화 모델을 활용한 테스트 환경 구축
OpenCode를 사용하여 각 LLM의 기본 준비 상태와 편의성을 확인하기 위해 두 가지 테스트를 수행했습니다:
-
Golang으로 IndexNow CLI 생성 (쉬운 작업)
-
SiteStructure 전략에 따라 웹사이트용 마이그레이션 맵 생성 (복잡한 작업)
Qwen 3.5, 3.6, Gemma 4, Nemotron 3, GLM-4.7 Flash 및 기타 여러 LLM을 테스트했습니다.
사용된 컨텍스트 크기: 25k-50k - 작업 및 모델에 따라 다름.
결과는 아래 표와 같습니다. 유용하게 활용하시길 바랍니다.
RTX 4080(16GB VRAM)에서 대부분의 자체 호스팅 LLM 속도는 아래와 같습니다(각 모델이 얼마나 빠르거나 느린지 파악하는 데 참고하세요).
기본 메모리 및 레이어 매개변수를 사용하여 llama-server를 사용했습니다. 이를 미세 조정하면 속도를 조금 더 향상시킬 수 있을 것입니다. 아니면 조금 더 많이 향상될지도 모르죠 :)
제 결론:
Qwen 3.5 27b는 제 하드웨어에 잘 맞는 매우 괜찮은 LLM입니다.
새로운 Gemma 4 26b는 매우 좋은 결과를 보여주었으며, 더 테스트해 볼 가치가 있습니다.
이 두 모델 모두 이 두 가지 작업에 대해서는 OpenCode Zen의 클라우드 호스팅 무료 LLM과 비교할 만합니다.
각 테스트에서 각 LLM의 동작에 대한 자세한 내용은 여기에서 확인할 수 있습니다: https://www.glukhov.org/ai-devtools/opencode/llms-comparison/


