Gemma4-31B, Qwen3.8-27B, 6.1-Sol 모델의 소프트웨어 엔지니어링 작업 성능 비교
Engineer / developer observations of Gemma4-31B, Qwen3.8-27B, and 6.1-Sol for software engineering work
핵심 요약
로컬 LLM과 최신 클라우드 모델의 코딩 성능을 비교한 결과, 로컬 모델도 유용하지만 클라우드 모델의 압도적인 성능 차이가 확인됨.
- 모델 성능 비교 — Gemma4는 효율적이고 빠른 반면 Qwen3.8은 더 끈기 있게 복잡한 작업을 수행함.
- 클라우드 모델 우위 — 6.1-Sol 모델은 로컬 모델과는 차원이 다른 완성도와 문맥 이해도를 보여줌.
- 로컬 모델의 한계 — 로컬 모델은 간단한 작업에는 적합하지만 복잡한 레거시 코드 분석에는 아직 부족함.
- 향후 테스트 계획 — 로컬 모델의 실전 역량을 검증하기 위해 복잡한 레거시 코드베이스 분석을 시도할 예정임.
참고로 알아두라고 적어본다.
나는 기계공학 전공에 지난 20년 동안 소프트웨어 엔지니어로 굴러먹은 사람이다. 요즘 로컬 모델 가지고 노는 게 취미라, 오늘 내가 평소에 하는 '진짜' 업무랑 비슷한 작업들로 모델이랑 하네스 조합을 좀 테스트해 봤다.
너무 딱딱하게 굴 건 없고, 대충 이런 식으로 진행했다:
모델: Gemma4-31B vs Qwen3.8-27B (둘 다 동일한 양자화 적용, Unsloth 버전 Q4)
하네스: Codex CLI vs OpenCode CLI
작업 유형: "이 코드 좀 설명해 봐" 그리고 "새로운 거 하나 만들어 보자"
GPT 6.1-Sol은 나중에 끼워 넣을 거다. 하네스 차이는 지금 단계에선 별 의미가 없어서 굳이 길게 떠들진 않겠다.
저장소 검사 및 분석
내가 아주 잘 아는 레퍼런스 저장소를 하나 골라서, 대충 이런 식으로 프롬프트를 날렸다. "읽기 전용으로 훑어보고, 이 라이브러리가 뭔지, 핵심 추상화는 뭔지, 사용자 입장에서 X, Y, Z 상황에서 뭘 주의해야 하는지, 그리고 이 접근 방식의 장단점은 뭔지 900자 이내로 정리해 줘."
Qwen이랑 Gemma 둘 다 분석 결과는 훌륭했고 답변도 좋았다. 다만 관점이 살짝 달랐음. 눈에 띄는 건 Gemma4가 Qwen보다 훨씬 효율적이었다는 거다. 시킨 대로 딱딱 맞춰서 일했고, 서버 호출도 훨씬 적었다(하네스에 따라 다르지만 대충 10번 vs 20~30번 정도). Qwen은 좀 더 호기심이 많은 건지, 시킨 것보다 더 깊게 파고들어서 전체적인 그림을 좀 더 완벽하게 그려내려는 경향이 있었다.
근데 결국 결과물은 둘 다 비슷하게 좋았다. 효율성만 따지면 난 Gemma4 쪽에 손을 들어주고 싶다.
새로운 프로젝트 만들기
범위가 딱 정해져 있고, 레거시 코드나 외부 의존성 크게 안 타는, 내가 직접 짜면 1~2일 정도 걸릴 만한 앱을 하나 생각해 봤다. 전체적인 컨셉, 사용자 경험, 설계 제약 사항, 미래 확장성까지 포함해서 프롬프트를 8문단 정도로 짰다. 언어는 C#이고 백엔드 재사용 가능하게, 프론트엔드는 WPF로.
여기서부터는 차이가 좀 확실히 보였다.
Gemma4는 여전히 효율적이었다. 계획도 빠르고 실행도 빨랐다. 결과물 점수는 B- 정도. 쓸만한 결과물 뽑으려면 피드백 몇 번 더 줘야겠지만, 이 정도면 나쁘지 않다! 수정 두 번 정도 돌려보고 평가 끝내고 치웠다.
Qwen3.8은 Gemma4만큼 '똑똑'하진 않은데, 대신 엄청 '끈질기다'. 작업하다가 자잘한 실수를 많이 함. using 문 빼먹거나, 지 발에 걸려 넘어지는 듯한 사소한 실수들이 잦았는데, 그래도 목표를 높게 잡고 끝까지 물고 늘어지더라. 시간은 확실히 훨씬 더 걸렸다. 첫 결과물은 Gemma보다 한 수 위였고, 수정 딱 한 번 거치니까 바로 실무에 쓸만한 수준이 나왔다. 점수는 B+. 결과물도 탄탄하고 Gemma보다는 확실히 낫다.
Qwen3.8이 내 방 조명까지 깜빡거리게 만들면서 열일하고 있을 때, 심심해서 ChatGPT 데스크톱 앱 켜고 6.1-Sol한테 똑같은 프롬프트를 던져봤다. 결과는? A+. 그냥 체급 자체가 다르다. 사용자 의도를 파악하는 수준부터가 다름. 한 방에 "자, 다 됐다. 배포해라" 수준의 결과물을 내놓는다.
오픈 웨이트 모델 두 개 비교해 보는 거 꽤 재밌었다. 개인용 하드웨어에서 돌리기엔 충분히 쓸만한 수준이었고. 물론 최첨단 연구소 모델들이랑 비빌 급은 아니지만 말이다.
다음에는 진짜 개발자들의 지옥 같은 작업, 그러니까 낡아빠진 레거시 코드 분석하는 걸 시켜보면 재밌을 것 같다. 그런 벤치마크도 있으면 좋을 텐데! 나중에 Doom이나 Command & Conquer 소스 코드 같은 거 가져와서 테스트해 봐야겠다.



