Gemma 4 31B 성능 보고 깜짝 놀랐다
Gemma 4 31B's competence surprised me
핵심 요약
Gemma 4 31B가 코드 구조 이해와 종속성 파악에서 Qwen 3.6보다 뛰어난 성능을 보여 놀랐다는 사용자 경험 공유.
- Gemma 4 31B — 코드 구조 이해 및 종속성 파악 능력에서 우수한 성능을 보임
- Qwen 3.6 비교 — 코드 수정 시 과도하게 개입하는 경향이 있어 Gemma가 더 안정적임
- 벤치마크 의문 — 일반적인 벤치마크 결과와 실제 사용 경험 간의 괴리에 대해 질문함
- 사용자 경험 공유 — 학계 연구 및 코드 통합 작업에서 모델별 차이를 체감함
이제 막 로컬 LLM으로 코딩 시작한 뉴비임. '바이브 코딩' 같은 건 관심 없고, '출판 아니면 죽음'인 학계에서 생산성 좀 올려보려고 하는 중임. 예전에 짠 코드들이 워낙 개판이라 LLM들이 이해를 잘 못함. 내가 쓰는 모델들이 워낙 마이너한 데다 주석도 거의 없고, 변수명도 엉망이라(공부하면서 코드 수정할 때 변수명 안 바꾸고 그대로 둔 게 많음) LLM들이 엉뚱한 거에 꽂히거든. 그래서 로컬 LLM을 내 코딩 워크플로우에 녹여내려고 아주 신중하게 접근하고 있음.
early test에서 로컬 모델들이 논문에 나온 모델을 코드로 어떻게 구현했는지 설명하는 능력을 테스트해 봤는데, Qwen 3.6 모델들이 압도적이더라고. 그래서 박사 논문 때 썼던 개판인 코드를 확장하는 테스트 프로젝트를 돌려봤는데, Gemma 4 31b가 Qwen 3.6(27b랑 35b a3b 둘 다)을 완전히 압살해서 진짜 깜짝 놀랐음. 심지어 Opus 4.7이 평가하기를 자기 성능이랑 거의 맞먹는 수준이라더라. This repo에 프로젝트 내용 자세히 적어놨음.
결론부터 말하자면 Gemma 4 31b는 내 코드 조각들이 어떻게 맞물려 돌아가는지 파악하는 능력이 미쳤음. 코드 한 군데를 고치면 다른 부분에 어떤 영향이 가는지 정확히 알고 있더라. 반면에 Qwen 3.6 모델들은 좀 과하게 설침. 내가 준 파일 전체를 수정 계획이랑 같이 통째로 다시 써버리거나, 작업 디렉토리 밖으로 접근하려고 하더라고. Qwen 3.6 27b가 Gemma나 Opus가 놓친 개선점을 하나 찾아내긴 했는데, 그건 내가 준 노트북 파일에서 쓰지도 않는 하위 컴포넌트였고, 코드 전체의 연관성을 이해해서 나온 결과라기보단 그냥 그 부분만 툭 건드린 거라 좀 아쉬웠음.
이건 다 내 개인적인 경험이고, 원래 글 쓸 생각도 없었음. 모델마다 프롬프트를 조금씩 다르게 주긴 했지만, 성능 차이가 내 예상이랑 너무 달라서 도저히 글을 안 쓸 수가 없더라. 혹시 비슷한 경험 한 사람 있음? 내가 찾는 이런 능력들을 제대로 측정해 주는 벤치마크 아는 사람? 대부분 벤치마크 보면 Qwen이 Gemma보다 잘 나오는 것 같은데 말이야. SciCode 벤치마크에서는 Gemma가 Qwen을 이기던데, 앞으로는 이걸 기준으로 삼아야 하나 싶기도 하고. 내가 모델한테 뭘 기대해야 하는지 제대로 파악하고 있는 건지도 모르겠네. 다들 어떻게 생각하는지 궁금함.

