Gemma 4 31B vs Qwen 3.5 27B: 긴 문맥 작업에 뭐가 더 나을까? 내 생각...
Gemma 4 31B vs Qwen 3.5 27B: Which is best for long context worklows? My THOUGHTS...
핵심 요약
24GB VRAM 환경에서 긴 문맥 처리를 위한 Gemma 4와 Qwen 3.5의 성능 비교 및 사용 경험 공유.
- 모델 성능 비교 — Gemma 4는 문맥 이해와 문체가 뛰어나고, Qwen 3.5는 속도와 긴 출력물 유지력이 우수함.
- 하드웨어 제약 — 24GB VRAM 환경에서 두 모델 모두 로컬 구동 시 최상의 성능을 보여주는 실질적인 선택지임.
- 속도와 최적화 — Gemma 4는 초기 속도가 느리지만 Unsloth 업데이트로 개선 가능하며, Qwen 3.5는 전반적으로 더 빠름.
- 할루시네이션 차이 — Gemma 4는 덜 환각을 일으키지만 세부 정보를 놓칠 수 있고, Qwen 3.5는 더 꼼꼼하지만 가끔 사실 관계 오류가 발생함.
- 내 사양: i7 12700K | RTX 3090 TI | 96GB RAM
- 모델: Qwen 3.5 27B UD Q5/Q6_K_XL | Gemma 4 31B UD Q4_K_XL
핵심부터 말하자면:
현재 Gemma 4 31B와 Qwen 3.5 27B는 24GB 카드를 위한 최고의 로컬 모델입니다. 마침표.
저는 모든 것을 테스트해 봤습니다. 이 두 모델은 그 크기에서 실제로 최첨단(state-of-the-art)처럼 느껴지는 첫 번째 모델들입니다.
지금까지 대부분의 모델은 적당히 성능이 나오는 참신한 수준에 불과했습니다. 재작성, 요약, 간단한 코딩, RPG 외의 실제 사용 사례에는 별로 유용하지 않았죠. 하지만 모든 로컬 모델은 긴 문맥 추론과 분석에서 형편없는 성능을 보였습니다.
벤치마크는 아무 의미 없습니다. 저에게는 쉬운 테스트가 하나 있었습니다: 로컬 모델을 로드하고, 50K 데이터를 입력한 뒤 질문에 답하고 분석을 제공하라고 하는 것이죠. 대부분의 모델은 아무 말도 안 하면서 떠들기만 합니다. 관련성 있는 문맥을 거의 제공하지 않죠. 로어를 이해하지 못하고 세부 사항을 환각(hallucinate)합니다. 사용할 수 없는 수준입니다.
Qwen 3.5 27B가 나오기 전까지는 그랬습니다. 이 모델은 동종 최초였고 저에게는 게임 체인저였습니다. 그 이후로 제 데일리 드라이버가 되었죠.
Gemma 4가 출시되고 며칠 뒤, 저는 60K의 방대한 문맥을 덤프하고 테스트를 돌려봤습니다. 질문에 답했을 뿐만 아니라 로어까지 이해하더군요. 그렇게 저는 그 작업을 처리할 수 있는 두 번째 모델을 갖게 되었습니다. Qwen처럼 참조를 인용하는 면에서는 덜 상세했지만, Qwen에게는 없는 무언가가 있었습니다. 그건 나중에 다시 얘기하죠.
이제 긴 문맥 추론을 위한 두 명의 최고 선수를 확인했으니, 대결로 넘어가 봅시다. 누가 더 나을까요?
지난 며칠 동안 저는 Qwen과 비교해 봤습니다. 제 발견은 다음과 같습니다:
- Gemma 4는 현재 Qwen 3.5보다 훨씬 느립니다. 저는 지금까지 70-100K 문맥 사이에서 Gemma를 테스트했습니다. 어제까지는 달팽이처럼 느려서 사실상 사용할 수 없었습니다. (0.6 - 3 tok/sec 정도 나왔습니다) 하지만 결과물이 계속 시도해 볼 만큼 괜찮았습니다. Unsloth가 어제 새 버전을 업로드해서 모델을 다시 다운로드했고, 이제 최소 2배의 속도 향상을 얻고 있으니 여전히 느린 속도를 겪고 있다면 다시 다운로드하는 것을 추천합니다. 그렇긴 해도 Qwen은 더 높은 양자화에서도 상당히 더 빠릅니다.
- Gemma 4는 Qwen 3.5보다 환각이 적은 것 같습니다. 문맥에서 참조를 덜 사용하고, 때로는 Qwen이 놓치지 않는 매우 중요한 세부 사항을 완전히 놓치기도 합니다. 하지만 Qwen은 90K 토큰 근처에서 사실 관계를 틀릴 때가 있는 반면, Gemma는 사실 관계가 좀 틀려도 놀라울 정도로 더 일관성 있어 보입니다.


