V4-Flash-0731 - 첫 주말 사용 후기
V4-Flash-0731 - vibes after first weekend of use
핵심 요약
V4-Flash-0731 모델의 양자화 성능과 에이전트 작업 능력을 분석한 첫 주말 사용기입니다.
- 양자화 민감도 — Q2/Q3 양자화 시 성능 저하가 심해 공식 버전과 차이가 큼
- Qwen3.6-27B 대체 — VRAM이 충분하다면 Q3 버전이 Qwen3.6-27B보다 훨씬 안정적임
- 에이전트 작업 특화 — 지식은 다소 부족하나 도구 사용 및 추론 능력이 매우 뛰어남
- 가성비 최강 — 풀 정밀도 모델은 GLM 5.2 수준에 근접하며 비용 대비 성능이 압도적임
[블록 1/7] 이번 주말에 V4-Flash-0731과 너무 많은 시간을 보냈고, 최대한 간략하게 내 느낌을 공유하고 싶음.
[블록 2/7] 실제 작업과 개인적인 벤치마크 몇 가지를 돌려봤음. 내 빠른 생각은 다음과 같음:
[블록 3/7] - 양자화가 이 모델을 아주 세게 때림 - Q2와 Q3 가중치를 여러 개 시도해 봤는데 완전히 다른 모델처럼 작동함. 추론하는 모습이나 느낌이 다르고 결과물도 공식/서빙되는 V4-Flash-0731보다 한 단계 아래임. Q4는 충분히 테스트해보지 못했음.
[블록 4/7] - Q3는 드디어 Qwen3.6-27B를 대체할 수 있음 (VRAM이 있다면..) - Qwen3.6-27B와 같은 작업을 수행하지만 더 안정적임. 단순한 원샷 작업에서는 비슷하지만, 더 큰 레포나 대규모 하네스(도구를 사용하는 Claude Code, 시스템 프롬프트 토큰 약 30k부터 시작..)로 들어가면 Q3의 V4-Flash-0731이 Q8의 Qwen3.6-27B보다 훨씬 앞서 나감.
[블록 5/7] - Q2는 좀 과함 - Q2를 사용한 모든 경우에서 결국 Qwen3.6-27B Q8 가중치를 더 선호하게 됐음. Q2_K_XL은 의문스럽지만 IQ3_XXS보다 4GB 정도 작아서 추천하고 싶지 않음.
[블록 6/7] - 풀 정밀도는 진짜 물건임 - GLM 5.2 수준에 접근하고 있다고 말하고 싶고, 이건 정말 흥미로운 부분임. 복잡한 작업에서 추론을 많이 하긴 하지만 최종 비용은 여전히 믿을 수 없을 정도로 낮음. GLM 5.2(Opus 5, Fable 등은 말할 것도 없고..)를 이긴다고 말하는 건 좀 우스운 소리지만.. 가격에 집중하면 이 모델은 독보적인 클래스임.
[블록 7/7] - 에이전트 작업에 매우 집중되어 있음 - 나는 항상 Deepseek의 릴리스를 '범용' 모델의 플래그십으로 생각했지만, V4-Flash-0731은 지식 측면에서는 약간 약함. 도구 호출을 사용한다면 전혀 문제가 안 됨. 모델이 도구를 사용하고 발견한 정보로 추론하는 능력이 매우 뛰어나기 때문임. 하지만 에어갭(망 분리) 환경에서 사용한다면 고려해야 할 부분임.

