두 가지 오픈 웨이트 모델 공개: Victoria(Qwen3.8-Flash-Next 기반, 전문가 44% 제거)와 Maple(캐나다 특화 파인튜닝)
Two open-weights releases: Victoria (Qwen3.8-Flash-Next with 44% of experts cut, 70% Terminal-Bench 2.1, GGUF included) and Maple (a Canada-first fine-tune)
핵심 요약
Qwen3.8-Flash-Next를 최적화한 코딩용 Victoria와 캐나다 정보 특화 Maple 모델이 공개되었습니다.
- Victoria 모델 — REAP 기법으로 전문가 44%를 제거하고 4비트로 재학습하여 성능 향상됨
- Maple 모델 — 캐나다 관련 질문에 정확한 답변을 제공하도록 파인튜닝됨
- 성능 지표 — Victoria는 Terminal-Bench 70.0%, HumanEval 159/164를 기록함
- 기술적 제약 — GGUF 사용 시 전용 llama.cpp 포크 버전 사용이 필요함
연구실에 Dell B300을 몇 주 동안 들여놓고 Qwen Flash Next 파인튜닝 모델 두 개를 뽑아봤다.
Victoria (코딩 및 에이전트 특화)
-
REAP이라는 논문/기술을 써서 Qwen3.8-Flash-Next를 44% 다이어트시켰다. 레이어당 512에서 288로 줄임.
-
나중에 4-bit(NVFP4)로 재학습까지 돌렸다. 그냥 사후 양자화한 게 아니라 애초에 그 포맷에 맞춰서 학습시킨 거임.
-
Terminal-Bench 2.1: 70.0% (작업당 8시간 타임아웃 걸고 3번 돌린 평균값). 이전 NVFP4 빌드는 62.5% 나왔었다.
-
HumanEval: 159/164.
-
가중치 용량은 드래프트 헤드 포함 48.0 GiB. 95.4 GiB짜리 n-gram 테이블은 별도라 이 수치엔 안 들어감.
-
B300 한 대에서 드래프트 헤드 썼을 때 초당 280 토큰, 안 썼을 땐 135 토큰 나옴.
-
GGUF Q4_K_M은 49.17 GiB. Terminal-Bench는 75.3% (이건 한 번만 돌린 거라 오차 감안하셈), HumanEval은 93.2% (5번 평균) 찍힘.
-
이전 빌드보다 출력 토큰 35% 덜 먹음.
Maple (캐나다 관련 질문 특화)
대부분 모델은 세금, 복지, 규정 같은 거 물어보면 미국 사는 줄 알고 답변하는데, Maple은 기본값을 캐나다로 잡고 파인튜닝했다. 검증용 질문 600개로 검색 돌려본 결과:
-
캐나다 공식 출처 인용: 파인튜닝 전 6.0% -> 후 62.9%.
-
완벽하게 정답: 전 6.6% -> 후 21.8%.
-
"답변 불가" 응답: 전 47.2% -> 후 23.7%.
-
다른 나라 산다고 했는데 캐나다로 우기는 경우: 전 2.9% -> 후 1.0%.
코딩 능력도 여전함: HumanEval 157/164. AI 판정단이 채점한 거라 아직 사람이 직접 검수는 안 해봄.
링크: https://huggingface.co/rmonsurate/Victoria https://huggingface.co/rmonsurate/Maple
모델 돌리는 거 궁금한 거 있으면 물어봐라.
수정: llama.cpp 쓰는 놈들 봐라. GGUF에 우리 드래프트 헤드가 들어가 있는데, 아직 메인라인 llama.cpp는 이걸 몰라서 "expected 1256, got 1224" 에러 뜰 거다. 파일은 정상이니까 걱정 말고, 일단 우리 포크 버전에서 빌드해라: github.com/rmonsurate/llama.cpp, 브랜치는 qwen4exp-mtp. 미리 빌드된 바이너리도 곧 올릴 예정. 이거 알려준 독자 고맙다.


