Qwen3.8-23B-Mini-Me: Qwen3.8-27B 모델의 레이어 가지치기 버전(약 22.7B 파라미터)
Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
핵심 요약
Qwen3.8-27B 모델의 레이어를 전략적으로 제거하여 성능 저하를 최소화하면서 속도와 효율을 높인 22.7B 모델을 공개함.
- 레이어 가지치기 — 파인튜닝 없이 모델 레이어를 제거하여 파라미터 수를 22.7B로 최적화함.
- 성능 유지 — 코딩 및 에이전트 작업에서 원본 모델 대비 큰 성능 저하 없이 빠른 속도를 제공함.
- 사용 권장사항 — 원본 모델과 동일한 채팅 설정을 사용해야 하며, 엣지 케이스에서는 원본보다 성능이 다소 떨어질 수 있음.
- 제공 형식 — 현재 MLX 버전으로 bf16, q8, q4 포맷이 준비됨.
huggingface.co
원문 사이트로 이동
뎁스 프루닝(depth pruning) 방식 연구하다가 이번에 나온 Qwen3.8-27B 모델에 한번 적용해 봤음. 추론 능력 크게 안 떨어뜨리면서 파라미터 22.7B 정도로 줄이는 데 성공했다. 파인튜닝은 따로 안 했고, 그냥 레이어 전략적으로 쳐냈음.
코딩이나 에이전트 작업, 멀티턴 챗 같은 내 용도에는 잘 돌아가길래 커뮤니티에 공유한다. 벤치마크는 안 돌려봐서 다른 모델보다 낫다고는 말 안 함. 그냥 27B 덴스 모델보다 덩치 작고 속도 빠른 버전이라고 보면 됨. 일부 성능은 좀 떨어질 수 있음.
써보고 싶은 사람들은 bf16, q8, q4 버전 있으니까 가져다 써라. 자기 프로젝트나 용도에 맞는지 직접 테스트해 보는 거 추천함.
써보고 의견 있으면 알려줘. 피드백 주면 고맙겠다!
수정: 현재는 MLX 버전만 있음.
수정 2: 원본 모델이 권장하는 채팅 설정 그대로 쓰는 거 추천함. 난 그렇게 쓰니까 루핑이나 문제 같은 거 전혀 없었음: https://huggingface.co/Qwen/Qwen3.8-27B
수정 3: 참고로 일반적인 코딩 문제는 잘 푸는데, 원본 모델이랑 비교했을 때 엣지 케이스나 프롬프트가 좀 애매하게 적힌 경우엔 확실히 좀 딸림(원본 모델은 프롬프트가 불충분해도 문맥 파악해서 알아서 잘 처리하는 능력이 더 좋거든).


