DavidAU가 어쩐 일로 Qwen 3.6 27B 모델을 개선해냈네
DavidAU somehow managed to improve Qwen 3.6 27B
핵심 요약
평소 평판이 좋지 않던 DavidAU가 협업을 통해 성능이 향상된 Qwen 27B 모델을 공개하여 커뮤니티에서 주목받고 있습니다.
- 모델 성능 향상 — 기존 모델 대비 추론 효율성과 에이전트 작업 수행 능력이 눈에 띄게 개선됨
- 협업의 결과물 — 단독 작업이 아닌 여러 전문가와의 협업을 통해 다단계 파인튜닝 및 머지가 진행됨
- 실제 작업 검증 — 복잡한 웹 자동화 작업에서 기존 모델보다 높은 성공률을 보임
- 커뮤니티 반응 — 데이터 공개 요구와 함께 RL(강화학습) 부재에 대한 회의론과 성능 개선에 대한 긍정적 평가가 공존함
huggingface.co
원문 사이트로 이동
DavidAU가 욕먹는 거 알고 있고, 솔직히 그럴 만도 함. 예전에 걔가 만든 파인 튜닝 모델 몇 개 써봤는데... 진짜 좀 '흥미로운' 수준이었거든.
우연히 이 모델을 발견하게 됐음. locallama에 누가 제일 긴 모델 이름 아는 사람 있냐고 올린 글 보다가:
https://www.reddit.com/r/LocalLLaMA/s/rsvWBHZasI
그래서 HF 페이지 들어가 봤는데 눈에 띄는 게 몇 개 있더라고.
- 이 모델은 여러 사람이 협업해서 만든 거임. 내가 알기로는 걔가 만든 다른 모델들처럼 혼자 북 치고 장구 치고 한 게 아님.
- 벤치마크 결과가 있음. 몇몇 항목은 성능이 꽤 올랐고, 떨어진 건 하나도 없음. 너무 잘 나와서 의심스럽긴 한데, 뭐 벤치마크가 전부는 아니니까. 그래도 확실한 건 뭔 짓을 했든 모델 성능을 조지진 않았다는 거임.
- 에이전트 성능에 집중했다고 하는데, 이름에 fable을 붙인 건 좀 오버 아닌가 싶음. fable의 진짜 사고 과정을 우리가 알 수 있는 건 아니니까.
--
원래는 unsloth의 IQ4XS에 preserve thinking 써서 돌리고 있었음. 내 Hermes 에이전트 돌리려면 262K 컨텍스트가 필요해서 3090에서 Q4 KV로 돌리는 중임 (GPU 두 개 더 오는 중).
DavidAU 모델 올리고 기존 unsloth 설정 그대로 돌려봤는데, 바로 몇 가지 차이가 느껴짐.
- 모델이 고장 나지 않았음.
- 추론 효율이 훨씬 좋아짐.
- 순정 모델이랑 추론 방식이 다름. 순정 모델은 안 하던 구조화된 계획을 추론 블록에서 짜는 게 자주 보임. 추론 과정도 훨씬 디테일해진 느낌임.
--
느낌은 확실히 옴. 순정 모델보다 훨씬 나음. 근데 뭐 '느낌'이 다는 아니잖아? 그래서 내 Hermes 에이전트 개인 크론 작업에 바로 투입해 봄.
내 에이전트는 업무 스케줄링 사이트 들어가서 특정 필터 걸린 초과 근무 수당 시프트 찾아내서 나한테 알림 보내주는 긴 컨텍스트 작업임. 사이트가 좀 복잡해서 함정도 많고 JS 요소도 떡칠돼 있거든.
10번 돌려봤음. 매번 컨텍스트 싹 비우고. unsloth 순정 모델은 10번 중에 2번은 실패했는데, 이 모델은 한 번도 안 틀림. KV Q4에서도 툴 호출 실패한 적 없음.
이거 양자화 안 한 KV나 Q8 가중치로 돌리면 진짜 물건일 듯. 너네도 꼭 써봐라. DavidAU가 이번엔 진짜 제대로 하나 뽑았네.
참고: unsloth의 vision mmprog 써라. 용량도 절반이고 난 아무 문제 없이 잘 돌아갔음.


