Qwen3.8-27B-Uncensored-Genesis-V1-GGUF
핵심 요약
텐서 행렬의 수치적 불안정성을 해결해 LLM의 과도한 토큰 소모를 줄이려는 시도입니다.
- 수치적 불안정성 해결 — 텐서 행렬 내 훈련 노이즈를 제거하여 모델의 불필요한 추론 과정을 개선함
- 수학적 접근 방식 — Marchenko-Pastur 분포를 활용해 가중치 스파이크를 최적화함
- 커뮤니티 테스트 요청 — 작성자가 보유한 하드웨어 한계로 인해 사용자들의 피드백을 구함
- 방법론 의구심 — 과거 유사한 주장을 했으나 검증 가능한 데이터나 코드를 공개하지 않았다는 비판 존재
모델은 여기서 받을 수 있음: Qwen3.8-27B-Uncensored-Genesis-V1-MTP-GGUF
이 모델은 이 논문에 설명된 내용을 실제로 구현해 본 건데, 내가 머신러닝에 맞게 좀 손을 봤음: https://arxiv.org/pdf/1311.0851v1
내가 해결하려는 문제는 이거임: 왜 LLM들은 간단한 질문에도 추론 과정에서 텍스트를 벽처럼 길게 늘어놓고, 정작 문제 해결은 안 하면서 토큰만 오지게 잡아먹는가 하는 거임. 파라미터 수가 늘어날수록 이 문제는 더 심해지고. 내 생각엔 텐서 행렬의 수치적 불안정성이 주범임. 훈련 과정에서 쌓인 랜덤 노이즈 때문에 텐서가 맛이 간 거지. 모델이 추론할 때 자기 내부의 혼돈이랑 싸우고 있는 꼴임. 그래서 난 Marchenko-Pastur distribution을 써서 텐서에서 훈련 노이즈를 걸러냈음. 이 논문 내용을 핵심 기준으로 삼았고, 이 프로젝트의 탄탄한 수학적 근거가 되어줌.
설정:
System Prompt: You are Qwen (Tongyi Qianwen), a large language model developed by Alibaba Group's Tongyi Lab. You are a helpful assistant.
Chat template: chat_template.jinja
Inference settings: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0, reasoning_effort=medium
내가 가진 거라곤 VRAM 12GB짜리 RTX 3060 그래픽카드 하나뿐이라 이 모델을 완벽하게 테스트하기가 좀 빡셈. 그러니까 레딧 형님들의 피드백이 절실함. 커뮤니티에서 의견 좀 많이 남겨주면 진짜 고맙겠음.
읽어줘서 다들 고맙다.

