낮은 양자화 모델을 낮은 온도와 top p로 안정화하는 실험 해보신 분 계신가요?
Has anyone experimented with stabilizing low quant models with lower temp and top p?
핵심 요약
80GB VRAM 환경에서 저양자화 모델의 출력을 안정화하기 위해 온도와 top p를 조절하는 실험에 대한 논의입니다.
- 모델 안정화 — 낮은 온도와 top p를 통해 저양자화 모델의 불안정한 출력을 개선하려는 시도함
- 샘플링 기법 — top p 대신 min_p를 사용하여 양자화된 분포에 맞게 동적으로 토큰을 필터링하는 방식이 권장됨
- 하드웨어 한계 — 샘플링 조절은 일시적인 방편일 뿐, 근본적인 해결책은 하드웨어 업그레이드라는 의견이 지배적임
- 성능 평가 — 모델이 실제로 똑똑해지는지 아니면 단순히 실수를 줄이는 것인지에 대한 검증이 필요함
80GB VRAM 환경에서 더 큰 모델들을 돌려보려고 생각 중인데, MoE 모델들은 CPU 오프로드를 쓰면 너무 느리네요. 그렇다고 80GB VRAM에 딱 맞춰 설계된 모델도 별로 없고요. 대부분의 큰 모델들은 심하게 양자화된 버전을 사용해야 합니다. 같은 top p를 사용한 벤치마크들을 보다가 여기서 뭔가 할 수 있는 게 있다는 걸 깨달았는데, 최근에 관련해서 올라온 글을 본 적이 없네요. LLM 샘플링 시각화 도구들을 가지고 놀아보니 온도와 top p를 낮춰서 일부 튀는 출력들을 줄이는 게 가능할 것 같았습니다. 오늘 저녁에 한번 시도해 보려고요.
도구 예시 (제 거 아님): https://artefact2.github.io/llm-sampling/index.xhtml


