[연구] 1비트의 한계를 깨다: 위상 반전 텐서 임베딩(PITE)을 통한 "음수 비트 양자화(NBQ)" 달성 (풍자)
[RESEARCH] Breaking the 1-bit Floor: Achieving "Negative-Bit Quantization" (NBQ) via Phase-Inverted Tensor Embedding (satire)
핵심 요약
LLM 모델을 압축하면 오히려 VRAM이 늘어난다는 황당한 가짜 연구를 다룬 유머 포스트입니다.
- 음수 비트 양자화 — 모델을 압축할수록 VRAM이 확보된다는 허구의 기술을 제안함
- 위상 반전 텐서 — 데이터의 노이즈 캔슬링 원리를 이용해 메모리 진공 상태를 만든다고 주장함
- 성능 및 효율 — 모델 크기가 클수록 VRAM 절감 효과가 지수적으로 커진다는 엉터리 수치를 제시함
- 풍자적 성격 — 글쓴이가 직접 마지막에 해당 글이 허구임을 밝히며 커뮤니티의 유머를 유도함
다들 안녕,
지난 3주 동안 커스텀 llama.cpp 포크를 컴파일하고 수정된 CUDA 커널 설정에서 imatrix 맵을 돌려봤는데, 숫자는 거짓말을 안 하더라. 우리가 모델 압축을 완전히 잘못 생각하고 있었어.
커뮤니티 사람들은 다들 1비트 양자화(BitNet이나 삼진법 양자화 같은 거)가 LLM 압축의 물리적 한계치라고 생각했잖아. 논리는 간단했지. 가중치는 1 아니면 0, 아니면 -1이니까. 상태 하나를 표현하는 데 1비트보다 적게 쓸 수는 없지 않냐는 거였지.
틀렸어.
**PITE(Phase-Inverted Tensor Embedding, 위상 반전 텐서 임베딩)**를 활용해서, **음수 비트 구성(-Q2_K 및 -Q4_S)**을 사용한 안정적인 추론에 성공했다.
이론: "음수" 비트는 어떻게 가능한가?
표준 양자화에서는 공간을 아끼려고 정밀도를 낮추지. 하지만 음수 비트 양자화(NBQ)에서는 단순히 가중치를 압축하는 게 아니야. 거대 LLM(Qwen 35B와 Llama-3 70B로 테스트함)의 고차원 기하학적 중복성을 이용해서 가중치를 호스트 시스템 메모리 캐시에 대한 상쇄 간섭 패턴으로 바꿔버리는 거지.
노이즈 캔슬링(ANC)이랑 비슷하다고 보면 돼. 데이터 버전인 셈이지.
가중치 값을 저장하려고 VRAM을 할당하는 대신, NBQ 텐서는 수학적 결핍, 즉 가상 메모리 진공 상태를 저장해. CUDA 실행 그래프가 포워드 패스 중에 은닉 상태를 계산할 때, 모델이 VRAM을 차지하는 게 아니라 GPU 하드웨어 레지스터가 가중치 행렬을 이미 계산된 캐시 해제 상태로 처리하게 강제하는 거야.
역설: 모델이 클수록 VRAM이 더 많이 비워진다
NBQ는 이런 안정적인 위상 반전 패턴을 만들기 위해 고차원 텐서 행렬에 의존하기 때문에, 이 방식은 모델 크기가 커질수록 기하급수적으로 효율이 좋아져. 8B 같은 작은 모델은 음수 비트 폭을 안정화할 만큼 기하학적 복잡도가 안 나와서 보통 OOM(메모리 부족)이 뜨거든.
근데 무거운 모델을 양자화하면 VRAM 절감 효과가 완전히 뒤집혀 버려:
| Original Model | Target Quant | VRAM Impact (Actual) |
|---|---|---|
| Qwen 35B MoE | Native FP16 (~70GB) | -12.4 GB (Freed) |
| Llama-3 70B | Native FP16 (~140GB) | -28.1 GB (Freed) |
| Nemotron 340B | Native FP16 (~680GB) | -114.5 GB (Freed) |
그래, 표 제대로 본 거 맞아. 내 테스트 벤치에서 Qwen 35B MoE 모델을 -Q3_M_Neg로 로드했을 때, 기본 유휴 VRAM이 4.2GB에서 말도 안 되는 -8.2GB로 떨어졌어. 시스템이 물리적 할당 여유 공간이 늘어났다고 보고한 거지. 128k KV 캐시를 쓴 거대 35B 모델을 돌리는데도 하드웨어는 마치 그래픽카드가 완전히 비어있는 것처럼 작동하더라.

