RTX 3090이나 다른 30xx 시리즈로 로컬 LLM을 돌린다면, 당신을 위한 게 있습니다
If you have a 3090, or other 30xx for local LLMs, I have something for you
핵심 요약
RTX 30xx 시리즈 GPU에서 로컬 LLM 성능을 극대화하는 llama.cpp 커스텀 포크 'llamAmpere'를 소개합니다.
- 성능 최적화 — Ampere 아키텍처에 특화되어 90+ TPS 및 240K 컨텍스트를 지원함.
- 커스텀 포크 — llama.cpp 기반으로 30xx 시리즈 GPU에서 속도 향상을 구현함.
- 사용자 피드백 — 실제 사용자들이 속도 향상을 체감하나 퀀트 품질과 배포 방식에 대해 논의함.
Ampere 아키텍처에 맞춰서 튜닝한 llama.cpp 커스텀 포크를 만들었어(물론 여기서 개선된 점들 대부분은 Blackwell이나 Lovelace에서도 더 빠른 성능을 보여줌). 추천 설정으로 돌리면 100K 토큰까지는 90+ TPS(에이전트/코딩 작업 기준, temp 1일 때고 greedy로 하면 당연히 더 빠름) 나오고, 컨텍스트는 최대 240K까지 지원해.
레포 필요하면 여기 있어:
https://github.com/JakeATX/llamAmpere
퀀타이즈는 이걸로 돌리는 거 추천함. 대충 4K M 퀄리티인데 속도는 훨씬 빠름(엄밀히 말하면 3K XL 업그레이드 버전임).
https://huggingface.co/jakeatx/Qwen3.8-27B-ATX-IQ4_XS-M-GGUF
이게 왜 그렇게 빠른지(200K 컨텍스트에서 경쟁 모델 대비 80%나 더 빠름!) 궁금하면 여기 자세하게 쓴 글 있으니까 읽어봐.
https://x.com/JakeKAllDay/status/2095646450138874095?s=20
내 3090에서 API 속도보다 더 빠르게 돌아가는 거 보니까(적어도 27b 모델 기준), 모델이랑 그래픽카드 활용도가 차원이 다르게 좋아졌음. 다들 잘 써먹길 바라!


