과소평가된 가성비 솔루션: 라데온 780M 내장 그래픽
Underestimated budget solution: radeon 780m iGPU
핵심 요약
1,000유로 이하 예산으로 LLM을 구동하려는 사람들에게 780M 내장 그래픽과 64GB DDR5 RAM 조합을 추천하는 글입니다.
- 가성비 하드웨어 — 780M 내장 그래픽과 64GB RAM 조합으로 저렴하게 LLM 구동 가능함
- 성능 검증 — Qwen 3.6 35B-A3B 모델 등을 Vulkan 백엔드로 준수한 속도에 실행함
- 최적화 팁 — MTP 및 부분 전문가 오프로딩을 통해 추론 속도를 향상시킬 수 있음
- 한계점 — DeepSeek 같은 대형 모델은 구동이 어렵지만 가벼운 모델에는 충분함
요즘 비싼 가격 때문에 징징대면서 1000유로 이하로 해결할 방법 없냐고 묻는 글이 너무 많네.
그래서 고려해 볼 만한 해결책 하나 던져준다: Ryzen 7 260/Ryzen 9 8945HX 같은 CPU에 780m iGPU, 그리고 64Gb DDR5 RAM 박은 PC/미니 PC/노트북 조합이야.
베어본 미니 PC는 300~400 정도 하고, 중고 32Gb DDR5 SO-DIMM 2개는 500 정도, 중고 SSD는 50~100 정도면 우리 동네에선 구하거든.
내가 Ryzen 7 260, Ubuntu 26 환경에서 커널 파라미터 amdgpu.gttsize=49152 amd_iommu=off ttm.pages_limit=16777216 (48Gb "VRAM" 할당) 주고, llama.cpp에 Vulkan 써서 돌린 결과값들이다.
모든 LLM은 Unsloth Q8 퀀트 버전이야.
Qwen 3.6 35B-A3B
| model | size | params | backend | ngl | type_k | type_v | fa | dev | test | t/s |
| ----------------------- | ---------: | ------: | ------- | --: | -----: | -----: | --: | ------- | -------: | ------------: |
| qwen35moe 35B.A3B Q8_0 | 35.19 GiB | 35.51 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | pp8192 | 287.33 ± 2.06 |
| qwen35moe 35B.A3B Q8_0 | 35.19 GiB | 35.51 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | pp16384 | 263.51 ± 1.06 |
| qwen35moe 35B.A3B Q8_0 | 35.19 GiB | 35.51 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | tg128 | 21.06 ± 0.01 |
| qwen35moe 35B.A3B Q8_0 | 35.19 GiB | 35.51 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | tg256 | 20.85 ± 0.20 |
Gemma 4 31B:
| model | size | params | backend | ngl | type_k | type_v | fa | dev | test | t/s |
| ---------------- | ---------: | -------: | ------- | --: | -----: | -----: | --: | -------- | -------: | ------------: |
| gemma4 31B Q8_0 | 30.38 GiB | 30.70 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | pp8192 | 51.59 ± 0.07 |
| gemma4 31B Q8_0 | 30.38 GiB | 30.70 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | pp16384 | 46.59 ± 0.01 |
| gemma4 31B Q8_0 | 30.38 GiB | 30.70 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | tg128 | 2.46 ± 0.00 |
| gemma4 31B Q8_0 | 30.38 GiB | 30.70 B | Vulkan | 99 | q8_0 | q8_0 | 1 | Vulkan0 | tg256 | 2.30 ± 0.22 |
실제 작업할 땐 MTP를 써서 tg 수치가 더 높게 나오는데, Gemma4 31B의 경우엔 이래:
16.27.894.079 I slot print_timing: id 0 | task 0 | prompt eval time = 481467.90 ms / 20470 tokens ( 23.52 ms per token, 42.52 tokens per second)
16.27.894.088 I slot print_timing: id 0 | task 0 | eval time = 449250.04 ms / 2587 tokens ( 173.66 ms per token, 5.76 tokens per second)
16.27.894.089 I slot print_timing: id 0 | task 0 | total time = 930717.94 ms / 23057 tokens
16.27.894.099 I slot print_timing: id 0 | task 0 | graphs reused = 658
16.27.894.109 I slot print_timing: id 0 | task 0 | draft acceptance = 0.95566 ( 1918 accepted / 2007 generated), mean len = 3.87


