Intel Arc B70 Pro에서 977 tk/s 프롬프트 처리 및 262k 컨텍스트 윈도우를 기록한 Qwen 3.6-35B-A3B
Qwen 3.6-35B-A3B with 977 tk/s prompt processing and 262k context window on Intel Arc B70 Pro
핵심 요약
Intel Arc B70 Pro GPU를 활용한 Qwen 3.6-35B-A3B 모델의 벤치마크 결과와 실사용 후기 공유.
- 벤치마크 결과 — Qwen 3.6-35B-A3B 모델의 프롬프트 처리 속도와 컨텍스트 윈도우 성능을 측정함.
- Intel Arc 활용 — B70 Pro GPU 환경에서 로컬 LLM 추론이 실사용 가능한 수준임을 입증함.
- 최적화 요청 — 더 나은 성능을 위해 추가적인 최적화 방법이나 불필요한 설정에 대한 조언을 구함.
- 커뮤니티 기여 — llama.cpp 개발자들의 노고에 감사를 표하며 로컬 추론 환경의 발전을 강조함.
lemongravy.me
원문 사이트로 이동
Llama 벤치마크 결과
model size params backend ngl threads type_k type_v fa test t/s qwen35moe 35B.A3B Q4_K - Medium 20.81 GiB 34.66 B SYCL 99 1 q8_0 q8_0 1 pp512 977.40 ± 2.02 qwen35moe 35B.A3B Q4_K - Medium 20.81 GiB 34.66 B SYCL 99 1 q8_0 q8_0 1 tg128 70.54 ± 0.12
모든 노트를 LLM에 넣고 기사를 작성했으니, 같은 설정을 재현하고 싶다면 참고해.
현재 'oh my pi'와 함께 사용 중인데 매우 실용적이야. 루프에 빠지거나 멈추거나 크래시 나는 일 없이 잘 설계된 포커 게임을 만들 수 있었어.
인텔용 vllm도 예전에 시도해봤지만 단일 요청에 대해 이 정도 성능을 뽑아내진 못했어. 업데이트된 내용들이 좀 보이니 시간 날 때 다시 한번 시도해볼 생각이야.
비슷한 환경에서 내가 놓치고 있는 최적화 방법이나, 사실상 아무것도 안 하고 있는 설정이 있다면 알려주면 좋겠어. 항상 더 짜낼 수 있는 성능을 찾고 있으니까.
또한 llama.cpp 기여자들과 로컬 추론을 실현 가능하게 만들기 위해 노력하는 모든 분께 정말 감사해. 내가 이런 종류의 추론을 로컬에서 할 수 있는 건 오직 이 기술을 만들고 유지보수하는 사람들 덕분이야.


