후속 보고: RTX 3090 1장으로 Qwen3.6-27B 구동 — 218K 컨텍스트 및 50~66 TPS 달성, 툴 호출 안정화(PN12 수정)
Follow-up: Qwen3.6-27B on 1× RTX 3090 — pushing to ~218K context + ~50–66 TPS, tool calls now stable (PN12 fix)
핵심 요약
RTX 3090 한 장에서 Qwen3.6-27B 모델의 218K 컨텍스트와 안정적인 툴 사용을 구현한 후속 보고입니다.
- 컨텍스트 확장 — RTX 3090 한 장으로 218K 컨텍스트와 초당 50~66 토큰 처리 속도를 달성함.
- 툴 사용 안정화 — Genesis 패치(PN12)의 앵커 드리프트 문제를 해결하여 툴 호출 시 발생하는 메모리 부족 현상을 제거함.
- 최적화 목표 — 최대 성능보다는 고컨텍스트와 실사용 가능한 처리량, 툴 에이전트 작업의 안정성을 동시에 확보함.
- 하드웨어 제한 — 단일 GPU 사용 시 50~60K 컨텍스트 구간에서 발생하는 메모리 병목 현상을 확인하고 이를 공유함.
RTX 3090 한 장에서 Qwen3.6-27B를 구동했던 이전 글에 대한 후속 보고입니다.
저희는 컨텍스트 길이와 툴 에이전트 작업의 안정성 측면에서 더 많은 시도를 해왔습니다.
현재 결과:
-
~218K 컨텍스트 @ ~50 / 66 TPS (텍스트, 내러티브/코드)
-
~198K + 비전 @ ~51 / 68 TPS
-
~25K 토큰 출력을 포함한 툴 호출이 이제 OOM 없이 완료됨
이전 설정보다 TPS는 낮아졌지만, 실제 작업 환경에서 훨씬 더 높은 컨텍스트와 안정성을 확보했습니다.
변경 사항
이전에는 긴 툴 출력(~25K 토큰)이 발생하면 지속적으로 충돌이 발생했습니다.
이는 메모리 문제를 완화하기 위한 Genesis 패치(PN12)가 vLLM dev205+ 버전에서 제대로 적용되지 않았기 때문인 것으로 밝혀졌습니다.
-
apply_all은 성공했다고 보고했지만 -
실제 코드 경로는 변경되지 않았음
근본 원인은 패치의 앵커 드리프트(anchor drift)였습니다.
이 문제를 해결한 후, 툴 프리필(tool-prefill) OOM이 사라졌고 더 높은 컨텍스트 설정이 가능해졌습니다.
수정 사항:
https://github.com/Sandermage/genesis-vllm-patches (PR #13)
최적화 목표
여기서 목표는 단순히 최대 TPS나 최대 컨텍스트를 확보하는 것이 아니라, RTX 3090 한 장에서 이 두 가지를 동시에 밀어붙이는 것입니다:
-
높은 컨텍스트 (200K+)
-
사용 가능한 처리량
-
안정적인 툴 에이전트 작업
참고 사항 / 제한 사항
-
단일 GPU에서 단일 프롬프트 작업 시 ~50–60K 구간에서 여전히 두 번째 메모리 절벽이 존재함
-
이는 텐서 병렬 처리(예: 2× 3090)를 사용할 때는 적용되지 않음
-
결과는 양자화 및 설정에 크게 의존함
재현 방법
https://github.com/noonghunna/club-3090
다른 분들은 3090/4090 환경에서 컨텍스트와 TPS 사이의 균형을 어떻게 맞추고 계신지 궁금합니다.


