2개의 3090으로 Qwen 27B와 OMP를 코딩 에이전트로 튜닝하기
Tuning Qwen 3.8 27B and OMP as a coding agent on 2× 3090s
핵심 요약
2개의 3090 GPU 환경에서 Qwen 27B와 OMP 설정을 최적화하여 코딩 에이전트의 응답 속도를 28초에서 7초로 단축함.
- 성능 최적화 — 2개의 3090 GPU 환경에서 코딩 에이전트 응답 속도를 4배 개선함.
- OMP 설정 변경 — 역할별 노력 수준 지정 및 토큰 버짓 조정을 통해 효율성을 높임.
- 컨텍스트 관리 — 최대 토큰을 32k로 늘리고 대용량 도구 출력은 파일로 처리함.
- 에이전트 구성 — 하위 에이전트 수를 4개로 제한하고 appendOnlyContext를 활성화함.
doug.sh
원문 사이트로 이동
3090 두 장에 Oh My Pi + vLLM 돌리는 중. 턴당 평균 대기 시간 28초에서 7초로 줄었다. 대부분 omp 설정 바꾼 덕분임:
-
모든 역할에 명시적인 노력 수준(effort level) 설정 (설정 안 된 건 기본값 xhigh로 들어감)
-
thinking_token_budget 7500으로 설정
-
maxTokens 8k → 32k로 상향 (파일 쓰기 자꾸 잘려서)
-
10 KB 넘는 도구 출력값은 파일로 저장
-
최대 서브 에이전트 4개, appendOnlyContext 켜기
자세한 건 게시물 참고하고, 궁금한 거 있으면 뭐든 물어봐.

