안정적인 설정: SOTA 모델을 오케스트레이터로, 로컬 Qwen 모델을 워커로 사용하는 방법?
Reliable Setup: SOTA Model as Orchestrator and Local Qwen Model as Worker?
핵심 요약
로컬 Qwen 모델을 워커로 활용하려 하지만, 속도 저하와 비효율적인 작업 흐름으로 어려움을 겪고 있습니다.
- 하드웨어 사양 — Nvidia AGX Orin 64GB 환경에서 Qwen3.6-35B 모델 구동 중
- 성능 문제 — 로컬 모델의 작업 속도가 느려 메인 모델인 GPT-6 Luna가 계속 대기함
- 워크플로우 개선 — 작업 분할 및 비동기 처리 방식의 최적화 필요
- 모델 활용 — 로컬 모델을 메인 모델의 보조 수단으로 효율적으로 사용하는 방법 모색
gpt-luna-6로 pi 돌리는 건 성공했는데, 마침 Nvidia AGX Orin 64GB(최대 50W) 장비가 하나 있어서 이걸 써먹어 보려고 함.
llama.cpp에 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q6_K_P 모델 올려서 돌리는 중임.
모델 정보는 아래와 같음:
Context Size 65,536 tokens
Model Size 28.53 GB
Parameters 34.7B
Embedding Size 2,048
Vocabulary Size 248,320 tokens
Quantization Q6_K_P
Parallel Slots 2
Build Info b1-609290b
실제 토큰 생성 속도는 20~25 tokens/s 정도 나옴.
SOTA 모델인 gpt 6 luna가 계획이랑 의사결정을 내리고, Qwen이 스스로 처리할 수 있을 만큼 잘게 쪼갠 작업을 수행하게끔 세팅해 보려고 함. 로컬 모델용으로 pi를 띄울 수는 있음.
근데 문제는 이게 그냥 gpt-6-luna만 쓰는 것보다 훨씬 느리고, 결과물도 개판임. 게다가 gpt-6-luna는 작은 작업 하나 끝날 때까지 10분씩 멍하니 기다리고 있음.
지금 이 세팅으로는 로컬 모델을 실무에 도저히 못 써먹겠음. 한 100개 정도 작은 작업을 던져주면 백그라운드에서 하나씩 처리하고, 메인 모델은 가끔 진행 상황 확인하면서 필요하면 방향 수정해 주는 그런 방식을 찾고 있는데 말이지.
지금 상태는 그냥 재앙 수준임. 일하는 데 방해만 됨.
메인 창에는 이런 툴 호출이 찍힘:
pi --approve --provider qwen-local --model Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q6_K_P --thinking off --tools read,write -p u/handoff.md "Use the Pi tools and follow only the active handoff. Create the requested test, read it back, and stop. Do not run it or edit app code."
이게 벌써 20분째 돌아가고 있고, 메인 pi는 결과 나올 때까지 아무것도 못 하고 대기 중임. 겨우 끝나도 gpt 6 luna는 결과물을 퇴짜 놓기 일쑤고. 그냥 qwen 안 쓰고 하는 것보다 토큰만 더 날리는 것 같음. 속도도 존나 느리고.
혹시 로컬 모델이랑 SOTA 모델 섞어서 실무에서 제대로 써먹고 있는 사람 있음? 다들 세팅 어떻게 함? 내가 뭘 놓치고 있는 거냐?

