Open Code나 다른 에이전트 프로그램을 쓸 때 병렬로 에이전트를 돌리지 않으면 t/s 성능을 엄청나게 낭비하는 겁니다. 벤치마크: RTX5090, Qwen3.6 35B, LM Studio에서 병렬 작업 8개 설정
If you use Open Code or other agenting programs you are leaving a lot of t/s if you don't actually use agents in parallel. Benchmark : RTX5090, Qwen3.6 35B loaded via LM studio with parallel tasks set to 8
핵심 요약
RTX 5090 환경에서 에이전트를 병렬로 실행할 때 4~5개일 때가 처리량과 효율성 면에서 가장 최적이라는 벤치마크 결과입니다.
- 병렬 처리 성능 — 에이전트 4~5개 실행 시 처리량(t/s)이 가장 효율적으로 극대화됨
- 하드웨어 병목 — KV 캐시와 연산 분할로 인해 에이전트가 늘어날수록 개별 속도는 급격히 감소함
- 최적의 설정 — 5개 이상의 에이전트는 VRAM 소모 대비 성능 향상이 미미함
- 컨텍스트 관리 — 각 에이전트는 독립적인 컨텍스트를 가지며, 병렬 실행 시 VRAM 점유율이 크게 증가함
다들 알다시피 t/s(초당 토큰 수)는 존나 중요함. 작업 속도가 이걸로 결정되거든. 내가 직접 open code 벤치마크 돌려보니까, 최소 4개 에이전트는 안 돌리면 성능의 절반을 그냥 버리는 꼴이더라고. 그러니까 open code에서 프로젝트 하나를 돌리든 4개를 동시에 돌리든, 단일 인스턴스나 에이전트 하나만 쓰는 것보다 이렇게 여러 개 돌리는 게 훨씬 나음.
AI한테 내 테스트 결과 요약 좀 해달라고 해서 확인해 봤는데 내용은 이래:
LM Studio Multi-Agent Throughput Benchmark
하드웨어: RTX 5090
모델: Qwen 3.6 35B (LM Studio 사용)
병렬 설정: 8
테스트: 에이전트당 5개 요청, 최대 토큰 1024, temperature 0.3
결과
| Agents | Avg t/s (each) | Combined t/s | Efficiency | Wall Time |
|---|---|---|---|---|
| 1 | 256.54 | 245.77 | — | 21.9s |
| 2 | 176.15 | 346.22 | 70.4% | 31.1s |
| 3 | 134.73 | 398.64 | 54.1% | 40.5s |
| 4 | 109.77 | 434.34 | 44.2% | 49.5s |
| 5 | 95.04 | 470.34 | 38.3% | 57.1s |
| 6 | 84.73 | 504.14 | 34.2% | 64.0s |
| 7 | 74.49 | 517.68 | 30.1% | 72.7s |
| 8 | 67.22 | 533.90 | 27.2% | 80.5s |
핵심 요약
처리량 스케일링
- 합산 처리량은 비선형적으로 증가: 에이전트 8개를 돌려도 처리량은 2.2배(245 t/s → 533 t/s)밖에 안 늘어남. 8배가 아니라고.
- 개별 에이전트 속도 급락: GPU 연산 자원을 나눠 쓰니까 256 t/s에서 67 t/s까지 꼬라박음.
- 효율 저하: 에이전트 5개에서 8개로 늘려봤자 63 t/s(12%) 정도밖에 안 오름. 사실상 5개까지만 의미가 있음.


