Nemotron - 딥 컨텍스트의 제왕인가? 120B 이하 모델 4종 비교
Nemotron - King of the Deep? Comparison of 4 models <=120B
핵심 요약
Nemotron Super 모델이 120B급 모델 중 딥 컨텍스트 처리 성능이 가장 우수함을 벤치마크로 입증함.
- 벤치마크 환경 — Strix Halo 128GB 메모리 및 Vulkan 백엔드 환경에서 테스트함.
- 프롬프트 처리 — Nemotron Super가 32K 이상의 깊은 컨텍스트에서 타 모델 대비 압도적인 속도를 보임.
- 토큰 생성 속도 — 400K 컨텍스트까지 안정적인 성능을 유지하나 고속 생성에는 다소 아쉬움이 있음.
- 모델 추천 — 대규모 컨텍스트 분석이 필요한 경우 Nemotron이 합리적인 선택지임.
비교는 Strix Halo 128gb 공유 메모리, Ubuntu 26.04, Lemonade Server, Vulkan 백엔드 환경에서 진행했음.
난 gpt-oss 120B나 qwen 같은 대형 모델을 자주 돌리는데, 컨텍스트가 깊어지면 성능이 팍 꼬라박는 느낌이더라고... 아, 그러니까 깊은 컨텍스트 말이야. 나한테 제일 중요한 건 프롬프트 처리(PP) 속도임. 기존 코드 분석해서 변경 요청이나 버그 수정할 때 컨텍스트가 금방 차버리거든. 기존 코드 작업할 때 전체 시간 중 95~99%는 PP고, 나머지 1~5%가 토큰 생성(TG)이라고 봄. 최근에 Nemotron Super (120B)를 써봤는데 퀄리티도 맘에 들고 속도도 괜찮았음. 놀랍게도 비슷한 모델들보다 깊은 컨텍스트(~100k)를 훨씬 잘 다루는 느낌이더라고. 이 주관적인 느낌이 맞는지 확인하려고 120B급 경쟁 모델 3개(GPT-OSS, qwen 3.5, Nemotron)랑, 비교용으로 인기 많은 작고 빠릿한 Qwen 3.6 35B 모델까지 싹 다 llama-bench 돌려봤음. 주관적인 기준으로는 100 TPS PP를 "쓸만하다"고 잡았고, 모델이 이 밑으로 떨어지면 벤치마크를 멈췄음. 참고로 모델마다 최대 컨텍스트가 다른데, GPT-OSS는 최대 ~128K, Qwen 3.5/6은 ~256K, Nemotron은 무려 400k 토큰까지 가능함.
결론부터 말하자면 내 느낌이 맞았음. Nemotron Super는 다른 모델들에 비해 깊은 컨텍스트를 압도적으로 잘 다룸. "속도 깡패"라던 GPT-OSS 120B는 속도가 너무 빨리 떨어져서 32K 깊이부터는 Nemotron Super가 PP 속도로 추월해버림. QWEN 3.5 122B A10B는 16K 깊이에서 거의 바로 따였고. 심지어 Qwen 3.6 35B A3B는 자기 최대 컨텍스트인 ~256k에서 Nemotron이랑 PP 속도가 비슷하게 나오더라. 이건 좀 의외였음.
토큰 생성 속도(난 이게 PP만큼 중요하진 않다고 봄)를 보면, Nemotron Super는 처음엔 쓸만한 수준(내 기준 >~10 TG TPS)으로 시작하지만, 아직 "쾌적하다"(내 기준 >~20 TG TPS)고 하긴 좀 그럼. 400k 컨텍스트 깊이까지 가면 내 기준에서 "간신히 쓸만한" 수준으로 서서히 떨어지는데, 그래도 이 정도면 꽤 대단한 거 아님? 제일 직접적인 경쟁자인 Qwen 3.5 122B A10B도 128k 컨텍스트에서 비슷한 속도였음. 아, MTP는 안 켰으니까 참고하고.
TG 속도가 중요하다면 128k 미만 컨텍스트에서는 Nemotron이 최선은 아님. 하지만 PP가 중요하고 큰 모델을 써야 한다면 Nemotron이 합리적인 선택지 같음. 굳이 그렇게 큰 모델이 필요 없다면 당연히 Qwen 3.6 35B 같은 작은 모델로 가는 게 답이고.
혹시 다른 결과 나온 사람 있음? rocm으로 돌려봤다거나, 내가 놓친 튜닝 팁 같은 거 아는 사람?

