Hermes Agent용 Jetson Orin NX 빌드 및 벤치마킹
Jetson Orin NX Build for Hermes Agent + Benchmarking
핵심 요약
Jetson Orin NX를 활용해 Hermes Agent 구동을 위한 저전력·고효율 LLM 서버를 구축하고 벤치마킹한 사례입니다.
- 하드웨어 개조 — 기존 방열판을 절단하고 새로운 케이스를 제작하여 40W 전력 환경에서 정숙성 확보
- 성능 목표 달성 — 10 tok/s 이상의 생성 속도와 65K 이상의 컨텍스트 윈도우 구현
- 모델 벤치마킹 — Gemma 4 26B Q2_K_XL 모델을 사용하여 긴 컨텍스트에서도 준수한 성능 확인
- 프로젝트 목적 — 로봇 프로젝트에서 남은 Jetson Orin NX를 활용한 소형 LLM 서버 구축
예전에 거대한 LLM 서버를 운영했었는데, 이제는 아주 작은 녀석을 갖게 됐습니다! Llama-7B 시절에 하던 로봇 프로젝트에서 쓰다 남은 Jetson Orin NX가 먼지만 쌓여 있었거든요. 요즘 MoE나 작은 모델들이 잘 나가는 걸 보고, 다시 한번 가지고 놀 때가 됐다고 생각했습니다.
목표:
- 최대한 조용하게 (전력을 25W에서 40W로 올렸음에도)
- 생성 속도(TG) 10 tok/s 이상, 프롬프트 처리(PP) 300 tok/s 이상
- Hermes Agent를 위해 최소 65K 컨텍스트 확보
- 무조건 간지나게 👌🏻
이런 제약 조건들 때문에 순정 방열판을 쇠톱으로 잘라내고 새 케이스를 만들어야 했습니다. 그 후 너무 많은 모델(예상대로 Gemma-4와 Qwen 3.6 계열)을 테스트했는데, 양자화 변형이 너무 많았네요.
세 줄 요약: Gemma 4 26B A4B UD Q2_K_XL 결과:
- 66K 컨텍스트 윈도우
- 약 8k 컨텍스트에서 14.65 tok/s
- 약 60k 컨텍스트에서 10.21 tok/s
- 긴 프롬프트로 여러 번 도구 호출(tool call)을 해도 여전히 괜찮은 성능
도움이 되길 바랍니다!


