듀얼 5070 Ti 환경에서 로컬 에이전트를 Qwen3.8 27B에서 Ornith 1.5 35B-A3B로 교체함: 180 tok/s vs 60 tok/s, 테스트 점수는 동일
Switched my local agent from Qwen3.8 27B to Ornith 1.5 35B-A3B on two 5070 Tis: about 180 tok/s vs 60, same scores on my tests
핵심 요약
듀얼 5070 Ti 환경에서 로컬 에이전트를 Qwen3.8 27B에서 Ornith 1.5 35B-A3B로 교체하여 속도를 3배 향상시켰으며, 동일한 테스트 성능을 확인했습니다.
- 성능 비교 — Qwen 27B 대비 Ornith 35B-A3B가 약 3배 빠른 생성 속도를 보임.
- 기술적 특징 — 선형 어텐션과 MoE 구조를 통해 긴 컨텍스트에서도 효율적인 속도 유지.
- 테스트 검증 — 에이전트의 9단계 세션 및 코딩 작업에서 기존 모델과 동일한 통과율 기록.
- 컨텍스트 확장 — 512K 및 1M 컨텍스트에서도 안정적인 성능과 긴 프롬프트 처리 능력 확인.
내 세팅은 RTX 5070 Ti 16GB 두 장(하나는 OCuLink 독에 연결)에 램 64GB, 윈도우에서 Ollama 돌리고 에이전트는 WSL 환경의 파이에서 돌아감. 어젯밤까지는 Qwen3.8 27B UD-Q4_K_XL 128K(MTP 포함)를 메인으로 썼는데, 카드 두 장 합쳐서 55~70 tok/s 정도 나오더라.
매주 새로 나오는 오픈 모델들 찾아서 내가 만든 테스트 두 개 돌려보는 루틴이 있음. 하나는 9단계짜리 긴 세션(도구 호출, 파일 읽기, 결정 내리기, 컨텍스트 3번 압축 후 리콜)이고, 다른 하나는 작은 코딩 작업 10개임. 27B는 9/9, 10/10 찍었음.
이번 주에 Ornith 1.5 35B-A3B(Ollama 라이브러리의 ornith-1.5:35b, Q4_K_M)를 가져와서 돌려봤는데, 이것도 9/9, 10/10 통과함. Laguna XS 2.1도 둘 다 통과했고, North Mini Code 1.0은 4/9밖에 못 하더라.
Ornith 128K 컨텍스트는 24.4GB 먹고 카드 두 장에 딱 들어감. 생성 속도는 180 tok/s 정도(두 번 돌렸을 때 176, 183 나옴, 짧은 프롬프트, 생각하기 끔). 27B보다 3배는 빠름.
모델 정보 보면 왜 이렇게 빠른지 이해가 감. 토큰당 활성화되는 파라미터가 3B 정도(256개 전문가 중 8개 사용)고, 41개 레이어 중 10개만 풀 어텐션이고 KV 헤드는 2개임. 나머지는 리니어 어텐션이라 KV 캐시가 거의 안 늘어남. 128K에서 256K로 올려도 2GB밖에 안 늘더라.
256K도 들어가긴 하는데, 내 메인 카드가 모니터 출력까지 담당해서 1.2GB 정도가 시스템 램으로 넘어가 버림. 그래서 속도가 139 tok/s 정도로 떨어짐. 그냥 128K를 기본으로 쓰고 256K는 필요할 때만 바꾸기로 함.
주의할 점: 내 테스트가 둘 다 만점이라서 내 작업 환경에서 27B보다 나쁘지 않다는 것만 증명된 거지, 더 똑똑하다는 건 아님. Artificial Analysis는 아직 점수 안 매겼고. 벤더 쪽 수치는 SWE-bench Verified 79점, Terminal-Bench 2.1 68.5점이라는데 이건 내가 직접 확인 안 해봄.
다음엔 llama-server로 512K랑 1M 돌려볼 생각임. 모델 카드 보니까 네이티브 262144 위에 YaRN 팩터 4 씌우면 1M 정도 나오고, 팩터 2면 512K 정도 나온다네. 잘 돌아가면 수치 공유함.
혹시 이거 에이전트 작업에 쓰는 사람 또 있냐? 긴 세션에서 27B랑 비교했을 때 어떤지 궁금함.
수정: 긴 컨텍스트 테스트도 잘 버팀. 모델 카드에 적힌 대로 YaRN 설정해서 llama-server 돌려보니까, 512K(팩터 2, q8 KV 캐시)는 카드 두 장에 쏙 들어가고 419K 토큰 프롬프트 중 335K 지점에 숨겨둔 메모도 잘 찾아냄. 읽는 속도는 평균 1060 tok/s 정도였고, 그 깊이에서 생성은 35 tok/s 정도 나옴. 1M(팩터 4, q4 KV 캐시)은 llama-server의 fit 옵션으로 전문가 일부를 시스템 램으로 밀어내니까 로드됐고, 849K 프롬프트 중 720K 지점 메모도 찾아냄. 이건 읽는 데 24분 걸렸고(평균 570 tok/s), 생성은 16 tok/s 정도 나옴. 짧은 프롬프트에서는 512K일 때 135 tok/s, 1M일 때 68 tok/s 정도 나옴.

