GPT-6.1 Sol 루프형 '유출'이 시사하는 중첩 모델 서빙 아키텍처
GPT-6.1 Sol looped "leak" hints at nested models serving architecture
핵심 요약
GPT-6.1 Sol의 추론 속도와 루프형 아키텍처를 분석하여 비용 절감을 위한 중첩 모델 구조 가능성을 제기함.
- 루프형 아키텍처 — 여러 번의 순방향 패스를 통해 모델의 실질적인 깊이를 늘리는 방식임
- 추론 속도 분석 — GPT-6.1 Sol과 Astra의 속도 차이를 통해 동일 가중치 공유 가능성을 추론함
- 중첩 모델 구조 — 비용 절감을 위해 하나의 모델 내에서 활성 파라미터를 조절하는 방식임
- 로컬 LLM 적용 — 루프형 아키텍처가 로컬 모델의 지능을 높이는 데 기여할 수 있는지 논의함
안녕 라마들아. 비록 클로즈드 소스 모델이긴 하지만, 이 논의가 로컬 AI 커뮤니티에도 분명 도움이 될 것 같아서 글 써본다.
다들 들어봤겠지만, GPT-6 Astra는 토큰 하나를 뽑을 때 한 번만 연산하는 게 아니라, 여러 번의 포워드 패스를 거쳐서 토큰을 출력하는 루프드 트랜스포머(looped transformer) 구조라는 썰이 돌고 있잖아. 이렇게 하면 재귀(recurrence)를 통해 모델의 실질적인 깊이가 깊어지는 효과가 있어서, 연산량은 좀 더 들더라도 가중치를 훨씬 알차게 써먹을 수 있거든.
최근 Azure Foundry "유출" 자료를 보면 구체적인 수치까지 나오는데, GPT-6-Sol은 토큰당 3번의 추론 패스를 돌리고, 6.1-Sol은 2번만 돌린다는 얘기가 있어.
사람들은 6-Sol이 아니라 ASTRA가 3번 패스를 돌리는 거고, 6.1-Sol은 그냥 2번 패스로 돌리는 같은 모델일 거라고 추측 중이지.
그래서 대충 계산기를 좀 두드려봤어. 수치가 맞나 보려고 artificial analysis에 들어가서 이게 사실인지 확인할 수 있는 가장 좋은 단서인 '속도'를 살펴봤지.
물론 이걸로 증명은 안 되겠지만, 일단 내 말 좀 들어봐. 이미지를 보면 흥미로운 점이 있어:
- GPT-6-Sol 및 5.6-Sol: ~100 tok/s
- GPT-6.1-Sol: ~60 tok/s
- GPT-6-Astra: ~60 tok/s
만약 얘네가 기본적으로 같은 모델 가중치를 쓴다면, 배치 추론을 돌리고 있을 가능성이 커. Sol은 Astra 요청이 토큰 하나를 끝낼 때까지 한 사이클 더 기다려야 할 수도 있고, 그래서 두 모델 다 속도가 비슷하게 제한되는 거지. 아니면 Sol이 노는 동안 그 대기 시간을 활용하려고 요청을 인터리브(interleaved)해서 GPU 활용률을 쥐어짜고 있을지도 모르고.
근데 생각해보니 5.6 Luna는 126-137 tok/s였는데 6.0-Luna로 넘어오면서 110-115 tok/s 정도로 떨어졌더라고. 여러 벤치마크랑 추론 난이도를 고려하면 내 눈엔 꽤 유의미한 하락폭이야.
그러다 예전에 NVIDIA가 선보였던 이 괴상한 모델이 생각났어. 큰 모델 안에 작은 모델들이 들어있어서 하나의 통합된 풋프린트 안에서 돌아가는 그런 놈이었지.
그래서 든 생각인데, Astra, Sol, Luna가 다 같은 가중치를 공유하는 거 아닐까? Luna는 그냥 Astra/Sol에서 활성 파라미터를 절반으로 줄이거나, 토큰당 패스를 한 번으로 줄여서 무료 사용자들한테 비용 절감용으로 뿌리는 모델일 수도 있잖아. 아무도 안 쓰고 돈도 안 되는 Sol을 위해 굳이 클러스터를 따로 돌릴 필요는 없으니까.
증명할 순 없지만, 얘네가 비용을 대규모로 아끼려고 재귀적이고 중첩된 아키텍처를 동시에 쓰고 있다는 강력한 증거 같아.
혹시 다른 의견 있는 사람 있어? 내 뇌가 과몰입해서 시간 낭비하는 거 좀 멈추게 설명 좀 해줘라.
이런 루프드 아키텍처가 실제로 대규모로 돌아가고 있다는 증거가 될 수 있어서 로컬 AI 커뮤니티에도 흥미로울 것 같아. deepseek나 qwen, glm 같은 애들도 결국 이런 아키텍처를 실험하게 되지 않을까 싶기도 하고. 큰 모델 안에 작은 모델을 넣는 방식도 확실히 장점이 많으니까.
추신: 100% 사람이 쓴 글임. 초당 0.7 토큰 속도. ~100T 파라미터짜리 생체 모델. 커피 두 잔이랑 뮤즐리 바 하나 먹고 돌리는 중.
