중국 AI 연구소 Moonshot AI가 오늘 아침 Kimi K3를 공개했다. "현재까지 가장 강력한 모델로, 파라미터(parameter) 규모는 2.8조 개"라고 소개한 이 모델은 현재 웹사이트와 API를 통해 이용할 수 있으며, 오픈 웨이트(open weight) 공개는 "2026년 7월 27일까지" 이루어질 예정이다.
Moonshot은 이 모델을 최초의 "오픈 3조 파라미터급 모델"(2.8조를 3조로 올림한 것으로 보인다)이라 부르며, DeepSeek의 1.6조 파라미터 v4 Pro에서 그 왕좌를 가져왔다. 자체 공개 벤치마크에 따르면 K3는 Claude Opus 4.8 max와 GPT-5.5 high를 대부분의 항목에서 앞서지만, Claude Fable 5와 GPT-5.6 Sol에는 뒤진다.
해당 모델에 대한 Artificial Analysis 보고서에서 주목할 만한 내용을 몇 가지 추리면 다음과 같다:
또한 이 모델은 현재 Arena.ai의 프론트엔드 코드 아레나에서 1위를 차지하며 Claude Fable 5마저 제쳤다.
이번 모델에서 특히 주목되는 것은 가격이다. 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로, Anthropic의 Claude Sonnet 시리즈와 동일한 수준이며 중국 AI 연구소가 출시한 모델 중 역대 가장 비싼 축에 든다. Kimi K2.6의 0.95달러/4달러와 비교하면 큰 폭의 인상이다. 파라미터 규모 2.8조 개는 기존 1조 파라미터 모델의 두 배를 훌쩍 넘는다.
Moonshot API 키 발급 없이 테스트하기 위해 llm-openrouter 플러그인을 통해 OpenRouter를 이용해 자전거를 타는 펠리컨 SVG를 생성해봤다:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'
전체 출력 내용은 여기서 확인할 수 있다. 결과물은 다음과 같다:

이 펠리컨을 생성하는 데 입력 토큰 95개, 출력 토큰 16,658개(이 중 추론 토큰 13,241개)가 소비되었고, 총 비용은 25센트였다!
K3가 이미지 입력을 지원하기 때문에, 위에서 렌더링한 SVG를 입력으로 넣고(대체 텍스트 프롬프트 사용) 다음과 같은 결과를 얻었다(비용 0.6센트):
빨간 스카프를 두르고 회색 도로 위에서 빨간 자전거를 타는 흰 펠리컨의 카툰 일러스트. 도로에는 흰 점선이 그려져 있으며, 펠리컨은 크고 주황색인 부리와 페달을 밟는 주황 물갈퀴 발을 가지고 있고, 뒤편에는 흰 속도선이 표현되어 있다. 배경에는 연한 하늘색 하늘에 흰 구름, 노란 태양, 날아가는 작은 검은 새 두 마리가 보이며, 전경에는 작은 흰 꽃이 핀 초록 풀밭이 펼쳐져 있다.
"자전거를 타는 펠리컨 SVG를 생성해줘" 테스트를 시작한 지도 어느덧 21개월이 됐다. 처음부터 특별히 훌륭한 벤치마크는 아니었다. 모델 비교가 얼마나 터무니없이 어려운 일인지를 비꼰 농담으로 시작했는데, 첫 1년간은 실제 모델 성능과 놀라운 상관관계를 보이는 것으로 나타났다.
하지만 그 연관성은 지금은 거의 끊어진 상태다. GPT-5.6과 Claude Fable 5의 펠리컨이 GLM-5.2에 밀리는데, GLM을 좋아하긴 해도 그것이 Fable급 모델이라고는 생각하지 않는다.
(연구소들이 이 벤치마크를 겨냥해 학습시키고 있다는 생각은 아직 확신하지 못한다. 실제로 그랬다면 훨씬 더 좋은 결과가 나와야 할 것 같다. 다만 Gemini가 동물이 탈것을 타는 조합에 최적화되어 있을 가능성은 있다!)
펠리컨 테스트의 가장 큰 한계는, 오늘날 모델에서 가장 중요한 요소인 에이전트(agent) 툴 호출과 대화가 길어질수록 도구를 안정적으로 운용하는 능력을 전혀 측정하지 못한다는 점이다.
그러니 펠리컨으로 모델을 비교하려 들지는 말자!
그렇다고 해도, 직접 이 벤치마크를 돌려보는 것에서 여전히 적지 않은 가치를 얻고 있다.
첫째로, 모델을 실제로 써보게 만드는 강제 장치가 된다. 펠리컨을 보여준다는 것은 내가 직접 프롬프트를 실행해봤다는 뜻이다. 공식 API가 있으면 그것을 쓰고, 오픈 웨이트 모델이고 128GB M5 MacBook Pro에서 구동 가능한 크기라면 직접 내 머신에서 돌려보는데, 보통 llama.cpp나 LM Studio, Ollama를 활용한다. 새 API 키 발급 없이 공식 API에 접근할 수 있는 경우가 많아 OpenRouter를 자주 이용하기도 한다.
대부분의 펠리컨은 내가 만든 LLM CLI 도구로 생성하는데, 덕분에 최신 모델이 해당 도구(및 플러그인)에서 지원되도록 관리하는 동기도 생긴다.
더 중요한 것은, "자전거를 타는 펠리컨 SVG를 생성해줘"라는 단 하나의 프롬프트만으로도 모델의 흥미로운 특성이 드러난다는 점이다.
오늘 Kimi K3로 얻은 결과를 보자. 이 단순한 프롬프트 하나가 이 모델의 여러 특징을 뚜렷하게 보여줬다.
K3는 현재 추론 강도 단계가 하나뿐이지만, 최근에는 같은 펠리컨 프롬프트를 여러 강도 수준으로 실행해보는 방식에서 꽤 많은 인사이트를 얻고 있다. 각 수준이 실제로 어떤 차이를 만드는지 빠르게 파악할 수 있기 때문이다. 예를 들어 GPT-5.6 모델 패밀리에 대해 만든 매트릭스가 있다.
결국 펠리컨 테스트에서 내가 실질적으로 얻는 것은 다음과 같다:
여기에서는 블로그의 장문 아티클만 볼 수 있습니다. 모든 포스트를 받아보시려면 /atom/everything/을 구독하거나, 다른 구독 방법을 확인해보세요.