Ling Tiny 3.0은 미래를 엿볼 수 있게 해준다
Ling Tiny 3.0 is a glimpse of the future
핵심 요약
8B 파라미터 모델 Ling Tiny 3.0이 저사양 하드웨어에서도 효율적으로 작동하며 엣지 AI의 새로운 가능성을 보여주고 있습니다.
- 엣지 AI 가능성 — 저사양 하드웨어에서도 유용한 AI 작업이 가능해짐
- MoE 모델 효율성 — 기존 하드웨어에서 지능형 작업을 수행하는 핵심 기술
- 하드웨어 최적화 — 고성능 GPU 없이도 로컬에서 AI 모델 구동 가능
- 모델 성능 체감 — Gemma 3 등 최신 모델들이 로컬 환경에서 비약적인 속도 향상을 보임
80억 파라미터(MoE, 활성 파라미터 10억) 모델인 Ling 3.0 Tiny를 가지고 좀 놀아봤는데, 덕분에 꽤나 감회가 새롭네. 재미 삼아 2017년산 7세대 i5에 램 8기가짜리 똥컴에 llama.cpp로 돌려봤거든. 요즘 작업 돌리기엔 거의 고철 수준인 노트북이지. VRAM도 없고 GPU도 없어. 아무튼 거기다 Pi를 올려서 llama.cpp 서버에 있는 모델들 싹 다 스캔하는 스크립트 좀 짜달라고 시켜봤다. 초당 10토큰 정도로 헉헉대면서 돌아가더니, 20분 만에 끝내버리더라.
코드 짜고, 실행하고, 피드백 주고받으면서 수정하는 과정을 몇 번 반복했어.
물론 간단한 작업이지. 근데 2020년이었으면 이거 하느라 한두 시간은 족히 걸렸을걸.
이런 감자 같은 하드웨어로도 합리적인 시간 안에 쓸만한 결과물을 뽑아낸다는 게 진짜 놀라울 따름이야. 활성 파라미터 10억 개면 워낙 작아서, 최적화 같은 거 하나도 안 해도 구형 CPU에서 초당 10토큰씩 뽑아주거든. 그냥 llama.cpp 빌드해서 눈에 보이는 Q6 양자화 모델 아무거나 돌린 게 다인데 말이야.
내 말은, 1~2년 전에 비싼 GPU 장비 보면서 "와, 이제 컴퓨터가 알아서 코드를 짜네?" 싶어서 소름 돋았던 그 기분 기억나냐? 진짜 뭔가 있는 것 같고, 지능이 있는 것처럼 느껴졌잖아.
근데 이제 그게 2015년 이후에 나온 모든 저사양 기기에서도 시작되고 있다는 거지.
물론 비싼 장비들이 전력 효율이나 가성비, 토큰 생성 속도 면에서 훨씬 압도적이겠지. 그래서 구형 기기를 실사용하는 게 비효율적일 수도 있어.
근데 또 모르지. 적당히 똑똑한 컴퓨터가 백그라운드에서 할 수 있는 일은 널리고 널렸으니까. 어쩌면 엣지 인텔리전스의 새로운 시작일지도 몰라. 새로운 장비 살 필요도 없어. 이미 세상에 널린 기기들이 갑자기 지능적인 작업을 수행하기 시작하는 거니까. 잘 모르겠다.
그냥 GPU 보면서 느꼈던 그 기묘한 감정, 단순히 비트 쪼가리 이상의 무언가가 들어있는 것 같은 그 느낌을 구형 CPU에서도 받았다는 게 신기해서 주절거려 봤어. (아, 물론 의식이 있다는 건 아님. 그런 소리 하는 거 아님.)


