Ngram과 세계 지식 - 왜 우리는 코딩 모델만 만드는 걸까?
Ngram and world knowledge - why are we just building a coding model?
핵심 요약
코딩 능력 중심의 소형 모델 대신, Ngram 기술을 활용해 세계 지식을 보강한 모델 개발 가능성을 논의함.
- 모델 최적화 — 코딩과 에이전트 성능에 집중된 현재의 소형 모델 개발 방향을 지적함.
- Ngram 활용 — VRAM 한계를 극복하고 세계 지식을 확장할 수 있는 새로운 패러다임을 제안함.
- 지식 패키지 — 지능형 코어 모델에 특정 분야 지식을 추가하는 모듈식 접근 방식을 논의함.
- 기술적 한계 — 모델이 사실 정보를 저장하는 방식과 Ngram의 작동 원리에 대한 의문을 제기함.
이 글은 사람이 직접 쓴 거니까 사람 대하듯 해주면 고맙겠음. ㄳ.
요즘 코딩이랑 에이전트 툴 콜링 잘하는 모델, 특히 50기가 이하의 작은 사이즈로 뽑아내려는 관심이 엄청난 거 다들 알 거임. 근데 내가 AI를 직접 써보니까, 대형 업체 모델 안 쓰고 독자적으로 가려면 지금 나와 있는 모델들보다 훨씬 나은 '세계 지식(world knowledge)'이 필요하더라고.
Qwen 3.8 27B는 진짜 개쩌는 모델임. 똑똑하고, 앱 설계나 코딩, 시스템 작업 같은 거 할 때도 존나 좋음. 근데 프론티어급 모델들이랑 비교하면 세계 지식이 좀 딸림. 특히 내가 돌려야 하는 Q4 양자화 버전에서는 더더욱 그렇고.
그래서 의문이 하나 생김. Qwen 3.8 Next에 들어간 N-gram 기술 같은 게 앞으로 나올 모델들에도 적용될 텐데, 왜 지능은 좀 낮추더라도 세계 지식은 훨씬 방대한 모델은 안 만드는 거임? 지금 다들 어떻게든 작은 용량에 최대한 똑똑한 모델을 쑤셔 넣으려고만 혈안이 되어 있는 건 아는데, 왜 SSD를 활용해서 모델한테 세계 지식을 잔뜩 때려 박고, 스크린샷 처리나 다국어 능력, 픽셀 아트, 물리 문제 풀이 같은 거 더 잘하는 모델은 안 만드는 거냐고.
VRAM 용량 문제 해결하는 데는 ngram이 답인 것 같음... Qwen 3.8 Next 보니까 모델 개발 방식이 완전히 바뀌거나 더 나은 패러다임이 나올 수도 있겠다는 생각이 듦. 적당히 똑똑하면서 세계 지식은 엄청나게 많은 모델이, 무조건 똑똑하기만 한 모델보다 훨씬 나을 수도 있잖아.
게다가 이렇게 되면 모델 학습 데이터 컷오프 날짜 같은 것도 별로 안 중요해짐. 그냥 새로운 ngram만 갖다 붙이면 되니까.
물론 시장 점유율 먹으려면 코딩 잘하는 모델 만드는 게 제일 중요하긴 하지. 그래도 혹시 이런 쪽으로 연구하는 데가 있는지, 아니면 왜 이런 시도가 별로 없는지 아는 사람 있음?
내가 왜 틀렸는지, 어떻게 틀렸는지, 얼마나 멍청한지 아주 뼈를 때려주셈. 어차피 다들 그거 말하고 싶어서 근질근질할 거 아니까. 그래도 욕먹으면서 배우는 게 있겠지. 이 글만 봐도 내가 뭘 모르는지 딱 티가 나잖아.
다들 좋은 하루 보내라 :)
수정: 이 글 찾았는데 내가 궁금해하던 거 거의 다 들어있는 듯:
https://www.reddit.com/r/LocalLLaMA/comments/1vzgtqf/ngram_vs_experts_explained/
수정2:
이게 더 대박임. 꼭 읽어보셈. 레딧 추천 고맙다:

