5B 활성 파라미터 모델은 아는 게 별로 없지만, 이제는 그걸 단점으로 치지 않기로 했다
A 5B-active model doesn't know much, and I've stopped counting that as a flaw
핵심 요약
모델의 지식량보다 도구 호출(tool calling) 능력이 실무에 훨씬 중요하다는 인식의 변화를 다룹니다.
- 지식의 한계 — 모델이 모든 정보를 기억할 필요 없이 외부 도구를 활용하는 것이 더 효율적임
- 도구 호출 능력 — 모델이 모르는 것을 인정하고 검색하는 능력이 지식 암기보다 중요함
- 평가 방식의 변화 — MMLU 같은 지식 벤치마크보다 실제 도구 사용 능력을 기준으로 모델을 선택해야 함
- 작은 모델의 강점 — 특정 작업에 최적화된 소형 모델이 범용 모델보다 도구 호출에 더 능숙할 수 있음
생각이 좀 바뀌어서 쓰는 글.
한동안 활성 파라미터가 낮은 모델들은 거들떠보지도 않았다. 테스트해 본 것마다 똑같은 방식으로 실패했기 때문이다. 조금이라도 모호한 걸 물어보면 아주 자신 있게 그럴듯한 거짓말을 지어냈다. 최근에 돌려본 Ling-3.0-flash도 마찬가지였다. 총 파라미터는 124B인데 토큰당 활성화되는 건 5B 정도라, 안에 든 게 별로 없는 거다.
생각이 바뀐 이유는 내가 모델을 잘못 테스트하고 있었다는 걸 깨달았기 때문이다. 나는 모델이 '지식'을 가지고 있는지 확인하고 있었다. 하지만 내가 모델을 돌리는 루프 안에서, 모델은 무언가를 알고 있을 필요가 없다. 가서 찾아오기만 하면 된다. 문서는 디스크에 있고, API 레퍼런스는 호출 한 번이면 되고, 코드베이스도 바로 옆에 있다. 가중치 안에 박제된 지식은 내가 업데이트할 수도, 검증할 수도 없는 지식이다.
그래서 이제 내가 중요하게 생각하는 속성은 모델이 추측하는 대신 도구를 호출하느냐 하는 것이다. 이건 완전히 다른 문제고, 학습으로 개선할 수 있는 부분이다. 작은 모델들이 덩치에 비해 이 능력이 더 좋은 것 같은데, 아마 잡학 지식보다는 도구 호출에 집중해서 학습되었기 때문일 것이다.
물론 반론도 있다. 모델이 자신이 모른다는 사실을 알 만큼은 똑똑해야 한다는 점이다. 모델이 자신 있게 틀린 답을 내놓으면 가로챌 도구 호출도 없다. grep으로 찾으면 될 걸 굳이 라이브러리 API를 지어내는 걸 본 적이 있다. '일단 찾아보라'는 규칙을 주면 도움이 되긴 하지만, 완벽한 해결책은 아니다.
내가 진짜 원하는 버전은 낮은 자신감일 때 도구로 넘어가도록 명시적으로 학습된 소형 모델이다. 이게 의도적인 건지, 아니면 도구 호출 RL의 부작용으로 얻어걸린 건지는 모르겠다.
지식 벤치마크가 아니라 이런 기준으로 모델을 고르는 사람이 있을까? MMLU 점수는 이 모델이 grep을 할 수 있을지 없을지에 대해 아무것도 알려주지 않는다.


