LLM을 활용한 칼로리 평가 벤치마크
Benchmarking calories evaluation with LLMs
핵심 요약
LLM을 이용해 음식 사진과 설명으로 칼로리를 추정하는 벤치마크를 수행하고 모델별 성능을 비교함.
- 벤치마크 설정 — Nutrition5k 데이터셋과 USDA/MEXT 영양 정보를 활용하여 25개 식단 평가함.
- 모델 성능 비교 — 모델 크기와 성능이 비례하지 않으며, Muse Spark 1.3이 가장 높은 정확도를 보임.
- 평가 지표 — 20% 오차 범위 내 적중률과 평균 편향, 중앙값 오차를 기준으로 모델을 분석함.
- 실제 활용 — 소비자용 하드웨어에서 최적의 모델은 작업 성격에 따라 크게 달라짐을 확인함.
그냥 내가 쓸 간단한 칼로리 계산기가 필요해서, LLM으로 음식 사진이랑 설명을 분석해 칼로리를 뽑아내는 걸 만들어봤음.
모델을 골라야 해서 간단하게 벤치마크를 돌려봤다.
테스트 환경은 이랬음:
-
사진이랑 칼로리 데이터는 Nutrition5k 사용: https://github.com/google-research-datasets/Nutrition5k
-
USDA FoodData Central이랑 MEXT 칼로리 정보에 접근할 수 있는 툴 사용
-
오차 범위 20% 이내로 맞춘 식단이 몇 개나 되는지로 모델 성능 평가
-
전부 무작위로 뽑은 25개 식단으로 테스트함
내 컴퓨터에서 돌리기 너무 큰 모델들은 OpenCode Go/OpenRouter를 써서 돌렸다. 곧 오픈 웨이트로 풀린다는 Spark 1.3도 포함했음.
결과
| Model | % within 20% | Mean bias | Median Error |
|---|---|---|---|
| Qwen 3.8 27b | 16% | +64 kcal | 148 kcal |
| GLM 5.3 Flash | 28% | +18 kcal | 65 kcal |
| Qwen 3.8 Max | 32% | -11 kcal | 48 kcal |
| Muse Glimmer 30b | 32% | +25 kcal | 92 kcal |
| Qwen 3.8 Flash | 36% | +2 kcal | 91 kcal |
| DeepSeek v4 Flash Vision | 40% | +52 kcal | 65 kcal |
| Muse Spark 1.3 | 48% | -24 kcal | 45kcal |
가장 과학적인 벤치마크는 아니라는 거 나도 알지만, 모델 크기랑 성능 순위가 딱히 상관없다는 게 흥미롭네.
개인적으로 제일 재밌는 건 Muse Glimmer 30b가 여기서 Qwen 3.8 27b를 그냥 압살해버린다는 거임. 결국 소비자용 하드웨어(~32Gb VRAM)에서 "최고의" 모델이 뭔지는 작업 종류에 따라 완전히 갈린다는 걸 잘 보여주는 듯.


