아마도 "llama.cpp를 쓰세요"라고 말해야 할 듯
Need maybe say "Use llama.cpp"
핵심 요약
최신 엔진에서 발생한 무한 루프 문제를 llama.cpp로 해결한 경험을 공유하며, 특정 런타임의 안정성에 대해 논의함.
- 런타임 성능 비교 — 동일한 모델을 사용해도 엔진에 따라 루프 발생 여부가 달라짐을 확인함.
- 샘플링 설정 문제 — 특정 엔진은 기본값이 greedy(온도 0)로 설정되어 루프가 발생할 가능성이 있음.
- llama.cpp 선호 — 안정적인 추론 결과를 위해 검증된 llama.cpp 사용을 권장함.
- 기술적 회의론 — 런타임의 결함을 모델 자체의 문제로 단정 짓는 것에 대해 신중한 태도를 보임.
다들 입에 침이 마르게 칭찬하던 그 기적의 엔진, 나도 한번 써봤다.
IQ3_S 모델한테 이 갤러리에 올라온 글 하나 던져주고 의견 좀 물어보면서 긴 문장 생성할 때 tps가 얼마나 나오나 테스트해 봤거든:
다음 문제 좀 도와줄 수 있어?
Kimi K2도 이제 한물갔고, GPT OSS 120b도 마찬가지야. 요즘 나온 오픈 웨이트 모델 중에서 아첨(sycophancy) 제일 덜 하는 놈이 누구냐? 창작이나 연구 보조용으로도 쓸 거고(아첨 때문에 내 멍청한 아이디어 따라가다가 삽질한 적이 한두 번이 아님), 에이전트 코딩용으로도 쓸 거거든(아첨 심하면 버그를 못 잡아내니까).
사고 과정(thinking trace)은 이랬음:
사용자 질문에 답해야 함. 2026년 기준 현황을 알려줘야 하나? get_datetime 툴이 있네. 현재 날짜가 2026년인지 알아야 함? 시스템상 현재 날짜는 2026-06-22. get_datetime을 써야 하나? 확인차 호출해 볼까. 사용자는 아첨이 가장 적은 최신 오픈 웨이트 모델을 묻고 있음. Kimi K2가 구식이라는 점을 언급해야 하나?
...
10k 토큰 지나니까 상태가 이 모양으로 맛이 가버림:
"Use 'for code, list constraints'."를 포함해야 할지도, 아마도.
"Use 'for code, list requirements'."를 포함해야 할지도, 아마도.
똑같은 모델을 llama.cpp에서 돌리면 무한 루프 안 빠지고 멀쩡하게 답변 잘만 나오는데 말이지.
