Luna 6은 Luna 5.6에 비해 엄청난 퇴보임. 핵심 정보를 놓치고 5.6보다 도움이 안 됨
Luna 6 is a massive downgrade over Luna 5.6. Misses crucial details, less helpful than 5.6 Luna
핵심 요약
Luna 6이 이전 버전보다 게으르고 핵심 정보를 누락한다는 사용자들의 비판과, 효율적이라 선호한다는 의견이 대립하고 있습니다.
- 성능 저하 논란 — Luna 6이 이전 버전보다 핵심 정보를 누락하고 답변이 불충분함
- 게으른 답변 — 모델이 토큰을 아끼려는 듯 최소한의 답변만 제공함
- 프롬프트 의존성 — 사용자가 더 구체적으로 질문해야 한다는 반론이 제기됨
- 일관성 문제 — 동일한 질문에도 답변 품질이 들쭉날쭉함
내가 관리하는 에이전트 기반 리포팅 툴이 있는데, 이게 LLM이랑 툴 콜링을 써서 여러 소스에서 데이터를 긁어와 보고서를 써주는 놈이거든.
Luna 5.6이 저렴한 비용으로 아주 잘 돌아가고 있었는데, 벤치마크 점수도 좀 더 높고 가격도 50%나 싸길래 Luna 6로 업그레이드하면 최소한 지금만큼은 해주겠지 싶었단 말이야.
그래서 둘 다 "high" 노력 수준으로 설정하고 A/B 테스트를 돌려봤는데 결과가 이 모양임:
-
작성된 보고서를 검토하고 관련 항목을 찾아내는 모든 평가 항목에서, Luna 6는 답에 포함되어야 할 관련 항목을 하나 이상씩 꼭 빼먹음. Luna 5.6은 안 그랬는데 말이지.
-
Luna 6는 Luna 5.6이 충분히 대답할 수 있는 질문들도 제대로 처리 못 하고, 답변 내용도 훨씬 부실해서 도움도 안 됨.
-
Luna 꼬라지를 보니 토큰을 최대한 아끼려고 발악을 하는 것 같은데, 그래서 더 쓸모가 없음. 답변을 뭉뚱그려서 내놓으니까 사용자가 꼬리에 꼬리를 무는 질문을 계속해야 함.
예를 들어보자. "이 기준에 맞는 항목이 있는지 찾아줄래?"라고 물으면,
GPT 5.6 Luna: "7개 항목을 찾았어. 여기 있어: <Formatted List>"
GPT 6 Luna: "응, 7개 찾았어." (사용자가 "그럼 목록 좀 보여줄래?"라고 다시 물어봐야 함)
Luna 6를 한 단어로 요약하자면 "게으름" 그 자체임. 'high' 노력 수준으로 설정해도 항상 최소한의 답변만 내놓으려고 함.
여러 케이스를 다 테스트해 봤는데, Luna 6가 Luna 5.6보다 나은 답변을 내놓는 경우는 단 한 번도 없었음.
내 앱에는 절대 안 쓸 거고, 그냥 Luna 5.6 계속 쓸 생각임.

