여러 LLM에게 버그 위치를 찾아달라고 요청해 봤음
I asked several models to locate the bug
핵심 요약
C# 코드의 버그를 여러 LLM으로 분석한 결과, DeepSeek V4.1이 가장 정확한 원인을 파악함.
- 버그 분석 — Godot 엔진의 버튼 상태 초기화 문제를 여러 모델이 진단함
- 성능 비교 — DeepSeek V4.1이 가장 정확했고 Muse Spark는 원인 파악에 실패함
- 비용 효율성 — API 가격 대비 성능 면에서 DeepSeek와 Luna가 경쟁력을 보임
- 판단 기준 — 레이아웃 변화보다 가시성 토글과 같은 근본 원인 파악을 중요시함
코드에 진짜 버그가 하나 있어서, 원인 좀 찾으려고 여러 LLM한테 똑같은 질문을 던져봤거든. 결과가 궁금한 사람들도 있을 것 같아서 공유함. 분석한 코드는 C#이었음.
프롬프트는 이거임:
In the expedition panel in the world map when I click on a resident to pick for expedition, or even hover over the button, it just flashes at high frequency as I move the mouse over it, but it only clicks like 1/10 of the time. Same for the dispatch Button, only close works fine. Can you locate why but don't make any changes yet?
API 가격 기준 토큰 사용량과 비용은 아래와 같음. Terra가 비효율적이라는 뜻은 아니고, 그냥 API 가격 자체가 비싸다는 거임. 구독 모델을 쓰면 실제 비용은 12~18 정도로 나누면 됨. Muse랑 GLM은 6, DeepSeek(OpenCode Go 구독 기준)는 1.5로 나누면 됨:
| Model | Input | Output | Cache Read | Context | Cost | Notes |
|---|---|---|---|---|---|---|
| Luna High | 108k | 7.1k | 646k | 104k | $0.043 | |
| Terra High | 115k | 5.2k | 519k | 109k | $0.396 | |
| DeepSeek V4.1 Flash Low | 53k | 25k | 1.6M | 75k | $0.028 | |
| DeepSeek V4.1 Flash High | 90k | 37k | 2.2M | 120k | $0.042 | Used webfetch on Godot's source code, but it fetched version 4.4, while the project uses 4.7 |
| Muse Spark 1.3 High | 36k | 5k | 474k | 37k | $0.006 | |
| GLM 5.3 Flash High | 46k | 41k | 696k | 40k | $0.048 |
출력 결과 보면 누가 제일 추론을 잘했는지 딱 보일 거임. DeepSeek는 낮은 추론 모드에서도 턴을 엄청 많이 썼는데, 그래서 Cache Read가 저렇게 많이 찍힌 거임.
판단은 Sol High한테 맡겼음. 어떤 모델이 낸 결과물인지 모르게 하려고 내가 임의로 첫 번째, 두 번째 이런 식으로 순서만 매겨서 넘겼고, 나중에 이름만 다시 바꿔 넣은 거임. 점수는 아래와 같음:
| Answer | Score |
|---|


