Luna 5.6과 Luna 6으로 Terminal-Bench 2.1 100개 슬롯을 돌려봤는데, Luna 6 결과는 여전히 장난 수준임
I ran 100 Terminal-Bench 2.1 slots on Luna 5.6 and Luna 6. The Luna 6 results still look like a joke
핵심 요약
Luna 6이 이전 버전인 5.6보다 Terminal-Bench 2.1 성능이 현저히 떨어지며, 환경 인식 오류 등 심각한 퇴보를 보임.
- 성능 퇴보 — Luna 6이 5.6 대비 Terminal-Bench 2.1 통과율이 매우 낮음
- 환경 인식 오류 — Luna 6이 쓰기 가능한 환경을 읽기 전용으로 오판하는 경향이 있음
- 사용자 불만 — Luna 6의 무능함으로 인해 다른 모델로 전환을 고려하는 사용자가 늘어남
이거 이틀 전에 처음 돌려봤거든. 결과 보고 진짜 충격받아서 GPT-5.6 Luna랑 GPT-6 Luna 사이의 그 엄청난 격차가 그냥 운이 없어서 그런 건지 확인하려고 오늘 다시 비교 테스트 돌려봤다.
테스트 과제는 Terminal-Bench 2.1 on Harbor에서 가져왔어. 이 공개 Harbor 작업에 있는 445개 기록 중에서 가장 짧은 거 100개 골랐다. 이 100개 슬롯은 29개의 서로 다른 과제가 반복된 것들이고, 그냥 제일 빨리 끝나는 100개 슬롯을 뽑은 거야.
각 설정마다 똑같이 100개 슬롯을 돌렸고, 100점 만점에 몇 개나 통과했는지는 아래와 같아:
| Model | Effort | Mode | First run | Rerun |
|---|---|---|---|---|
| Luna 5.6 | Medium | Standard | 87 | 82 |
| Luna 5.6 | Medium | Fast | 83 | 89 |
| Luna 5.6 | High | Fast | 89 | 87 |
| Luna 5.6 | Xhigh | Fast | 91 | 93 |
| Luna 5.6 | Max | Fast | 89 | 90 |
| Luna 6 | Medium | Standard | 53 | 59 |
| Luna 6 | Medium | Fast | 51 | 62 |
| Luna 6 | High | Standard | 59 | 55 |
| Luna 6 | High | Fast | 60 | 58 |
| Luna 6 | Xhigh | Standard | 36 | 40 |
| Luna 6 | Xhigh | Fast | 42 | 40 |
| Luna 6 | Max | Standard | 41 |


