물리 시뮬레이션에서 탑 쌓기로 LLM 10종 벤치마크를 해봤는데, Claude Opus 5가 우승함
I benchmarked 10 LLMs on building towers in a physics sim. Claude Opus 5 won
핵심 요약
물리 엔진 기반의 탑 쌓기 벤치마크에서 Claude Opus 5가 위험 관리 능력을 바탕으로 1위를 차지함.
- 벤치마크 방식 — 30개의 블록을 쌓으며 위치와 속도 사이의 불확실성(하이젠베르크 원리)을 적용함
- Claude Opus 5 우승 — 무리하게 블록을 쌓기보다 탑을 보호하기 위해 일찍 종료하는 전략을 선택함
- 모델별 성능 차이 — 단순 성능보다 위험을 다루는 전략적 판단력이 결과에 큰 영향을 미침
- 향후 연구 방향 — 적대적 환경을 도입한 'JengaBench' 등 추가적인 테스트 가능성 논의
각 모델은 툴 API를 통해 30개의 블록을 배치함. 모든 배치에는 노이즈가 포함되어 있어, 정확한 위치나 정확한 속도 중 하나만 가질 수 있고 둘 다는 불가능함. 점수는 마지막에 남아 있는 탑의 높이임. 5개의 시드, 각 3번의 시도가 주어지며, 모델들은 시도 사이에 노트북을 유지함.
| # | 모델 | 높이 (m) | ±σ | 최고 기록 | 시도 1→2→3 | 출력 토큰 | m / 100k 토큰 |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | 8.52 | 2.4 | 11.07 | 6.50 → 6.85 → 8.10 | 390k | 2.2 |
| 2 | Claude Sonnet 5 | 8.46 | 2.2 | 11.94 | 6.30 → 5.54 → 4.84 | 396k | 2.1 |
| 3 | Claude Fable 5 | 7.81 | 1.0 | 9.10 | 6.45 → 4.01 → 5.98 | 284k | 2.8 |
| 4 | GPT-5.5 | 7.79 | 0.3 | 7.92 | 5.59 → 7.06 → 6.90 | 99k | 7.8 |
| 5 | DeepSeek V4 Flash | 7.10 | 1.1 | 8.18 | 2.08 → 6.24 → 5.80 | 467k | 1.5 |
| 6 | GPT-5.6 Sol | 6.16 | 1.4 | 6.87 | 3.17 → 3.43 → 4.76 | 76k | 8.1 |
| 7 |

