Astra는 잠재 공간에서 34번의 연속적인 단순 수학 연산이 가능하며, 이는 Sol보다 4배 뛰어난 수치임
Astra can do 34 consecutive simple math operations in latent space, 4x more than Sol
핵심 요약
Astra 모델이 사고의 연쇄(Chain-of-Thought) 없이도 잠재 공간에서 34단계의 연속 수학 연산을 수행하는 놀라운 성능을 보임.
- 성능 벤치마크 — Astra가 사고의 연쇄 없이 34단계 연속 수학 연산을 성공함
- 비교 분석 — 기존 모델인 Sol은 8단계, Claude Opus는 12단계까지만 가능함
- 기술적 추측 — 재귀적 깊이(recurrent depth) 구조가 성능 향상의 원인으로 지목됨
- 추가 연구 — 잠재 공간 연산 능력에 대한 상세 결과와 분석이 공개됨
GPT-6 Astra가 일종의 순환 깊이(recurrent depth)를 쓴다는 소문을 듣고, LLM이 Chain-of-thought 없이 잠재 공간(latent space)에서 긴 추론 과정을 강제로 수행하게 만드는 벤치마크를 직접 만들어 봤다. Astra 결과가 진짜 미쳤는데, Chain-of-thought 없이 연속으로 34번의 간단한 수학 연산(작은 수로 더하기, 빼기, 곱하기, 나누기)을 해내더라! 비교하자면 Sol은 겨우 8번밖에 못 함.
다른 모델 24개(Anthropic 모델 포함)도 다 테스트해 봤는데 Astra 근처에도 못 왔다. 더 이상한 건 Astra 나오기 전까지 이 벤치마크에서 발전이 거의 없었다는 거임(두 번째로 잘한 게 Claude Opus 4.6으로 12단계였음).
전체 결과는 여기서 볼 수 있고, Astra 내부에서 무슨 일이 벌어지고 있길래 이런 결과가 나오는지에 대한 추측도 적어놨음:


