학습된 적 없음에도 불구하고, 모델의 AA Intelligence Index 점수와 Base64 인코딩 응답 생성 능력 간의 피어슨 상관계수가 0.91이라는 사실이 밝혀짐
Despite not being trained to, it turns out the Pearson correlation between a models AA Intelligence Index score and its ability to generate Base64 encoded responses is 0.91
핵심 요약
모델의 Base64 인코딩 능력이 지능 지표와 높은 상관관계를 보인다는 흥미로운 벤치마크 결과가 공유되었습니다.
- Encode Bench — 모델의 Base64 인코딩 능력을 측정하는 새로운 오픈 벤치마크임
- 높은 상관관계 — AA Intelligence Index와 0.91, Agentic Index와 0.94의 상관계수를 보임
- 측정 원리 — 다단계 추론, 인코딩 정확도, 출력 제약 준수 능력을 종합적으로 평가함
- 추가 연구 필요 — 토큰화 문제인지 실제 지능의 척도인지 확인하기 위해 일반 텍스트 및 16진수 대조군 실험이 필요함
Encode Bench를 만들었다. 모델한테 문제를 풀게 하고 그 답을 Base64 페이로드로 내놓으라고 시키는 오픈 벤치마크다.
초기 결과 보고 좀 놀랐다. 현재 9개 모델 스냅샷 중에서 데이터가 겹치는 8개 모델을 돌려봤더니, Encode Bench 통과율이랑 Artificial Analysis Intelligence Index 간의 피어슨 상관계수가 0.91이나 나왔다. Agentic Index랑은 0.94까지 찍히더라.
수치만 보면 엄청나 보이지만, 당연히 주의할 점이 있다. 이건 표본이 작고 완벽하지 않은 관찰 데이터일 뿐이다. Base64가 지능을 측정한다는 증거도 아니고, 인과관계를 입증하는 것도 아니다. SimpleBench가 좋은 반례인데, Encode Bench랑 상관계수가 0.23밖에 안 된다. 물론 이건 겹치는 모델이 4개뿐이라 비교하기엔 좀 애매하지만.
이 아이디어는 내가 계속 봐왔던 비대칭성에서 시작됐다. 모델들이 프롬프트에 있는 Base64는 곧잘 해석하는데, 정작 요구한 결과물을 정확하게 디코딩되는 Base64로 뽑아내는 건 쩔쩔매는 경우가 많더라고. 최종 페이로드를 생성하려면 모델이 다음 과정을 다 거쳐야 하거든.
- 기본 문제를 풀고;
- 답을 정확하게 유지하고;
- 제대로 인코딩하고;
- 엄청 까다로운 출력 규칙을 지켜야 함.
중간에 하나라도 삐끗하면 결과물이 박살 나니까, 이게 다단계 신뢰성을 테스트하는 거친 척도가 될 수도 있겠다. 아니면 토크나이저 동작 방식이나 학습 데이터, 후학습, 추론 한계, 아니면 제공업체의 라우팅 문제일 수도 있고. 지금 벤치마크로는 뭐가 원인인지 딱 잘라 말하긴 어렵다.
평가 항목은 인코딩 정확도, 지시 이행, 산수, 논리, 코드 추론, 구조화된 데이터 등 총 24개의 결정론적 태스크로 구성했다. 각 태스크를 3번씩 돌려서 모델당 총 72번의 채점을 진행했다. 누락된 시도, 제공업체 오류, 잘못된 Base64, 출력 제한 초과, Base64는 맞는데 답이 틀린 경우 전부 다 실패로 처리했다. Base64로 인코딩된 PNG 프롬프트도 포함하긴 했는데, 이건 그냥 주관적인 예시일 뿐이고 점수에는 안 넣었다.
현재 결과는 이렇다:
- GPT-5.6 Sol — 70/72 (97.2%)
- Kimi K3 — 63/72 (87.5%)
- Claude Sonnet 5 — 49/72 (68.1%)
- Gemini 3.5 Flash — 46/72 (63.9%)


