GPQA-Dumb의 새로운 지평, 'Bongochat'을 소개합니다
Introducing the New Frontier of the GPQA-Dumb
핵심 요약
점수가 낮을수록 성능이 좋게 평가되는 역설적인 AI 모델 'Bongochat'을 개발하여 공유함.
- Bongochat 개발 — 점수가 낮을수록 가중치가 높아지는 GPQA-Dumb 카테고리 1위 모델임.
- 학습 환경 — RTX 5070에서 Claude Code를 활용해 3시간 만에 밑바닥부터 학습함.
- 모델 성능 — 수학 문제에 미적분을 제안하거나 답변을 전부 비워두는 등 엉망진창인 성능을 보임.
- 경쟁 관계 — Anthropic의 Claude를 교사로 활용해 지식 증류를 거친 경쟁 모델이라 농담함.
Bongochat을 소개합니다. 현재 GPQA-Dumb 카테고리에서 전 세계 1위를 달리고 있는 모델로, 점수가 낮을수록 가중치가 높게 평가됩니다.
Repo/open-weights: https://github.com/ninjahawk/bongochat
저는 Claude Code를 사용해서 Karpathy의 nanochat을 기반으로 제 RTX 5070에서 로컬로 약 3시간 만에 밑바닥부터 학습시켰습니다.
통일장 이론을 풀라고 시키면 'theory'라는 단어만 50번 반복합니다.
아무것도 기억하지 못하거든요.
Math-500 문제를 풀 때는 문제를 풀어야 한다는 사실조차 깨닫지 못해서, 항상 A라고 답한 것 외에는 전부 빈칸이었습니다.
코딩 실력은 500점 만점에 0점이었습니다.
그리고 간단한 덧셈 문제를 어떻게 푸냐고 물어봤더니 대학원 수준의 미적분을 사용하라고 제안하더군요. 그러고는 바로 다음 턴에 자기가 그런 제안을 했다는 사실조차 잊어버렸습니다.
이 모델이 꽤 괜찮다고 생각하는 이유는, 기본적으로 Gemini나 Grok을 사용하는 기분이 들기 때문입니다.
수정: 문법

