JetBrains가 Caveman의 65% 효율 주장을 반박했습니다. 그들이 옳았기에, Caveman을 완전히 새로 만들었습니다.
JetBrains called bullshit on Caveman's 65%. They were right, so I rebuilt Caveman from the ground up.
핵심 요약
JetBrains의 벤치마크 지적을 수용하여 토큰 효율을 개선하고 기능을 재설계한 Caveman 업데이트 버전입니다.
- 벤치마크 수용 — 기존 65% 효율 주장이 과장임을 인정하고 8.5% 측정치를 바탕으로 재설계함
- 입력 압축 기술 — 로컬 프록시를 통해 원본 손실 없이 입력 토큰을 33.2% 절감함
- 이미지 로딩 방식 — 설치된 스킬을 이미지로 자동 변환하여 토큰 비용을 70% 추가 절감함
- 오픈 소스 공개 — 벤치마크 검증 및 성능 개선을 위해 커뮤니티 피드백을 수렴함
몇 주 전, JetBrains에서 내가 만든 멍청하고 작은 Claude 스킬인 Caveman을 독자적으로 벤치마크했더라. 코딩 에이전트들이 입 좀 닥치게 만들고, 학생 신분인 내 AI 비용 좀 아껴보려고 만든 거였지.
난 채팅할 때 출력 토큰을 65% 정도 줄였다고 떠들고 다녔거든. 근데 사람들이 Caveman을 주로 돌리는 장기 코딩 작업에서는 JetBrains가 8.5%라고 측정했더라고.
뼈 맞았다. 나도 진작 이런 테스트를 해봤어야 했는데.
근데 걔네가 품질 저하는 없다고 확인해 줬으니, 그 원시인 같은 출력 스타일이 작업 성능을 깎아먹진 않는다는 거지. 대신 걔네 벤치마크 덕분에 더 큰 낭비 요소를 발견했어. Claude의 답변은 코딩 세션 전체 맥락에서 아주 일부일 뿐이거든. 파일, 로그, 도구 출력, 브라우저, MCP 응답, 그리고 예전 컨텍스트까지 전부 모델에 계속 처넣고 있었던 거야.
그래서 Caveman을 그 부분에 맞춰서 싹 갈아엎었어.
이제 이건 Claude Code, Codex, 그리고 다른 코딩 에이전트 밑에서 로컬 프록시로 돌아가. 각 제공업체에 호출을 보내기 전에 입력을 압축하는데, 원본 내용은 바이트 단위로 완벽하게 복구할 수 있게 만들었지.
54번 돌려서 벤치마크를 고정해 봤는데, 제공업체 기준 입력 토큰이 33.2% 줄었고, 정답 확인 18개도 전부 통과했어.
그리고 Caveman을 쓸 때 발생하는 초기 토큰 비용 문제도 해결했어. 이제 설치된 모든 스킬을 Caveman을 통해 이미지로 자동 로드하면, 정확도는 99% 유지하면서 토큰은 70% 덜 먹게 만들 수 있어.
명령어는 caveman claude야. 기존에 쓰던 Claude Code 설정은 그대로 두면 돼.
독립적인 벤치마크한테 공개적으로 털린 게 오히려 약이 됐네. 근거 없는 자신감은 박살 났지만, 덕분에 훨씬 더 나은 제품을 만들 수 있게 됐거든.
Caveman은 오픈 소스야. 벤치마크를 박살 내거나 이 방식이 어디서 무너지는지 찾아내면 꼭 알려줘.
오늘 이 버전 출시했어: https://www.producthunt.com/products/caveman
