Caveman 기법과 'be brief' 프롬프트를 비교 벤치마크해봄
I benchmarked caveman against the prompt "be brief"
핵심 요약
Caveman 기법과 단순한 'be brief' 프롬프트를 비교한 결과, 토큰 효율과 품질 면에서 성능 차이가 거의 없다는 사실을 밝혀냄.
- 벤치마크 결과 — Caveman 기법과 'be brief' 프롬프트의 토큰 효율 및 품질이 거의 동일함.
- 프롬프트 최적화 — 복잡한 기법보다 단순한 지시어가 의외로 강력한 성능을 발휘함.
- 구조적 차이 — Caveman은 출력 구조 유지나 안전 장치 측면에서는 여전히 유효함.
- 오픈소스 도구 — 작성자가 벤치마크에 사용한 도구를 깃허브에 공개함.
Caveman이 정말 인기를 끌고 있어서, 단순하게 'be brief'라고 상기시키는 것보다 실제로 더 나은 성능을 내는지 궁금해졌습니다.
6개 카테고리에서 24개의 개발 프롬프트를 실행했고, 5가지 방식(기본값, 'be brief.', Caveman lite/full/ultra)을 비교했습니다. 각 프롬프트별 루브릭에 따라 별도의 Claude가 평가했습니다.
점수:
|Arm|mean score|mean tokens|
|:-|:-|:-|
|baseline|0.985|636|
|**be brief.**|0.985|419|
|caveman lite|0.976|401|
|caveman full|0.975|404|
|caveman ultra|0.970|449|
놀랍게도 두 단어만으로도 토큰과 품질 면에서 Caveman과 대등했습니다. Caveman은 일관된 출력 구조, 모드 전환, 그리고 파괴적인 작업에 대한 안전 장치 측면에서는 여전히 제 역할을 하지만, 압축 자체는 내가 기대했던 차별화 요소가 아니었습니다. 안전 장치는 실제로 출력에서 많은 변동성을 야기했습니다.
카테고리별 데이터와 안전 질문에 대한 변동성 조사 결과가 포함된 전체 분석은 여기에서 확인하세요: https://www.maxtaylor.me/articles/i-benchmarked-caveman-against-two-words

관심 있으시다면 벤치마크 도구는 오픈 소스로 공개되어 있습니다: https://github.com/max-taylor/cc-compression-bench

