어떤 LLM이 펜테스팅에 제일 좋을까? 벤치마크로 알아보기
Which LLM is actually best at pentesting? benchmark to find out
핵심 요약
펜테스팅에 최적화된 LLM을 찾기 위해 작성자가 직접 구축한 벤치마크 프로젝트 공유.
- 펜테스팅 벤치마크 — 기존 도구의 한계를 극복하고자 실전 인프라 공격 기반의 벤치마크를 직접 구축함.
- 모델 성능 비교 — 다양한 LLM을 대상으로 펜테스팅 수행 능력을 테스트하여 실질적인 성능을 검증함.
- 검열 해제 모델 — 펜테스팅 효율을 높이기 위해 검열되지 않은 모델 사용에 대한 논의가 활발함.
- 도구 활용 방식 — LLM 단독보다는 적절한 하네스와 도구 연동이 펜테스팅 성공의 핵심이라는 의견이 제시됨.
hunterbench.com
원문 사이트로 이동
다들 안녕,
요즘 펜테스팅에 LLM이랑 AI 에이전트 쓰는 거 꽤 흔해진 거 알지? 근데 문제는 이런 작업에 어떤 모델이 진짜로 제일 적합한지 제대로 따져볼 방법이 마땅치 않다는 거야.
CyberGym이라고 괜찮은 베이스가 있긴 한데, 요즘 돌아가는 꼴이 영 마음에 안 들어. LLM 비교보다는 에이전트나 툴 홍보하는 데 더 혈안이 된 것 같고, 정작 펜테스팅에 쓸만한 최신 모델들은 다루지도 않거든. 게다가 거긴 실제 펜테스팅이 아니라 격리된 코드(OSS-Fuzz 버그)에서 알려진 취약점에 대한 익스플로잇이나 PoC 생성하는 거 위주로 돌아가잖아. 우리가 하는 건 진짜 펜테스트 중심이야. 알려진 버그 재현하는 게 아니라, 모델한테 실제 공격해야 할 라이브 인프라를 던져주는 거라고.
그래서 그냥 내가 직접 벤치마크를 하나 만들었어. 솔직히 처음엔 나 혼자 쓰려고 만든 거였거든. 어떤 모델이 진짜 실전에서 잘 먹히는지 궁금했으니까. 근데 너희들한테도 도움 될 것 같아서 링크 공유한다.
