직접 만든 사이버 보안 벤치마크로 Qwen3.8 27B를 테스트해 봄, 로컬 모델의 실제 해킹 능력은?
I made my own cybersecurity benchmark and ran Qwen3.8 27B, here's how a local model actually does at hacking
핵심 요약
직접 구축한 사이버 보안 벤치마크를 통해 로컬 모델 Qwen3.8 27B와 API 모델들의 해킹 성능을 비교 분석함.
- 사이버 보안 벤치마크 — 19개 작업과 544번의 시도로 구성된 해킹 성능 측정 도구 구축함.
- 로컬 모델 성능 — Qwen3.8 27B는 첫 시도에서 28.1%의 성공률을 보였으나 Pwn 작업은 해결하지 못함.
- API 모델 우위 — MiMo 2.6 Flash와 GPT-6 Luna 등은 70~90% 이상의 높은 해결률을 기록함.
- 모델 최적화 논의 — 커뮤니티는 VRAM 부족 문제를 해결하기 위한 MoE 모델 운용 및 양자화 팁을 공유함.
안녕 로컬 AI 커뮤니티 형들, 이거 꽤 오랫동안 작업해왔는데 이제야 좀 공유해도 되겠다 싶어서 올린다.
이건 모델한테 격리된 도커 박스 안에서 셸 권한 주고 정확한 플래그 찾아내게 만드는 사이버 벤치마크야. Pwn, 웹, 암호학, 리버싱, 포렌식, 실제 CVE 몇 개랑 다단계 문제들까지 섞여 있어. 총 19개 태스크고, 모델 6개 돌려서 544번 시도한 결과야.
분명히 말하는데, 내가 모든 문제를 직접 만든 건 아님. GLM 5.3이 문제 몇 개 만드는 거 도와줬어. 오픈 모델치고 사이버 보안 능력이 진짜 높고, 거절도 거의 안 해서 이 용도로는 최고였거든. 참고로 GLM 5.3은 이번 벤치마크 대상 모델은 아님.
로컬 환경은 이래: Proxmox 노드 2개에 3090이랑 3080 꽂고 2.5G 직결로 연결해서 llama.cpp RPC 풀로 Qwen3.8 27B (Unsloth Q4_K_XL, xhigh) 돌렸어. 덕분에 에이전트 여러 개 동시에 돌릴 만큼 tps가 충분히 나오더라. 낮은 추론(low reasoning)으로도 돌려봤는데, 하네스 문제 때문에 20시간 넘게 걸리길래 그냥 껐음.

순정 Qwen3.8 27B는 첫 시도에 28.1% 나왔고, Pwn은 0%였어. 게이밍 그래픽카드 두 장으로 돌린 27B 모델치고는 나쁘지 않지만, 혼자서 뭘 위협할 수준은 아니라는 거지.
근데 저렴한 API 모델들은 얘기가 좀 달라:
- MiMo 2.6 Flash: 첫 시도에 73.7% 해결
- GPT-6 Luna: 3번 시도 안에 90.9% 해결
- 여러 단계를 거쳐야 하는 다단계 문제에서는 상위 모델들이 92-96%까지 찍음
Pwn은 여전히 다들 어려워하더라(최고 기록이 56%). 82번 시도했는데도 아직 아무 모델도 못 푼 문제가 3개나 됨.
하네스 (MIT): https://github.com/lbgos/rangebench-harness
문제들은 학습 데이터에 유출되지 않게 비공개로 해뒀는데, 직접 돌려볼 수는 있어. 여기나 X(lbgosna)로 DM 주면 보내줄게. 형들 하드웨어나 토큰 써서 돌려보고 결과 알려주면 보드에 추가해줌. 로컬에서 돌린 결과 좀 모이면 로컬 전용 테이블도 따로 만들 생각이야.
이런 거 처음 만들어봐서 방법론이나 문제 구성, 혹은 빠진 부분 있으면 피드백 좀 부탁해.

