HuggingFace에 사이버 보안 특화 Mythos 스타일 LLM 오픈 웨이트를 공개했습니다
We trained a cybersecurity-focused Mythos like LLM open weights on HuggingFace
핵심 요약
사이버 보안 작업에 특화된 오픈 소스 LLM 'OpenMythos'를 개발하고 학습 방법론을 공유함.
- 사이버 보안 특화 — 취약점 식별 및 코드 리뷰에 최적화된 모델 개발함.
- 학습 파이프라인 — SFT 이후 GitHub 브랜치 기반의 RLVR로 검증 능력 강화함.
- 데이터셋 공개 — ArXiv 논문 및 CVE 데이터를 활용한 고품질 데이터셋 제공함.
- 모델 성능 개선 — RLVR 도입으로 취약점 분류 정확도 및 불확실성 보정 향상됨.
Build Small 해커톤을 위해 사이버 보안 작업에 특화된 오픈소스 LLM인 OpenMythos를 만들었음. RLVR 설정이 꽤 까다로웠고, 비슷한 도메인 특화 파인튜닝 하는 사람들한테 도움 될 것 같아서 우리 학습 방식을 공유하려고 함.
문제점 범용 LLM들은 보안 쪽에서 생각보다 진짜 개판임. CVE 세부 정보를 환각으로 지어내거나, 코드에서 실제 취약점 패턴을 놓치고, 틀린 소리를 하면서도 엄청 자신만만하게 말함. 우리는 보안 도메인에 깊이가 확실하게 박혀 있는 모델이 필요했음.
데이터
- ArXiv cs.CR 논문 1만 개 긁어옴 → 코드 취약점에 집중된 고품질 데이터 약 1.84K개로 필터링
- 실제 영향을 받은 코드와 수정 맥락이 포함된 구조화된 CVE 데이터셋
- 둘 다 허깅페이스에 공개함 (링크는 글 하단 참조)
학습 파이프라인
1단계 - SFT 사이버 보안 작업에 대한 표준 지도 미세 조정(SFT): 취약점 식별, CVE 설명, 보안 이슈 코드 리뷰, 완화 전략 등.
2단계 - RLVR 여기가 핵심임. SFT는 모델한테 좋은 답변을 흉내 내도록 가르치긴 하는데, 지가 뱉은 답변을 스스로 검증하게 하지는 못함. 보안 분야에서 이 차이는 존나 위험함.
우리는 취약한 브랜치와 수정된 브랜치가 짝을 이루는 GitHub 저장소들을 활용해서 보상 체계를 구축했음. 검증 모델이 생성된 답변을 정답 데이터와 비교해서 "제대로 된 취약점을 찾았나?", "수정 코드가 진짜 맞는가?"를 확인하고, 거기서 보상 신호를 주는 방식임.
RLVR 거치고 나니까 모델이 확실히 더 정교해짐. 비슷한 취약점 클래스끼리 헷갈리는 것도 줄었고, 불확실성에 대한 보정도 훨씬 나아짐.
링크
- 🤖 데모: https://huggingface.co/spaces/build-small-hackathon/OpenMythos
- 🧠 모델: https://huggingface.co/build-small-hackathon/OpenMythos
- 📦 CVE 데이터셋: https://huggingface.co/datasets/build-small-hackathon/CVE_Vulnerailities_Detailed
- 📄 ArXiv 필터링 데이터: https://huggingface.co/datasets/himanshu17HF/ArvixImport-Filtered-Final
RLVR 설정이나 필터링 파이프라인에 대해 궁금한 거 있으면 자세히 알려줄 수 있음. 모델이 어디서 부족한지 피드백도 환영함.


