OpenMythos 벤치마크 결과
OpenMythos benchmarks
핵심 요약
사이버 보안 특화 모델 OpenMythos의 벤치마크 결과가 공개되었으며, 추가 학습을 통해 성능을 개선할 예정입니다.
- 벤치마크 결과 — SWE-bench Pro, CyberGym, cybench에서 준수한 성능을 보여줌
- 모델 개선 계획 — 현재 성능에 만족하지 않고 추가 학습을 진행할 예정임
- 데이터셋 공개 — 모델뿐만 아니라 학습에 사용된 데이터셋도 오픈소스로 공개됨
- 커뮤니티 반응 — 성능 향상에 대한 기대와 함께 차트 가독성에 대한 지적이 나옴
여러분 안녕하세요! 드디어 OpenMythos 벤치마크 결과를 공개합니다. 올리는 데 일주일 정도 걸려서 죄송합니다.
지연된 주된 이유는 SWE-bench 결과가 Qwen 3.6 27B 공식 수치와 일치하지 않았기 때문입니다. 알고 보니 Qwen은 다른 평가 하네스를 사용했고 벤치마크 문제들을 정제/필터링했더군요. 심지어 이전 3.5 버전(SWE Verified에서 72.4)의 벤치마크 점수조차 3.6 버전(SWE Verified에서 75)에 게시된 수치와 일치하지 않았습니다.
어쨌든, SWE-bench Pro, CyberGym, cybench에 걸친 결과는 다음과 같습니다.
OpenMythos는 소규모 사이버 보안 특화 모델치고는 꽤 괜찮은 성능을 보여줍니다! 하지만 더 잘할 수 있는 잠재력이 있으니, 앞으로 추가 학습을 진행할 예정입니다.
또한 u/giveen 님께 큰 감사를 드립니다.
GGUF 버전: https://huggingface.co/jabbatheduck/OpenMythos-GGUF
데모: https://huggingface.co/spaces/build-small-hackathon/OpenMythos


