Qwen 3.8 - 27B는 게임 체인저다
Qwen 3.8 - 27B is a game changer
핵심 요약
사이버 보안 전문가가 Qwen 3.8 27B 모델의 뛰어난 악성코드 분석 및 자동화 성능에 경악하며 보안 분야의 판도가 바뀔 것이라 평가함.
- 성능 혁신 — 로컬 모델이 기존의 클라우드 기반 모델을 능가하는 악성코드 분석 능력을 보여줌.
- 보안 위협 — 자동화된 취약점 탐지 및 공격 도구 활용으로 인해 사이버 보안 환경이 급격히 변화함.
- 로컬 환경 — API 호출 없이 로컬에서 강력한 분석 도구와 연동하여 보안 작업을 수행할 수 있음.
- 기술적 충격 — 과거 국가급 해킹 팀이 수행하던 복잡한 분석을 개인이 로컬 모델로 가능하게 함.
배경 설명을 좀 하자면, 난 사이버 보안 시니어 애널리스트야.
LLM을 이 분야에 써먹는 거, 특히 MCP(Model Context Protocol)를 연결해서 툴을 돌리거나 스크립트를 짜는 쪽에 관심이 많아.
십 대 때 게임 해킹하려고 어셈블리어 읽으면서 이 바닥에 발을 들였고, 그러다 악성코드 분석으로 넘어갔지. 지금은 먹고살려고 회사에서 트래픽이랑 로그 분석하는 일을 해.
취업 전에는 CTF(Capture The Flag)라고 하는 사이버 보안 대회에 나갔는데, 딱 한 분야만 팠어. 바로 악성코드 분석이지.
자, 그럼 LLM이랑 사이버 보안이 만난 현재 상황을 좀 읊어볼게.
입문용 CTF 문제들(내가 2017~2018년쯤 풀던 것들, 2019년에 첫 취업함)은 이미 오래전에 LLM한테 다 따였어. (intercode CTF 벤치마크 참고해봐)
그다음 고난도 CTF(NYU CTF Bench, CSAW 문제들, CyBench)도 이미 예전에 다 뚫렸고.
요즘은 어떤 상황이냐면:
CyberGym (취약점 설명(CVE 리포트 수준, 상세 정보는 없음)이랑 코드 베이스 주고 취약점 찾아내기)
이것도 이미 정복됐어.
그다음 ExploitGym (최근에 OpenAI 모델이 탈옥해서 Hugging Face 해킹하고 답 찾아낸 그거. 사실 그 취약점 2개는 별거 아니야. Jfrog 샌드박스에 서버 측 검증 없는 JWT 스푸핑이랑, Hugging Face 오픈소스 데이터 뷰어의 JS + Python 템플릿 문제였거든)
그래도 모델이 완전히 자율적으로 해냈다는 건 확실히 인상적이지.
ExploitGym은 취약점 상세 정보랑 익스플로잇 기법/상세 정보, 그리고 코드 베이스를 던져줘. (근데 애초에 OpenAI 모델이 어떻게, 왜 탈옥을 했는지 의문이야. 그런 상세 정보들이면 충분히 해결 가능했을 텐데. 그래서 난 이게 다 짜고 치는 고스톱 같다는 생각이 들지만, 뭐 어쩌겠어.)
ExploitBench
이건 좀 더 현실적인 위협 벡터야.
0-day가 아니라 1-day거든. (0-day는 아무도 모르는 새로운 취약점이라 0-day고, 1-day는 이미 알려져서 패치까지 나온 취약점이야. 오픈소스 프로젝트라면 패치 전후를 비교해서 알아낼 수 있지. 0-day만큼 가치는 없지만, 사람들이 소프트웨어 업데이트를 안 하거나 못 하면 여전히 위험해. 0-day는 제3세계 국가들에서 감시용으로 쓰이기도 하지만(다른 나라들도 그럴걸?!), 1-day는 보통 그렇게까지 쓰긴 힘들지. 그래도 여전히 위협적이야.)
암튼 ExploitBench는 V8 엔진(크롬, 일렉트론, VS Code 등 거의 모든 곳에 쓰이는 거!!)의 1-day 취약점들을 다뤄.
모델한테 패치 diff랑 코드 베이스만 던져주는 식이지.
모델들이 ExploitBench랑 ExploitGym에서 날뛰고 있긴 한데, 아직 정점까지 찍은 건 아니야. 그래도 최근 프론티어 모델들은 예전의 '거의 0에 가까운 성능'에서 벗어나서 엄청나게 발전했어.
이거 진짜 위험한 신호야.
능력 없는 사람들이나 수준 낮은 LLM이 짠 소프트웨어라면 뭐든 다 털어버릴 수 있는 모델이 나온다고 상상해봐. (복잡한 취약점까지 다 찾아내면서!)
그뿐만이 아니야. DEF CON 같은 세계 최고 수준의 CTF도 있지.
OpenSage 하네스(Google ADK나 Anthropic ADK 같은 건데, 이건 모델한테 자기만의 에이전트를 설계하라고 시켜! 서브 태스크를 효과적으로 수행하기 위해 적절하다고 판단되는 툴이나 샌드박스 환경을 직접 고르게 하는 거지. 심지어 자기만의 MCP를 직접 설계할 수도 있어! 모델들이 아직 이걸 100% 활용하진 못하지만, 몇몇 모델은 이걸 써서 성능을 39%에서 60%까지 끌어올렸어. 같은 모델인데도 말이야!)
- 이제 내가 직접 돌려본 벤치마크는 간단해.
내 커리어 동안 공부하면서 개인적으로 의미 있다고 생각하는 악성코드 샘플 몇 개.
그리고 SIEM 분석 문제 하나 (공격이랑 정상적인 행동이 섞여 있는 로그).
여러 모델(Qwen3.6, 엄청나게 다이어트한 Minimax 2.5 등)을 내 Strix halo에서 테스트해보고 당시 Opus랑 비교해봤어. (그때 Opus는 4.5였는데, 꽤 굵직한 건 풀었지만 악성코드를 분해해서 2단계 분석을 수행하는 코드는 짜지 못하더라고.)


