Pangram 데이터셋으로 파인튜닝한 Qwen 0.8b 기반 AI 콘텐츠 탐지기
AI content detector based on Qwen 0.8b fine-tuned on Pangram dataset
핵심 요약
Pangram의 EditLens 데이터셋을 활용해 로컬에서 가볍게 구동되는 AI 글 탐지기 'Slop Hammer'를 개발함.
- 로컬 구동 모델 — M1 맥북에서 1초 이내로 작동하는 경량 Qwen 0.8B 모델임.
- 크롬 확장 프로그램 — 웹 브라우저에서 텍스트를 선택해 AI 생성 확률을 즉시 확인 가능함.
- 데이터셋 제약 — Pangram의 EditLens 데이터셋 라이선스에 따라 CC-BY-NC-SA-4.0을 따름.
- 탐지 성능 한계 — 최신 모델인 GPT-5.5 등에서는 오탐지가 발생할 수 있는 초기 단계임.
Pangram이 EditLens 논문과 함께 제공한 데이터셋으로 Qwen 3.5 0.8B 모델을 파인튜닝했습니다. 크롬 확장 프로그램을 통해 사용할 수 있으며, 텍스트를 선택하면 AI 생성 확률 분포를 즉시 확인할 수 있습니다. 제 M1 MacBook Pro에서 1초 이내로 작동합니다.
Pangram에서 자체 데이터셋으로 학습시킨 Llama 3.2 3B 모델을 공개했지만, 제 기준에서는 성능 대비 너무 무거웠습니다. Qwen 0.8B(base) 모델을 RTX 3090 한 대에서 약 20시간 동안 파인튜닝한 결과, 그만큼 좋은 성능을 보여주었습니다. Qwen 2B, Gemma 4 e2b, e4b 모델도 시도해 보았지만, 현재 릴리즈한 체크포인트에서는 Qwen 3.5 0.8B가 가장 좋은 결과를 냈습니다.
크롬 확장 프로그램 링크입니다(이름은 Slop Hammer로 지었습니다 😅). 설치 후 Hugging Face에서 모델(약 400MB)을 다운로드하면 모든 과정이 로컬에서 실행됩니다: https://chromewebstore.google.com/detail/slop-hammer/gfjdmhfokmhedlgfggmmgchpppmhkdgg
ONNX 형식의 모델 파일은 여기서 확인 가능합니다: https://huggingface.co/Slomin/slop_hammer_0_8_b/tree/main. 참고로, Pangram의 EditLens 데이터셋 제한으로 인해 모델 라이선스는 CC-BY-NC-SA-4.0을 따릅니다.
Pangram에서 작성한 논문은 여기에서 볼 수 있습니다: https://arxiv.org/abs/2510.03154 - 0-1 사이의 float 뉴런 하나 대신 4개의 분포 버킷을 사용하는 방식이 꽤 흥미롭습니다. 한계점은 오픈소스로 공개된 데이터셋 자체가 구형 LLM 모델들로 생성되었다는 점입니다. 예를 들어 GPT-5.5에서는 다소 혼란을 겪기도 합니다(그래도 완전히 사람이 쓴 글이 아닌 AI가 편집한 글 등으로 표시되긴 합니다). 링크드인이나 특정 서브레딧처럼 AI 글이 넘쳐나는 곳들을 확인해보면 꽤 재밌습니다.


