Heretic 1.3 출시: 모델 재현성, 통합 벤치마크 시스템, VRAM 사용량 감소, 모델 지원 확대 등
Heretic 1.3 released: Reproducible models, integrated benchmarking system, reduced peak VRAM usage, broader model support, and more
핵심 요약
LLM 검열 제거 도구 Heretic 1.3 출시. 모델 재현성 확보, 벤치마크 시스템 내장, VRAM 최적화 등 대규모 업데이트 진행.
- 모델 재현성 — 모델 생성 과정을 기록하여 동일한 결과물을 완벽하게 재현할 수 있는 시스템 도입함.
- 벤치마크 통합 — 외부 도구 없이 Heretic 내에서 MMLU, GSM8K 등 주요 벤치마크를 즉시 실행 가능함.
- VRAM 최적화 — 텐서 연산 과정의 메모리 사용량을 대폭 줄여 더 큰 모델도 원활하게 처리 가능함.
- 모델 지원 확대 — 레이어 및 모듈 처리 로직 개선으로 Qwen3.5, Gemma 4 등 최신 모델 지원함.
동료 Llama 여러분, 언어 모델의 검열을 제거하는 최고의 소프트웨어인 Heretic(https://github.com/p-e-w/heretic)의 1.3 버전을 즉시 사용할 수 있게 되었음을 알려드리게 되어 매우 기쁩니다.
이번 릴리스 주기는 길고 다사다난했습니다. 그동안 Heretic은 2만 개의 GitHub 스타와 1,300만 건 이상의 총 모델 다운로드를 기록하며 세간의 주목을 받는 오픈 소스 프로젝트가 되었습니다(최근 Heretic의 표절 포크를 사용하다 적발된 특정 '경쟁사'의 모델은 제외한 수치입니다). 모델 검열 제거라는 주제는 폭발적인 인기를 끌게 되었고, 많은 클론과 포크가 등장했습니다. 그중 일부는 신비주의나 기술적 전문 용어, 혹은 LLM이 작성한 수만 줄의 쓰레기 코드로 자신들의 기술을 감추기도 했습니다.
저는 Heretic이 정반대의 방향으로 나아가고 있다고 자신 있게 말씀드립니다. 무슨 일이 일어나고 있는지 이해하기 어렵게 만드는 대신, 이번 새 릴리스는 더 쉽고 투명하게 만들었습니다. Heretic 1.3의 핵심 기능은 **재현 가능한 실행(reproducible runs)**입니다. 이는 텐서 연산 결과가 PyTorch 버전, GPU, 드라이버, 가속기 라이브러리, 그리고 토성의 위치에 따라 달라질 수 있기 때문에 언뜻 보기보다 훨씬 해결하기 어려운 문제였습니다. 즉, 재현성을 보장하려면 모든 정보를 수집하고 보존해야 한다는 뜻입니다. 이 거대한 작업은 오랜 기여자 Vinay-Umrethe가 맡았으며, 250개 이상의 댓글이 오가는 격렬한 몇 주간의 협업 끝에 코드 대부분을 작성했습니다.
그 결과, 이제 Hugging Face에 검열이 제거된 모델을 게시할 때 Heretic이 저장소에 reproduce 디렉토리를 생성하도록 선택할 수 있습니다. 여기에는 다른 사람이 직접 바이트 단위로 동일한 모델을 생성하는 데 필요한 모든 정보가 포함되어 있습니다(해당 디렉토리 예시). "내 컴퓨터에서는 왜 이렇게 낮은 수치가 나오는지 모르겠다"고 하던 시절은 지났습니다. 이제 여러분도 할 수 있습니다! 재현성 시스템은 그 자체로도 매우 유용하고 교육적이지만, 앞으로는 제가 곧 발표할 더 야심 차고 흥미로운 무언가의 중추가 될 것입니다. 재현성 정보 게시 여부는 전적으로 선택 사항이며, Heretic은 게시하기 전에 항상 사용자에게 확인을 요청합니다. 여러분은 언제나 업로드되는 내용을 제어할 수 있습니다.
더 있습니다! 검열이 제거된 모델이 성능에 상당한 손상을 입었는지 확실히 알기 어렵다는 점을 잘 아실 겁니다. Heretic은 이제 세계에서 가장 간단한 벤치마크 시스템을 포함하고 있어, 설정을 만지거나 모델을 먼저 내보낼 필요 없이 Heretic 내에서 직접 MMLU, EQ-Bench, GSM8K, HellaSwag와 같은 표준 벤치마크를 실행할 수 있습니다. 이를 통해 모델을 게시할 가치가 있는지, 아니면 다른 트라이얼을 살펴봐야 할지 훨씬 쉽게 결정할 수 있습니다. 이 시스템은 LLM 벤치마크 실행을 위한 학계의 표준인 lm-evaluation-harness를 기반으로 하여, 결과 지표를 온라인에 게시된 수치와 직접 비교할 수 있습니다.
일반적인 실행 과정에서 Heretic은 텐서에 대한 다양한 함수를 계산합니다. 이 과정에서 GPU 메모리에 중간 텐서가 나타나 많은 양의 VRAM을 차지할 수 있습니다. magiccodingman이 이를 자세히 분석하여 피크 VRAM 사용량을 대폭 줄이는 최적화를 구현했으며, 덕분에 더 큰 모델도 처리할 수 있게 되었습니다.
모델 아키텍처는 계속 진화하고 복잡해지고 있으며, Heretic도 발맞춰 나가고 있습니다! farolone과 MoonRide303은 Heretic의 레이어 및 모듈 처리 로직을 개선하여 훨씬 더 범용적으로 만들었고, Qwen3.5 및 Gemma 4와 같은 최신 세대 모델 등을 처리할 수 있게 되었습니다.

