103B 토큰 규모의 Usenet 말뭉치(1980~2013)를 구축했습니다 — 웹 이전, 순수 인간 작성, AI 오염 제로. r/ML에서 반응이 좋아 이 커뮤니티에도 도움이 될 것 같아 공유합니다.
I built a 103B-token Usenet corpus (1980–2013) — pre-web, human-only, zero AI contamination. Got strong traction on r/ML, thought this community would find it useful.
핵심 요약
AI 오염이 전혀 없는 1980~2013년 Usenet 데이터를 구축하여 로컬 모델 파인튜닝을 위한 고품질의 인간 언어 말뭉치를 제공합니다.
- AI 오염 방지 — LLM 이전의 순수 인간 작성 데이터로 GPT 특유의 말투나 RLHF 잔재가 없음
- 방대한 데이터셋 — 18,347개 뉴스그룹에서 추출한 103.1B 토큰 및 4억 8백만 개의 게시물
- 도메인별 분류 — 컴퓨터, 과학, 취미, 인문학 등 분야별로 세분화된 데이터 구조 제공
- 상업적 활용 가능 — 연구 및 취미용 샘플은 무료이며 상업적 AI 학습을 위한 라이선스 옵션 제공
r/MachineLearning에 몇 주 전에 올렸는데(조회수 3만, 추천 100개 이상), 파인튜닝 관점에서 더 직접적으로 관련이 있는 이곳에 공유하고 싶었습니다.
저는 1980년부터 2013년까지의 완전한 Usenet 말뭉치를 구축하고 처리하는 데 수년을 보냈습니다. 이 데이터가 특히 로컬 모델 작업에 중요한 이유는 다음과 같습니다:
AI 오염이 전혀 없습니다. 모든 게시물은 LLM보다 수십 년 앞선 것입니다. 이걸로 학습해도 GPT의 말투나 거부 패턴, RLHF 잔재가 남지 않습니다. 33년 동안 논쟁적이고, 필터링 되지 않았으며, 문체적으로 다양한 순수 인간의 글입니다.
SEO 이전, 알고리즘 이전의 인터넷입니다. 사람들은 참여를 최적화하려 하지 않고 더 길고 실질적인 내용을 썼습니다. 글의 성격이 현대 웹에서 긁어온 그 어떤 것과도 확연히 다릅니다.
도메인 파인튜닝을 위한 좋은 계층 구조:
• comp.* — 인터넷을 실제로 구축하던 사람들이 나눈 103억 토큰의 컴퓨팅 토론
• sci.* — 33억 토큰의 과학적 의견 교환
• rec.* — 165억 토큰의 취미, 스포츠, 예술, 게임 관련 내용
• humanities.* — 철학, 문학, 고전 텍스트
수치:
• 1031억 토큰 (cl100k_base)
• 18,347개 뉴스그룹에 걸친 4억 8백만 개의 게시물
• 1980~2013년, 96.6% 영어
처리 과정: 중복 제거, alt.binaries.* 제외, 바이너리 제거, 이메일 주소 비식별화, MBOX → gzip JSONL 변환.
커뮤니티의 누군가가 이미 샘플 데이터로 Gemma 4를 파인튜닝했습니다(HF의 wyan/usenet-gemma-4-E2B-lora) — 초기 단계이긴 하지만 개념 증명으로 작동합니다.
샘플(계층별 5천 개 게시물 + 통합 세트)은 승인 없이 무료로 다운로드할 수 있습니다. 전체 말뭉치는 라이선스 계약을 통해 이용 가능합니다.
링크는 첫 번째 댓글에 있습니다.

