Hugging Face, 역대 최대 규모의 오픈 코드 데이터셋 'The Stack v3' 출시
Hugging Face releases The Stack v3 – largest open code dataset yet
핵심 요약
Hugging Face가 114TB 규모의 역대 최대 오픈 코드 데이터셋인 The Stack v3를 공개했습니다.
- 역대 최대 규모 — 114TB에 달하는 방대한 오픈 소스 코드 코퍼스를 포함함.
- 두 가지 버전 — 정제된 훈련용 데이터셋과 전체 원본 데이터를 모두 제공함.
- 데이터 품질 논의 — 사용자들은 자신의 저질 코드가 모델 성능을 떨어뜨릴까 봐 농담 섞인 우려를 표함.
- 개인정보 및 옵트아웃 — PII 제거가 포함되었으며 사용자는 자신의 코드를 제외할 수 있는 옵션이 있음.
Anton Lozhkov의 𝕏 게시물: https://x.com/anton_lozhkov/status/2080254608639701222
접근 방법 두 가지:
stack-v3-train - 중복 제거, 품질 필터링, 개인정보(PII) 비식별화 완료, 콘텐츠 인라인 포함. load_dataset으로 바로 사용 가능.
https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train
stack-v3-full - 114 TB 전체 코퍼스를 HF Storage Bucket으로 제공: 클러스터 ID와 함께 모든 중복본 유지, 제외된 파일은 스텁(stub) 처리. 직접 중복 제거, 필터링, 믹싱 가능.
https://huggingface.co/buckets/HuggingFaceCode/stack-v3-full


