[대규모 데이터셋 공개] - SupraLabs/reasoning-corpus-4K-5M-v1 - 소형 SLM을 똑똑하게 훈련시키세요!
[BIG DATASET RELEASE] - SupraLabs/reasoning-corpus-4K-5M-v1 - Train your tiny SLMs to think!
핵심 요약
소형 모델 파인튜닝을 위한 500만 개의 추론 데이터셋이 공개되었습니다.
- 데이터셋 구성 — 500만 개의 추론 데이터가 포함됨
- 최적화된 길이 — 5k 토큰 이내로 소형 모델 학습에 적합함
- 데이터 품질 — 중복 제거 및 수동 검수를 거쳐 정제됨
- 활용 가능성 — 다양한 소형 모델의 추론 능력 향상에 기여함
안녕하세요 r/LocalLLaMA 여러분!
저희가 돌아왔습니다. 오늘 정말 놀라운 것을 준비했습니다.
저희의 대규모 5M 샘플 추론 코퍼스 데이터셋입니다.
이 데이터셋은 500만 행의 다음 데이터들을 포함합니다:
- repo_id --> 출처
- tok_len --> 총 토큰 길이
- user --> 사용자 프롬프트
- thought_trace --> 모델의 정확한 사고 과정(chain-of-thought)
- assistant --> 최종 AI 모델의 답변
- ChatML --> ChatML 형식의 사용자, 사고 과정, 답변
모든 샘플은 5k 시퀀스 길이 이내로, 소형 모델의 SFT/파인튜닝에 완벽하게 맞도록 구성되었습니다.
Hugging Face 데이터셋 링크 🤗:
https://huggingface.co/datasets/SupraLabs/reasoning-corpus-4K-5M-v1
SupraLabs Hugging Face 조직 링크 🤗:
https://huggingface.co/SupraLabs
또한, 저희 작업을 응원하고 싶으시다면 Hugging Face에서 팔로우해주시고, 공유 및 리뷰를 남겨주세요. 피드백은 언제든 환영입니다 ❤️🔥🤗 이미 250명 이상의 분들이 저희와 저희 작업을 신뢰해주고 계십니다!
이 데이터셋이 여러분 모두에게 유용하기를 바라며, 이를 기반으로 여러분이 만들어낼 결과물들을 기대하겠습니다.
이 데이터셋은 이미 1,000회 이상의 다운로드와 80개 이상의 좋아요를 기록했습니다. 다음 사용자가 되어보세요 🔥🎉

