오픈 소스 모델 학습을 돕기 위해 코딩 세션 데이터를 CC-BY-4.0 데이터셋으로 기부하세요
Donate your coding sessions to an open CC-BY-4.0 dataset to help train open-weight and open source models
핵심 요약
거대 기업의 데이터 독점을 막기 위해 코딩 에이전트 사용 기록을 오픈 데이터셋으로 공유하자는 제안입니다.
- 데이터 독점 방지 — 거대 기업의 코딩 데이터 독점으로 인한 오픈 소스 모델의 격차를 줄임
- Trace Commons 이니셔티브 — 코딩 에이전트 사용 기록을 수집하여 오픈 데이터셋으로 구축함
- 데이터 익명화 필요 — 기부 과정에서 코드와 민감 정보를 보호할 도구 개발이 중요함
- 기여 장려 — 오픈 데이터셋 구축을 위해 커뮤니티의 피드백과 코드 기여를 환영함
Anthropic과 OpenAI는 Claude Code와 Codex 사용을 통해 엄청난 데이터를 얻고 있습니다. 저는 이것이 과점 상태를 만들까 봐 꽤 두렵습니다. 그들의 모델만 이 데이터로 학습되어 오픈 웨이트 및 오픈 소스 모델들이 뒤처지게 될 테니까요.
그래서 저는 Trace Commons라는 작은 이니셔티브를 시작하려고 합니다. 사람들이 자신의 코딩 에이전트 기록을 오픈 데이터셋(https://trace-commons-web.hf.space/)에 기부하도록 장려하여 다른 모델 연구소들도 이를 학습에 활용할 수 있게 하려는 것입니다.
피드백이 있다면 알려주세요. 조만간 멋진 오픈 데이터셋을 만들 수 있기를 바랍니다!

