Carbon: 생명의 언어를 해독하다
Carbon: Decoding the Language of Life
핵심 요약
Hugging Face에서 공개한 오픈 DNA 파운데이션 모델 'Carbon'은 기존 SOTA 모델 대비 275배 빠른 속도를 자랑함.
- 모델 성능 — Evo2-7B와 대등한 성능을 내면서도 275배 빠른 추론 속도 달성.
- 토큰화 방식 — DNA 서열을 6-mer 단위로 토큰화하여 시퀀스 길이를 줄이고 효율성 극대화.
- 학습 전략 — 유전체의 특성을 고려해 학습 중 손실 함수를 FNS 방식으로 전환하여 안정성 확보.
- 로컬 실행 — GGUF 변환을 통해 llama.cpp에서 로컬 환경으로 구동 가능.
안녕하세요, Hugging Face의 loubna입니다. 저희의 최신 결과물인 Carbon 🧬을 공유하게 되어 매우 기쁩니다. Carbon은 오픈 DNA 파운데이션 모델 제품군입니다. Carbon-3B는 현재 SOTA인 Evo2-7B와 대등한 성능을 내면서도 275배 더 빠릅니다.
저희는 현대적인 LLM 학습 방식과 SmolLM 연구에서 많은 것을 차용했지만, DNA는 언어와 다릅니다. 유전체는 노이즈가 많고 중복적이며, 의사소통이 아닌 진화에 의해 형성되었습니다. 그래서 저희는 레시피를 조정했습니다:
토크나이저. 대부분의 유전체 모델은 뉴클레오타이드 수준에서 토크나이징을 수행하는데, 이는 시퀀스 길이를 폭발적으로 늘립니다. BPE가 LLM 스타일의 명확한 해결책이긴 하지만, DNA에서는 잘 작동하지 않습니다. 저희는 결정론적인 6-mer 토큰(1 토큰 = 6 뉴클레오타이드)을 사용합니다. 덕분에 시퀀스는 6배 짧아지고 어텐션 비용도 저렴해졌습니다.
학습 손실(Training loss). 6-mer 토큰을 사용하면 크로스 엔트로피는 6개 뉴클레오타이드 중 5개를 맞춘 예측과 완전히 틀린 예측을 동일하게 평가합니다. 이는 학습 후반부에 모델을 불안정하게 만들고 손실 스파이크를 유발합니다. 그래서 저희는 학습 중간에 더 유연한 팩터화 손실(FNS) 방식으로 전환합니다.
데이터. 유전체는 대부분 희소하고 반복적인 배경으로 이루어져 있습니다. 저희는 이를 단계별 기능성 DNA + mRNA 혼합물로 큐레이션했으며, 모든 비율은 어블레이션(ablation)을 통해 선택되었습니다. 마치 웹 코퍼스를 섞는 것과 비슷하지만, 생물학을 위한 방식이죠.
- 기술 보고서: https://github.com/huggingface/carbon/blob/main/tech-report.pdf
- 데모 (ML 친구들을 위한 생물학 입문 포함): https://huggingface.co/spaces/HuggingFaceBio/carbon-demo
댓글로 질문 주시면 답변해 드리겠습니다 🤗

