Qwen/Qwen-Drive-1.0-4B · 허깅페이스
Qwen/Qwen-Drive-1.0-4B · Hugging Face
핵심 요약
Qwen에서 자율주행을 위해 미세 조정된 오픈 웨이트 모델 Qwen-Drive-1.0-4B를 공개했습니다.
- 오픈 웨이트 모델 — 중국 AI 연구소에서 자율주행 기술을 적용한 오픈 웨이트 모델을 공개함
- 자율주행 모델 — 3.5 4B 모델을 기반으로 미세 조정된 주행 특화 모델임
- 기술적 활용 — RC카 제작이나 자율주행 학습용으로 활용 가능성이 기대됨
huggingface.co
원문 사이트로 이동
여기 아무도 이 얘기 안 올린 것 같은데, Qwen에서 자율주행용으로 3.5 4 파인튜닝한 모델을 내놨음. 전체 Bf16 체크포인트는 9B임.
중국 AI 연구소들이 오픈 웨이트 모델로 자율주행 시장에 뛰어드는 게 진짜 흥미로운 흐름이네.
수정: HF 레포 들어가면 깃허브 레포 링크가 있고, 거기 인용된 곳에 40페이지짜리 기술 보고서가 있음. 초록 내용은 이거임:
우리는 자율주행을 위한 비전-언어 파운데이션 모델의 첫걸음인 Qwen-Drive-1.0을 선보인다. Qwen-Drive-1.0은 사전 학습된 비전-언어 모델(VLM)의 아키텍처를 그대로 유지하면서 3D 인식, 시각적 질의응답, 동작 계획을 하나의 통합 프레임워크에 담아냈다. 외부의 조감도(BEV) 인식 헤드가 3D 객체 탐지, 의미론적 점유 예측, BEV 맵 세그멘테이션을 동시에 수행한다. 이건 공유된 표현에서 3D 정보를 추출하는 탐색기 역할을 하며, 3D 장면 구조를 명확하게 들여다볼 수 있는 인터페이스를 제공한다. 계획 전문가(Planning Expert) 모델은 공유된 VLM 표현을 기반으로 향후 자차의 궤적을 생성한다. 단계별 학습 방식을 통해 주행 데이터와 범용 비전-언어 데이터를 결합함으로써, 전반적인 시각적 이해와 지시 이행 능력을 유지하면서도 주행 특화 역량을 확보했다. 실험 결과, 범용 비전-언어 능력을 대부분 유지하면서도 강력한 3D 인식 및 주행 장면 이해 능력을 보여줬다. 오픈 루프, 의사 폐쇄 루프, 폐쇄 루프 환경 전반에 걸친 종합 평가에서도 매우 경쟁력 있는 동작 계획 성능을 입증했다.


