마이크로소프트의 AesCode 8B 및 32B 모델
microsoft/AesCode 8B and 32B
핵심 요약
시각적 레이아웃과 구조화된 코드를 결합하여 슬라이드나 대시보드를 생성하는 마이크로소프트의 새로운 모델입니다.
- 시각적 생성 능력 — 이미지 생성 모델의 미적 감각과 코드 모델의 구조적 정확성을 결합함
- 기술적 접근 — 그래프 구조 감독과 교차 모달 보상을 통해 시각적 단서와 의미적 요구사항을 분리함
- 모델 기반 — Qwen3-VL-32B-Instruct를 기반으로 훈련된 고성능 체크포인트임
- 활용 분야 — HTML/CSS를 사용하여 편집 및 검증 가능한 정보 중심의 시각적 결과물을 생성함
AesCode는 슬라이드, 포스터, 대시보드 같은 정보 밀도 높은 시각적 결과물을 HTML/CSS로 뽑아주는 모델임. 결과물은 구조화되어 있고, 수정 가능하며, 검증까지 가능한데, 이게 좀 까다로운 게 코드 모델들은 레이아웃이나 계층 구조, 색감이 캔버스 위에서 어떻게 어우러지는지 직접 볼 수가 없거든.
이미지 생성 모델은 정반대 장점이 있음. 시각적으로는 그럴싸하게 뽑아내는데, 정작 텍스트나 숫자, 논리적 관계는 죄다 뭉개버리기 일쑤지. AesCode는 같은 프롬프트로 생성한 이미지를 미적 참고 자료로 쓰면서, 동시에 프롬프트가 요구하는 핵심 내용을 정확하게 따라가는 방식을 씀.
그냥 참고 자료만 던져준다고 해결되는 게 아님. 시중에 있는 비전-언어 모델(VLM)들은 환각(hallucination)으로 헛소리를 적거나 레이아웃을 무시하기 일쑤거든. 그래서 AesCode는 **그래프 구조 기반의 지도 학습(graph-structured supervision)과 분리된 교차 모달 보상(decoupled cross-modal rewards)**을 써서 의미론적 요구사항이랑 시각적 단서를 확실하게 갈라놨음.
AesCode-32B는 Qwen3-VL-32B-Instruct를 기반으로 만들었고, 콜드 스타트 SFT(cold-start SFT)를 거친 뒤 7개 보상 채널에 걸쳐 GDPO로 학습시켰음. 이번에 나온 체크포인트 중 덩치가 제일 크고, 벤치마크 점수도 제일 잘 나옴.
https://huggingface.co/microsoft/AesCode-32B
https://huggingface.co/bartowski/AesCode-32B-GGUF



