Qwen3.6 35B - TXT vs Markdown vs HTML vs HTML+CSS 비교
Qwen3.6 35B - TXT vs Markdown vs HTML vs HTML+CSS
핵심 요약
로컬 모델 Qwen3.6 35B를 사용하여 출력 형식(텍스트, 마크다운, HTML 등)에 따른 토큰 효율성과 품질을 실험한 결과입니다.
- 실험 목적 — Claude Code에서 마크다운 대신 HTML 사용 논의에 따른 로컬 모델 성능 검증
- 측정 지표 — 토큰 수, 추론 효율, 초당 토큰 처리량(TPS), 총 소요 시간 측정
- 품질 평가 — ChatGPT 5.5를 활용하여 정보 정확도, 설명력, 오류율, 효율성 점수 산출
- 결과 요약 — 마크다운 형식이 정보 밀도와 효율성 측면에서 가장 우수한 성능을 보임
최근 Claude Code에서 마크다운 대신 HTML을 사용하는 것에 대한 논의가 있었습니다. 로컬 모델에서는 어떻게 작동할지 궁금해서 Qwen3.6 35B A3B 모델을 Q8 및 F16 KV 캐시로 로드하여 테스트해 보았습니다.
그런 다음 동일한 프롬프트인 write a detailed explanation of the Blazor render cycle를 입력했습니다. 먼저 일반 텍스트, 마크다운, 스타일 없는 HTML, HTML+CSS, 마지막으로 제약 조건 없음(모델이 마크다운을 선택함) 순으로 요청했습니다. 추론 토큰 수, 전체 응답(마크다운 또는 HTML 서식 포함), 서식을 제거한 원본 응답 콘텐츠의 토큰 수를 측정했습니다.
또한 초당 토큰 수(MTP와 3개의 드래프트 토큰 사용)와 총 소요 시간도 기록했습니다.
| Output | Reasoning tokens | Output tokens | Raw content tokens | Tokens per second | Time taken |
|---|---|---|---|---|---|
| Raw text | 1,873 | 1,080 | 1,080 | 146 | 20s |
| Markdown | 1,264 | 1,496 | 1,269 | 123.5 | 23s |
| Unstyled HTML | 166 | 7,346 | 4,857 | 139 | 56s |
| Styled HTML | 108 | 10,290 | 3,418 | 139 | 82s |
| No constraint (chose markdown) | 1,465 | 2,256 | 2,002 | 122 | 31s |
마지막으로 ChatGPT 5.5 Extended Reasoning을 사용하여 다음 기준에 따라 출력 품질을 평가했습니다:
- How much correct useful information is present
- How well it is explained

