Qwen/Qwen-Image-Bench · Hugging Face
핵심 요약
텍스트-이미지 생성 모델의 결과물을 자동으로 평가하는 비전-언어 모델 Q-Judger가 공개되었습니다.
- Q-Judger 모델 — 텍스트-이미지 생성 결과물을 다각도로 평가하는 비전-언어 모델임
- 평가 방식 — 3단계 계층 구조를 통해 구조화된 JSON 점수를 출력함
- 평가 차원 — 품질, 미학, 정렬, 현실 충실도, 창의적 생성 등 5개 항목을 평가함
- 사고 모드 — 최종 결과 출력 전 Chain-of-Thought 추론을 수행함
huggingface.co
원문 사이트로 이동
Model Description
Q-Judger는 텍스트-이미지 생성 모델이 만든 결과물을 자동으로 평가하기 위해 특별히 파인튜닝된 비전-언어 모델입니다. 텍스트 프롬프트와 생성된 이미지가 주어지면, 이 모델은 3단계 계층 구조로 정리된 세부 품질 기준에 따라 이미지를 평가하고 구조화된 JSON 점수를 출력합니다.
- Base Model: Qwen3.6-27B
- Task: 이미지 품질 평가 / 판정
- Input: 텍스트 프롬프트 + 생성된 이미지
- Output: 차원별 점수가 포함된 구조화된 JSON (0 = 실패, 1 = 통과, 2 = 우수, N/A)
- Thinking Mode: 활성화됨 — 모델이 최종 JSON을 출력하기 전에 Chain-of-Thought 추론을 사용함
Evaluation Dimensions
이 모델은 5개의 최상위 차원에 걸쳐 이미지를 평가하며, 각 차원에는 여러 하위 차원이 포함됩니다:
Quality
- Realism: 물리적 논리, 재질 질감
- Detail: 노이즈, 엣지 선명도, 자연스러움
- Resolution: 해상도
Aesthetics
- Composition: 구도
- Color Harmony: 색상 조화
- Lighting: 조명 및 분위기
- Anatomical Portraiture: 해부학적 정확성
- Emotional Expression: 감정 표현
- Style Control: 스타일 제어
Alignment
- Attributes: 수량, 표정, 재질 특성, 색상, 모양, 크기
- Actions: 접촉 상호작용, 비접촉 상호작용, 전신 동작
- Layout: 2D 공간, 3D 공간
- Relations: 구성 관계, 차이/유사성, 포함 관계
- Scene: 현실 세계 장면, 가상 장면
Real-world Fidelity
- : 사회적 편향, 문화적 공정성


