Qwen3.6-35b-A3B에서 thinking 모드를 올바르게 지원하려면 어떻게 해야 하나요?
How do I support thinking mode correctly with qwen3.6-35b-A3B
핵심 요약
Qwen3.6-35b-A3B 모델의 thinking 모드 비활성화 설정 및 동일 모델의 파라미터별 다중 설정 방법을 질문함.
- Thinking 모드 설정 — Qwen 모델의 thinking 모드를 끄기 위한 models.json 구성 방법을 문의함.
- 파라미터 최적화 — 동일 모델을 다른 파라미터로 호출하는 효율적인 방법이 있는지 확인함.
- Pi의 답변 한계 — Pi에게 질문했으나 해결책을 찾지 못해 커뮤니티에 도움을 요청함.
- 버그 가능성 — Pi 0.86.x 버전 이상에서 thinking 레벨 설정이 무시되는 버그가 존재함.
데스크탑에 Qwen3.6-35b-A3B로 Bionic 세팅했고, 노트북에는 Pi 깔아놨음. 지금은 '생각 안 하는(non-thinking)' 버전 돌려보려고 하는데, Qwen 문서 보니까 아래 코드처럼 하면 될 것 같은데 models.json에 어떻게 넣어야 할지 도통 모르겠네. Pi한테도 물어봤는데 알려준 대로 해도 안 됨.
아, 그리고 추가로 궁금한 거: models.json에서 서버에 있는 똑같은 모델을 파라미터(thinking, temperature, topk 등)만 다르게 해서 여러 개로 정의할 방법은 없나? 쿼리 날릴 때마다 패키지 써서 바꿔야 하는 거야?
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B",
messages=messages,
max_tokens=32768,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
"top_k": 20,
"chat_template_kwargs": {"enable_thinking": False},
},
)

