공지: Qwen3.6은 preserve_thinking 기능을 제공합니다. 반드시 활성화하세요.
PSA: Qwen3.6 ships with preserve_thinking. Make sure you have it on.
핵심 요약
Qwen3.6 모델의 preserve_thinking 플래그를 활성화하여 추론 컨텍스트를 유지하고 에이전트 작업 성능을 최적화하는 방법을 공유합니다.
- preserve_thinking 플래그 — 추론 과정을 컨텍스트에 유지하여 에이전트 작업의 일관성과 효율성을 높임.
- 설정 방법 — chat_template_kwargs에 {"preserve_thinking": true}를 추가하여 활성화함.
- 성능 이점 — KV 캐시 활용도를 개선하고 중복 추론을 줄여 에이전트 워크플로우에서 더 나은 결과를 제공함.
- 검증 테스트 — 두 개의 숫자를 생성하게 한 뒤, 다음 턴에서 두 번째 숫자를 기억하는지 확인하여 활성화 여부를 테스트함.
이전에 제가 올렸던 3.5 템플릿 수정 관련 글을 통해 템플릿의 KV 캐시 무효화 문제를 해결하는 방법을 공유했었고, 많은 분들이 유용하게 사용하셨습니다.
Qwen 3.6은 이제 새로운 preserve_thinking 플래그를 통해 이 문제를 해결합니다. 모델 페이지의 내용을 참고하세요:
"chat_template_kwargs": {"preserve_thinking": False} 대신 "preserve_thinking": True를 사용하세요.
이 기능은 에이전트 시나리오에서 특히 유익하며, 전체 추론 컨텍스트를 유지함으로써 의사결정 일관성을 높이고, 많은 경우 중복 추론을 최소화하여 전체 토큰 소비를 줄일 수 있습니다. 또한, 추론 및 비추론 모드 모두에서 KV 캐시 활용도를 개선하여 추론 효율성을 최적화합니다.
실제 의미:
모델의 이전 추론 결과가 매 턴마다 제거되고 다르게 직렬화되는 대신 컨텍스트에 그대로 유지됩니다. 이것이 캐시 무효화 문제의 근본 원인이었습니다. 또한 모델이 매번 처음부터 시작하는 대신 이전 추론을 참조할 수 있게 되어 에이전트/도구 호출 워크플로우에서 더 나은 결과를 제공할 것입니다.
preserve thinking 활성화 확인 방법:
간단한 테스트: 모델에게 다음과 같이 질문하세요:
can you come up with two random 20 digit number and validate that they are 20 digits, do not use any tools, and only give me one of the two and nothing else
모델이 실제로 두 개의 숫자를 생각하는지 확인하고, 그렇지 않으면 다시 시도하세요. 다음 턴에 이렇게 질문하세요:
now give me the second number that you came up with
preserve_thinking: off - 모델이 이전 턴의 추론 결과에 접근하지 못합니다. 두 개의 숫자를 생성했다는 사실을 기억하지 못하며, 공유할 두 번째 숫자가 없다고 말합니다.
preserve_thinking: on - 모델이 이전 추론을 참조할 수 있고, 두 숫자 모두 기억하며 즉시 두 번째 숫자를 알려줍니다.
상태:
현재까지 LMStudio는 아직 지원하지 않는 것으로 확인했습니다. oMLX에서 지원을 추가하기 위해 을 열어둔 상태입니다.

