최대 사고 모드에서 Sol은 작업을 끝내는데 Grok 4.6은 무한 루프를 돕니다. 두 모델 모두에서 작동하는 스킬은 어떻게 작성하시나요?
At max thinking, Sol finishes the job and Grok 4.6 loops. How are you writing skills that both can run?
핵심 요약
최대 추론 모드에서 Sol은 작업을 완수하지만 Grok은 루프에 빠지는 현상에 대해, 모델 독립적인 스킬 작성법과 종료 조건 설정에 대한 논의입니다.
- 모델 성능 차이 — Sol은 한 번에 작업을 완료하는 반면 Grok은 무한 루프에 빠지는 경향이 있음
- 스킬 작성 전략 — 모델에 의존하지 않기 위해 명확한 입출력 계약과 체크리스트를 포함한 스킬 정의가 필요함
- 종료 조건 설정 — 모델의 주관적 판단에 맡기지 말고 외부에서 검증 가능한 완료 조건을 명시해야 함
- 모델 역할 분담 — Grok을 단순 작업자로 활용하고, 계획과 검토는 Sol 같은 상위 모델에 맡기는 방식이 효율적임
벤치마크 표 따위는 관심 없음. 사람들이 실제로 스킬을 어떻게 짜는지 궁금함.
똑같은 작업, 최고 수준의 사고력으로 돌려봤음: GPT Sol Ultra는 아티팩트를 바로 완성해버림. 반면 Grok 4.6은 하루 종일 로컬 수정만 붙잡고 절대 끝낼 생각을 안 함.
구체적인 사례로 draw.io에서 과학 도표 그리는 작업을 시켜봤음. Sol은 레이아웃을 바로 뽑아내는데, Grok은 계속 재생성만 반복함. 에이전트 도메인 순서도는 괜찮게 나오는데, 내가 모아둔 생물정보학 플롯 라이브러리는 여전히 개판임. 이건 뭐 나중에 따로 글 쓸 예정.
원본 도표.
GPT Sol Ultra (한 번에 성공).
Grok Extra High, 10번 넘게 돌렸는데도 아직 안 끝남.
사용 방식: Cursor에서 둘 다 최고 사고력 모드로 돌림. 똑같은 과학 일러스트 작업임. Sol Ultra는 보통 한 번에 쓸만한 레이아웃을 뽑아줌. Grok 4.6(최고 사고력)은 하루 종일 붙잡고 반복했는데도 끝을 못 봄. 한 번 해보고 마는 프롬프트가 아님; 똑같은 스킬, 똑같은 파일, 똑같은 수락/거절 루프였음. Grok Extra High는 두 번째 도표까지 가는 데만 수락/거절을 10번 넘게 반복해야 했음.



