6.x 모델들은 전부 5.6-Sol보다 훨씬 멍청함
All of the 6.x models are significantly dumber than 5.6-Sol
핵심 요약
6.x 모델들이 문맥 유지와 지시 이행 능력이 떨어져 5.6-Sol보다 실무 성능이 낮다는 사용자 경험 공유.
- 성능 저하 논란 — 6.x 모델들이 5.6-Sol 대비 문맥 파악 및 지시 이행 능력이 현저히 떨어짐.
- 사용자 경험 공유 — 6.1-Sol과 6-Astra를 사용해 본 결과 5.6-Sol보다 작업 효율이 낮다고 평가함.
- 벤치마크 회의론 — 벤치마크 점수와 실제 작업 성능은 다르며 5.6-Sol이 실무에 더 적합하다고 주장함.
누가 6-Astra가 5.6-Sol보다 똑똑하다고 할 때마다 가스라이팅 당하는 기분임.
6-Astra나 6.1-Sol을 쓰다 보면 마리오 카트에서 바나나 껍질 밟고 핸들 꺾는 느낌임. 과하게 꺾이거나, 덜 꺾이거나, 트랙 이탈해서 강물로 처박히는 꼴이지. 다시 주워 들고 처음부터 시작해야 함. 지금 대체 어디까지 한 거지?
어젯밤이랑 오늘 밤 절반을 꼬박 써서 이 모델들한테 내 AGENTS 파일에 추가할 내용을 제안해 보라고 시켰거든. 6.1-Sol에서 발견된 병적인 동작들을 좀 막아보려고 말이야.
5.6-Sol, 6.1-Sol, 6-Astra 셋 다 동시에 돌려봤는데, 제대로 궤도 유지하는 건 5.6-Sol밖에 없음. 6.x 모델들은 추론 레벨을 어떻게 설정하든 범위를 계속 넘어가거나 못 미치고, 맥락이랑 목적을 까먹고, 내 요청을 완전히 엉뚱하게 해석함. 특정 단어에 자폐적으로 집착하는 건 덤이고. 수정 요청 한 번 하면 그게 다음 응답의 유일한 목적이 돼버려서 이전 맥락은 싹 다 날려 먹음.
음모론자들 튀어나오기 전에 미리 말하는데, 이거 "모델 너프"나 "양자화" 문제 아님. 6-Astra는 출시 첫날부터 이 모양이었음. 6.0-Sol 나오면 고쳐질 줄 알았는데(진짜 헛된 희망이었지), 6.1-Sol이 나와도 똑같음. 6-Astra랑 사실상 판박이인데, 가격만 좀 싸지고 속도는 더 느려짐.
6.1-Sol이 싸니까 이 모델 어떻게든 써먹어 보려고 온갖 추론 레벨 다 써가면서 가이드하고 수정하고 별짓을 다 해봤음. 근데 그냥 불가능함. 6.x 모델들은 그냥 너무 멍청함. 맥락 유지 못 하고 이해력 떨어지는 게 딱 5.0 시절 생각나게 함.
6.x 모델들은 코드 리뷰 2차 검토용으로는 쓸만할지 몰라도, 계획 짜고 오케스트레이션하고 실제로 콘텐츠 생성하는 용도로는 5.6-Sol이 유일한 답임.


