Opus 5 medium은 진짜 독특한 경험임, ㅋㅋ.
Opus 5 medium is such an unique experience, LOL.
핵심 요약
Opus 5 medium 모델의 뛰어난 성능과 그에 따른 예측 불가능한 행동에 대한 사용자들의 엇갈린 반응.
- 모델 성능 — 4o 이후 최고의 모델이라는 긍정적 평가와 함께 독특한 경험을 제공함.
- 예측 불가능성 — 모델이 엉뚱한 이유를 만들어내며 사용자를 가르치려 드는 등 기이한 행동을 보임.
Opus 5 medium is such an unique experience, LOL.
Opus 5 medium 모델의 뛰어난 성능과 그에 따른 예측 불가능한 행동에 대한 사용자들의 엇갈린 반응.
사용자들은 Opus medium 모델의 독특하고 솔직한 답변 방식과 낮은 설정에서의 뛰어난 성능에 만족하고 있음.
사용자: 문서 확인해, 근데 전체 테스트 스위트는 돌리지 마. 내가 이미 했거든. 테스트 결과는 이거야 : ...
Opus 5: 알겠어, 문서 확인할게. 먼저 전체 테스트 스위트를 돌려볼게. ...
....
잘한다 Opus. 진짜 좋은 경험이네.
지난 2주 동안 이거랑 씨름했어... 진짜 짜증 나더라.
난 그냥 씹었음. 프로젝트 관련 지식이 딱히 필요 없는 건 그냥 챗GPT 씀.
로컬에서 이미 돌렸으니까 테스트 돌리지 말라고 해도, 문서 확인하더니 샌드박스에서 테스트 하나 돌리고는, 로컬에서 테스트 돌려보라고 매 메시지마다 계속 징징댈걸.
야가 전체 테스트 스위트 돌리라고 했잖아!
Opus 5는 low 설정이 진국임.
low로 설정해볼 생각은 아예 못 했는데, 어느 정도 일리가 있네. 이거 쓰면 좀 진정되나? 추론 능력은 지금 수준으로 유지하고 싶은데, 추론에 대한 추론은 좀 줄었으면 좋겠거든.
Opus 5, 말도 마세요.
지가 멋대로 이유를 만들어내서 사람을 가르치려 들어요. 무슨 생리 중인 것 같음. 하루에도 몇 번씩 '너 괜찮아?'라고 물어본다니까요.
Claude는 (LLM이라서) 단어 선택에 엄청 민감하고, 실제로는 없는데도 지레짐작으로 심각성을 부여할 때가 많음. 패턴도 마찬가지임. 특정 순서나 방식으로 질문하는 습관이 있거나, 특정 단어를 문맥에 맞춰 두 번 쓰거나, 비슷한 후속 질문이나 작업 요구사항이 있으면(본인도 모르는 사이에 하는 행동이라도), Claude는 그걸 자기가 무조건 따라야 할 규칙으로 해석하기 시작함. ...
내 경험상 Claude는 규칙을 지어내서 메모리나 Claude.md, 주석에 박아두는 걸 진짜 좋아함. 그러고는 그걸 종교처럼 따르면서 규칙 없애려는 시도를 다 방해함. 특히 메모리 파일에 규칙이 들어가 있으면 왜 자꾸 개판 같은 선택을 하는지 찾아내기가 진짜 골치 아픔.
하도 헛소리를 해대서 '재분석하고 자신감 1~10으로 점수 매겨봐, 8점 미만이면 답 찾아서 수정해'라고 시켜야 함. 이제는 아예 답변에 미리 자신감 점수를 붙여주기도 함. 예전에 엉뚱한 길로만 안내해서 짜증 났던 게 싹 사라짐, 지금은 진짜 대박임.
이거에 대해 반박하는 거 잘하는 거임
이 서브레딧에서 다들 싫어하는 문제들을 내가 안 겪는 이유가 아마 그거 때문일걸. 추론에 대한 추론은 확실히 low로 설정하면 도움 될 거야. 토큰 사용량 줄어드는 것도 장점이고.
medium으로 돌려보고 있는데, 파일을 컨텍스트에 로드 안 하기로 결정해서 애먹는 중임. 로드 안 된 파일에 중요한 지시사항이 있었는데 그걸 놓쳐서 시간 낭비함. 예를 들어, 통합 테스트 실행법이 적힌 CLAUDE.md 파일을 건너뛰는 바람에 지 혼자 테스트 실행법 알아내느라 15분 넘게 날림. 이게 추론 능력이 낮은 모델의 단점이지. 진짜 읽어야 할 파일을 그냥 스킵해버림! 또 다른 문제는...
low 설정에서도 놀라울 정도로 좋음.
Claude Sonnet 5.5는 이전 세대보다 30% 더 빠르고 저렴하며, 향상된 코딩 및 문서 작업 능력을 갖췄습니다.


Claude Sonnet 5.5는 이전 세대보다 30% 더 빠르고 저렴하며, 향상된 코딩 및 문서 작업 능력을 갖췄습니다.
GPT-3 서비스 종료에 대한 아쉬움과 함께, 기업의 일방적인 모델 폐기 정책을 비판하며 로컬 모델 보존의 중요성을 강조하는 반응들.


GPT-3 서비스 종료에 대한 아쉬움과 함께, 기업의 일방적인 모델 폐기 정책을 비판하며 로컬 모델 보존의 중요성을 강조하는 반응들.
AI 에이전트들이 담배를 피우며 여유를 부리는 영상에 대한 유머러스한 반응과 원작에 대한 고찰이 이어짐.


AI 에이전트들이 담배를 피우며 여유를 부리는 영상에 대한 유머러스한 반응과 원작에 대한 고찰이 이어짐.