Astra는 작가, 편집자, 문서 작업자들에게 오히려 퇴보한 느낌임
Astra feels like a downgrade for writers, editors, and documentation work
핵심 요약
Astra가 코딩 성능에 집중하느라 정작 중요한 글쓰기 지시사항 이행과 편집 정밀도는 떨어졌다는 비판이 제기됨.
- 지시사항 무시 — 명확한 가이드라인과 제약 조건을 제공해도 모델이 이를 반복적으로 어김
- 글쓰기 품질 저하 — 코딩과 기술적 벤치마크에 치중하면서 작문, 톤 조절, 편집 역량이 퇴보함
- 과도한 검열 — 불필요한 안전 가이드라인으로 인해 창의적인 글쓰기나 번역 작업이 방해받음
- 사용자 경험 차이 — 문서 작업 중심의 사용자들은 불만을 표하는 반면, 일부는 여전히 유용하다고 평가함
도대체 Astra가 뭐가 더 낫다는 건지 모르겠네. 만약 답이 "전부 다"라면, 글쓰기 위주의 작업에 대해 도대체 어떤 테스트를 거친 건지 이해가 안 가거든.
가장 큰 문제는 지시 사항을 제대로 안 따른다는 거야.
내가 원하는 걸 정확하게 설명하고, 반복해서 말하고, 예시까지 들고, 바꾸지 말아야 할 부분까지 짚어주고, 톤이랑 구조, 서식, 범위까지 다 정해줘도 Astra는 툭하면 그 지시들을 무시하고 완전히 딴판인 결과물을 내놓거든.
예를 들면 이런 식이지:
X는 절대 하지 마.
Y를 해.
근데 몇 번 대화하다 보면 어느새 X를 하고 앉아있어.
이럴 거면 커스텀 인스트럭션, 프로젝트 인스트럭션, 메모리, 워크 인스트럭션, 아니면 그 큰 컨텍스트 윈도우는 다 무슨 소용이야? 모델이 사용자의 명확한 지시를 계속 씹어버리는데 말이야.
난 ChatGPT를 문서 작업이나 글쓰기 업무에도 쓰는데, Astra는 여기서도 진짜 사람 속 터지게 만들어. 특정 단어만 바꾸라고 하면 문장 전체를 뜯어고치질 않나, 구조 유지하라고 하면 구조를 바꿔버리고, 서식이나 특정 단어, 빨간색 폰트, 특정 톤, 아주 좁은 편집 범위까지 지정해 줘도 제멋대로 무시하기 일쑤야.
이걸 보면 OpenAI가 글쓰기가 주 업무인 사람들을 대상으로 테스트를 하긴 하는 건지 의문이 들어. 코딩, 수학, 추론 벤치마크, 에이전트, 기술적인 작업에는 엄청나게 힘을 쏟으면서, 정작 테크니컬 라이터, 문서 전문가, 마케터, 에디터, 카피라이터, 연구원, 인문학 종사자나 글쓰기 위주로 ChatGPT를 쓰는 사람들은 안중에도 없는 거냐고.
이게 무슨 마이너한 케이스도 아니잖아. 애초에 사람들이 언어 모델을 쓰는 가장 큰 이유 중 하나가 글쓰기인데 말이야.
Astra가 기술적인 벤치마크 점수는 좋을지 몰라도, 글쓰기 측면에서는 확실히 퇴보한 느낌이야. 지시 이행도 떨어지고, 톤 조절도 안 되고, 캐릭터성도 죽고, 편집 규율도 엉망이고, 검열은 훨씬 더 공격적으로 변했어.
나 프로 계정 쓰면서 일반 채팅이랑 워크 모드 둘 다 테스트해 봤거든. 상세한 지시 사항이랑 충분한 컨텍스트까지 다 줬는데도 이래. 내가 프롬프트를 대충 쓴 게 아니라고.
Astra랑 대화하다 보면 마치 방음 유리 너머로 엄청나게 상세한 지시를 내리는 기분이야. 모델은 밖에서 공손하게 고개는 끄덕이는데, 막상 결과물은 내가 하지 말라고 한 것만 골라서 써놓거든.
OpenAI가 코딩이나 벤치마크 성능만큼이나 글쓰기 품질, 편집의 정밀함, 창의성, 톤 조절, 그리고 지시 이행 능력을 좀 진지하게 다뤄줬으면 좋겠어.


