혹시 DeepSeek-V4-Flash가 코딩 외 작업에서 신뢰도가 떨어진다고 느끼시는 분 계신가요?
Is anyone else finding DeepSeek-V4-Flash unreliable for non-coding tasks?
핵심 요약
DeepSeek-V4-Flash가 코딩은 잘하지만, 문맥 파악이나 요약 등 일반적인 사무 작업에서는 Gemma-4-31B보다 성능이 떨어진다는 사용자 경험 공유.
- 모델 성능 비교 — DeepSeek-V4-Flash가 코딩 외의 언어 이해 및 문맥 파악 작업에서 기대 이하의 성능을 보임
- 구체적 결함 — 회의록 요약, 화자 구분, 문맥 내 중요 정보 추출 등에서 잦은 오류 발생
- 벤치마크의 한계 — 지능 벤치마크 점수는 높지만 실제 사무 업무에 필수적인 언어적 섬세함은 부족함
- 모델 전문화 — 모든 모델이 만능일 수는 없으며, 특정 작업에 최적화된 모델을 선택하는 것이 중요함
(내가 원어민이 아니라서 직접 쓴 거라 좀 봐줘)
진심으로 DeepSeek-V4-Flash-0731을 좋아하고 싶거든. 근데 지능 벤치마크 점수만 높지, 실상은 치명적인 결함이 너무 많아. 솔직히 코딩 말고는 어디 써먹을 데가 없을 정도로 쓸모가 없어. 사소해 보이지만 결정적인 부분에서 자꾸 삽질하고, 누가 봐도 쉬운 작업조차 제대로 못 해. 이런 오류들 때문에 텍스트 요약이나 편지 쓰기 같은 간단한 사무 업무조차 믿고 맡길 수가 없다고.
내가 뭘 잘못하고 있는 건가 싶기도 해. 밑에 적은 문제들 중 몇 개는 이 정도 규모의 LLM에서 나올 법한 수준이 아니거든.
분명히 말하는데, 난 이 모델이 잘됐으면 좋겠어. Gemma-4-31B보다 빠르고 파라미터 수도 8배나 많잖아. 웹 검색 권한만 주면 정보 조사도 기가 막히게 잘하고, 깊게 생각하는 능력도 좋아. 근데 언어 능력 쪽으로 가면 "문장력"은 둘째치고, 문맥에서 핵심 개념을 뽑아내는 것부터가 안 돼. 벤치마크에서는 이런 걸 테스트 안 하는 모양인데, 사무 업무 할 때는 이게 제일 중요하거든.
예시를 보면 이해가 빠를 거야. 세 가지 보여줄게.
능력 1: 핵심을 찌르면서 간결하게 말하기
회의록을 작성하라고 텍스트를 줬을 때.
DeepSeek-V4-Flash-0731:
불규칙한 수입을 1년 동안 분산시켜 매달 필요한 생활비를 확보함.
Gemma-4-31B:
핵심: 금융 투자는 필요 자금의 일부만 충당하도록 설계됨. 나머지 부족분은 자영업에서 발생하는 불규칙한 수입을 연간 평균으로 환산하여 메울 예정.
DeepSeek-V4-Flash-0731 버전은 수입원이 두 개라는 사실을 아예 빼먹었어. 핵심(문제점)은 짚었지만, 전체 이야기의 일부만 다루고 있어서 상황이 명확하게 전달이 안 돼.
Gemma는 어떻게든 핵심을 파악해서 간결하면서도 정확하고 예쁜 문장으로 만들어내. "연간 평균으로 환산하여(by averaging)"라는 표현 봐봐. 그냥 "평균 내서"라는 두 단어로 상황을 이렇게 우아하게 설명하잖아. DeepSeek는 이런 게 안 돼. 더 심각한 건 금융 투자가 비용 충당의 한 부분이라는 문맥 자체를 놓쳤다는 거야. 이건 단순히 "문장력" 문제가 아니라, "개념 이해"나 "뭐가 중요한지 파악하는" 능력의 문제라고.
능력 2: 화자가 누구인지 파악하기
음성 메시지 녹취록과 질문이 주어졌을 때.
"그녀에게 최선의 선택은 무엇일까? 이 상황을 어떻게 해결해야 할까? 그녀가 할 수 있는 건 뭐가 있을까? 앞으로 나아갈 최선의 방법을 찾아줘."
DeepSeek-V4-Flash-0731: 답변 전체를 마치 내가 그 음성 메시지를 남긴 당사자인 것처럼, 나한테 말하는 식으로 써놨어. 질문에 분명히 "그녀(her)"라고 적혀 있었고, 음성 메시지 제목도 "1번 음성 메시지", "2번 음성 메시지"라고 명시되어 있는데 이런 실수를 한다고? 이건 도저히 용납이 안 돼. 따져 물으니까 답변에 "그녀" 대신 "당신"이라고 쓴 이유가 녹취록에 "나(I)"라는 1인칭 시점이 많이 나와서, 그게 질문자인 줄 알고 착각했다는 식으로 변명하더라. 근데 내가 분명히 "그녀(her)의 최선의 선택"이라고 적었고, 제목만 봐도 다른 사람 메시지인 게 뻔히 보이는데 말이야. DeepSeek는 여기서 완전히 맛이 갔어. AI라면 문맥을 파악해야지, 그냥 "나"라는 단어가 많이 나왔다고 헷갈리면 어쩌자는 거야.
Gemma-4-31B: 아무 문제 없음. 요청한 사람과 음성 메시지 화자가 다른 사람이라는 걸 정확히 이해했어.
능력 3: 사소한 문구에 낚이지 않기
DeepSeek-V4-Flash-0731은 메시지 시작 부분인 "Hi, hi. So, Jon, his message is kind of funny. They’re currently up north, ..." 때문에 헷갈려 함. "So, John, ..."이 인사말일 수도 있다고 생각해서, 나머지 텍스트에서 계속 "he"라고 지칭하는데도 5개 문단 전체가 John에게 보내는 메시지라고 오해한 거임.
