Gemini의 가드레일은 정말 놀라울 따름이다 - 이번엔 RECITATION BLOCK이라니...
Gemini guardrails don't stop to amaze me - this time it is RECITATION BLOCK...
핵심 요약
Gemini API의 과도한 저작권 필터가 OCR 작업까지 차단하며 업무 자동화를 방해하는 상황을 비판함.
- OCR 작업 차단 — 법률 문서의 일부 텍스트를 저작권 자료로 오인하여 API 응답이 거부됨
- Gemini의 우수성 — 희귀 언어 OCR 성능은 뛰어나지만 가드레일 때문에 실무 활용이 어려움
- 구글의 무책임함 — 노래 가사 필터를 범용으로 적용해 업무용 도구로서의 신뢰성을 떨어뜨림
야 구글, 너네 진짜 그 말도 안 되는 가드레일 가지고 장난질 좀 그만할 생각 없냐?
나 지금 유료 API 써서 법률 문서 분류나 OCR 같은 작업들 돌리고 있거든.
근데 몇 달 전부터 갑자기 요청 대부분이 PROHIBITED_CONTENT 에러 뜨면서 막히기 시작하더라.
오늘은 아예 RECITATION BLOCK이 뜨네.
처음엔 "이게 대체 뭔 개소리야?!" 싶었지.
제미나이가 설명하기를:
이게 뭔 뜻이냐면
Gemini API에서 FinishReason.RECITATION은 구글의 저작권/출처 필터 때문에 응답이 차단됐다는 뜻이야. 모델이 생성한 응답이 학습 데이터에 있는 저작권 자료(출판된 책, 뉴스 기사, 저작권 있는 가사, 독점 코드 등)와 똑같거나 거의 비슷할 때, API가 응답을 끊어버리고 빈 페이로드를 반환하는 거지.
OCR 프롬프트에서 왜 이런 일이 생기냐고?
모델한테 이미지 OCR을 시켰을 때:
이미지에 출판된 텍스트가 포함된 경우: 만약 그 이미지가 출판된 책, 뉴스 기사, 교과서, 가사 같은 거라면 모델이 받아 적은 내용이 저작권 있는 텍스트랑 바로 겹치거든.
야, 너네 진짜 여기서 잠깐 멈추고 생각 좀 해봐라.
구글 제미나이 모델이 현재 OCR 작업하기엔 최고거든, 특히 희귀 언어 쪽은 압도적이야. 어떤 언어들은 앤스로픽 모델이랑은 비교도 안 될 정도로 차이가 커.
근데 너네 모델을 그런 자동화 작업에 쓰고 싶으면, 이런 식으로 차단하는 짓은 절대 하면 안 되지.
이번엔 외국어로 된 문서 OCR 돌리다가 법 조항 짧은 거 하나 들어갔다고 바로 컷 당했어(!!!!!!!!). 보니까 시스템이 그 법 조항 텍스트를 "저작권 있는 자료"라고 판단해서 요청을 날려버린 모양인데.
이거 진짜 말도 안 되는 거 아니냐? 그냥 간단하게 말해서, 난 모델한테 뭘 창작해달라고 한 게 아니라 그냥 비전 기능 써서 텍스트 OCR 해달라고 한 것뿐이라고. OCR 작업에 저작권 필터까지 걸어버리면, 이런 모델들은 문서 자동화 워크플로우 쪽에서는 그냥 끝난 거야.
쓸데없는 넋두리는 여기까지.
추신: 아, 물론 AIStudio에도 피드백 다 남겼다.


