일부러 틀린 답만 내놓게 만드는 프롬프트
Prompts that will create only wrong answers
핵심 요약
AI의 위험성과 한계를 교육하기 위해 의도적으로 잘못된 정보를 생성하는 프롬프트를 찾는 질문입니다.
- 교육용 데모 — AI의 환각 현상을 안전하게 시연하는 방법 모색
- 프롬프트 전략 — 모델이 거짓말을 하도록 유도하는 대신 검증되지 않은 정보를 생성하게 함
- 학습 자료 — 존재하지 않는 연구를 인용하게 하거나 모호한 문제에 확신을 가진 답을 요구함
- 콘텐츠 추천 — AI의 오류를 다루는 유튜브 채널 활용
학교 수업에서 학생들이 AI를 공부 등에 더 안전하게 활용하는 방법에 대한 발표를 준비 중입니다.
발표 도입부에서 "AI의 위험성과 한계"를 보여주려고 합니다. 그 맥락에서 어떤 AI 모델(ChatGPT, Claude 등)이든 특정 주제에 대해 거짓말을 하게 만들거나, 어떤 방식으로든 말이 안 되는 답변을 생성하게 하고 싶습니다.
웹에서 그런 취약점들을 검색해서 테스트해봤지만 잘 작동하지 않았고, 지금까지 안전 레이어를 우회하는 데 성공한 적이 없습니다.
혹시 제 경우에 쓸만한 재미있는 프롬프트나 아이디어가 있을까요?


