다들 'AI 연구 에이전트'랑 논문용 챗GPT를 자꾸 혼동함
everyone keeps confusing "AI research agent" with ChatGPT for papers
핵심 요약
AI 연구 에이전트는 단순 요약을 넘어 다단계 연구 워크플로우를 수행해야 한다는 주장입니다.
- 연구 에이전트 정의 — 단순 요약이 아닌 연구 목표 설정, 실험 설계, 데이터 분석을 수행하는 도구임.
- 챗GPT의 한계 — 단일 턴 답변에 그치며 연구의 맥락을 연결하거나 계획을 세우지 못함.
- 진정한 연구 도구 — 인용 네트워크 분석, 실험 설계 보조, 가설 검증 등 복잡한 과정을 자동화해야 함.
- AI 거품 논란 — 챗봇에 프롬프트만 씌워 연구 에이전트라고 포장하는 스타트업들이 많음.
누가 "문헌 검토할 때 그냥 챗GPT 쓰면 되잖아"라고 할 때마다 내 수명이 1년씩 줄어드는 기분이다.
요약은 연구가 아니다. 요약은 이미 뭘 찾아야 할지 다 알고 있을 때나 하는 짓이지.
연구는 정반대다. 4개 세부 분야에 걸친 논문 200편을 멍하니 쳐다보면서, 실험 설계를 어떻게 할지는 고사하고 대체 빈틈이 어디에 있는지 찾아내는 게 연구다.
진짜 연구용 에이전트가 해야 할 일은 단순 Q&A 따위가 아니다.
"왜 X 방법론이 Y 도메인에서 성능이 안 나오는지 파악해라" 같은 막연한 연구 목표를 던져주면, 이걸 실행 가능한 세부 질문으로 쪼개야 한다. 논문 80편을 읽고, 인용 네트워크를 매핑하고, 그중 진짜 중요한 논문 5편이 뭔지, 나머지는 왜 그냥 뻔한 소리만 늘어놓는지 알려줘야지. 제안된 접근법들을 비교하고, 성립하지 않는 가정들을 잡아내고, 내가 깜빡할 법한 베이스라인도 제안해줘야 한다. 지저분한 실험 결과들을 가져와서 적절한 테스트를 돌리고, '리뷰어 2'가 지적하기 전에 표본 크기가 부족하다는 걸 미리 짚어줘야 한다고.
챗GPT는 이런 거 하나도 못 한다. 그냥 문단 하나 띡 던져줄 뿐이지. 뭐, 문장 구성은 깔끔하겠지. 근데 결국 연결하고, 계획 짜고, 디버깅하는 건 전부 내 몫이다. 요즘 mira ai science를 써보고 있는데, "여기 요약본 있어요" 수준에서 멈추는 게 아니라 진짜 전체 워크플로우를 다루려고 시도하는 첫 번째 툴인 것 같다.
연구 목표를 잡으면 그걸 세부 작업으로 분해하고, 코퍼스 전체를 훑어서 문헌 분석을 수행하고, 실험 설계랑 데이터 분석 구조 잡는 것까지 도와준다.
물론 완벽하진 않다. 작업 분해가 가끔 너무 과해서 특정 도메인에서는 말도 안 되는 세부 질문을 만들어내기도 한다. 그래도 최소한 이 아키텍처는 단답형 답변이 아니라 다단계 연구 수행을 위해 설계된 거니까.
핵심은 어떤 툴이 더 낫냐는 게 아니다. 요즘은 너도나도 챗봇 껍데기 씌워놓고 "AI 연구 비서"라고 이름 붙이는 바람에 그 단어 자체가 아무 의미가 없어졌다는 거다.
연구 목표를 여러 단계에 걸쳐 유지하면서 실제로 그에 맞춰 행동할 수 없다면, 그건 연구용 에이전트가 아니다. 그냥 단계만 좀 추가된 검색창일 뿐이지.

