LangChain, CrewAI, AutoGen, LlamaIndex. 4가지 다 써보고 느낀 진짜 핵심 정리.
LangChain, CrewAI, AutoGen, LlamaIndex. I've used all four. Here's what you actually need to know.
핵심 요약
주요 AI 에이전트 프레임워크 4종의 실제 사용 경험과 장단점, 그리고 상황별 선택 가이드를 공유합니다.
- LangChain/LangGraph — 방대한 생태계와 복잡한 워크플로우 구현에 적합함
- CrewAI — 선형적 워크플로우와 빠른 프로토타이핑에 최적화됨
- AutoGen — 대화형 에이전트와 연구용 협업 시나리오에 강점 있음
- LlamaIndex — 데이터 검색 및 인덱싱 성능이 압도적으로 뛰어남
비교 글들은 죄다 깃허브 스타 수나 기능 목록으로 순위를 매기지. 근데 정작 중요한 건 안 알려줘. 실제로 이걸로 뭘 만들어볼 때 어떤 기분인지, 어디서 막히는지, 어디서 시간을 버리는지, 그리고 네가 하려는 일에 맞춰서 뭘 골라야 하는지 말이야.
LangChain: 스스로가 문제가 되어버린 '모든 것을 위한' 프레임워크.
LangChain은 생태계가 제일 커. 통합 기능도 제일 많고, 튜토리얼도 널렸고, Stack Overflow 답변도 제일 많지. 구글에 "LLM으로 X 만드는 법"이라고 치면 첫 번째 결과는 십중팔구 LangChain일걸.
좋은 점: 처음부터 모델에 구애받지 않게 설계됐어. 코드 한 줄이면 모델 공급자를 바꿀 수 있지. 수백 개의 툴 연동은 덤이고, 커뮤니티도 엄청나. LLM 판에 존재하는 거라면 LangChain은 아마 다 연결할 수 있을 거야.
노트북을 집어 던지고 싶었던 점: 추상화 위에 추상화, 또 그 위에 추상화가 겹쳐 있어. LLM에 간단한 API 호출 하나 하고 싶다고? 그럼 '체인(chain)'을 써야 해. 메모리를 추가하고 싶어? 그럼 메모리 모듈이 달린 다른 체인을 써야지. 에이전트가 툴을 쓰게 하고 싶어? 그럼 툴 실행기가 포함된 ReAct 에이전트로 체인을 감싸야 해. 조건문 로직을 넣고 싶다고? 이제 LangGraph가 필요할걸.
2026년의 LangChain은 사실상 LangGraph를 의미해. 기존의 체인 기반 API는 이제 구식이야. LangGraph는 상태 유지가 가능한 그래프를 제공하는데, 순환, 분기, 체크포인트, 사람의 승인 단계까지 다 넣을 수 있어. 강력하긴 하지. 근데 너무 복잡해서 대부분의 팀은 비즈니스 로직 한 줄 짜기도 전에 실행 모델 이해하는 데만 2주를 다 써버려.
내가 LangChain으로 문서 처리 파이프라인을 만들어봤거든. 돌아가긴 해. 근데 정작 해결해야 할 문제보다 프레임워크가 정해놓은 '구조 방식'이랑 싸우느라 시간을 더 많이 썼어. 예상했던 패턴에서 조금만 벗어나려고 하면, 도대체 어떤 추상화 단계가 내 에러를 집어삼키고 있는지 파악하려고 소스 코드를 뒤져야 했지.
LangChain/LangGraph를 써야 할 때: 가장 방대한 생태계가 필요할 때, 순환이나 분기, 사람의 개입이 필요한 복잡한 걸 만들 때, 그리고 팀이 프레임워크를 제대로 공부할 시간이 있을 때. 투자한 만큼 보상은 확실해. 다만, 처음에 쏟아야 할 노력이 너무 클 뿐이지.
CrewAI: 빠르게 만들긴 좋은데, 금방 한계에 부딪힘.
CrewAI는 "금요일까지 멀티 에이전트 시스템 하나 만들어야 해"라고 묻는 사람들한테 내가 추천하는 거야.
사고방식이 아주 단순해. 역할을 정의하고(연구원, 작가, 편집자), 작업을 정의하고("경쟁사 가격 조사", "보고서 작성", "오류 검토"), 작업에 역할을 할당해. 그리고 실행 버튼을 누르면 끝이야. 에이전트끼리 서로 대화하면서 결과물을 만들어내지.
오후 반나절 만에 콘텐츠 조사 파이프라인을 완성했어. 연구원 에이전트가 웹에서 데이터를 긁어오고, 작가 에이전트가 요약본을 초안으로 쓰고, 편집자 에이전트가 정확도를 검토했지. 결과물도 꽤 쓸만했어. 세팅부터 첫 결과물까지 딱 3시간 걸렸나? 여기 있는 프레임워크 중 제일 빨라.
문제는 한계가 너무 낮다는 거야. 워크플로우에 조건부 분기가 필요하거나("연구 결과가 X면 이걸 하고, 아니면 저걸 해"), 동적인 작업 생성이 필요하거나("연구원이 찾은 내용에 따라 새로운 작업을 생성해"), 오류 복구가 필요할 때("작가가 쓰레기 같은 글을 쓰면, 더 좋은 지시사항을 줘서 연구원한테 다시 보내") CrewAI는 너랑 싸우기 시작해.
토큰도 엄청 잡아먹어. 에이전트 셋이 작업 하나를 두고 대화한다는 건 최소 세 번의 LLM 호출이 일어난다는 뜻이고, 실제로는 더 많아. '대화 오버헤드'가 순식간에 쌓이지. 프롬프트 잘 짠 에이전트 하나가 500 토큰으로 끝낼 일을 CrewAI는 3,000 토큰 넘게 써버려.
CrewAI를 써야 할 때: 워크플로우가 전문가 역할별로 딱딱 나뉘고, 빠르게 프로토타입을 뽑아야 하며, 워크플로우가 비교적 선형적일 때. 연구원이 데이터를 찾고, 작가가 쓰고, 편집자가 검토한다. 이 패턴이라면 CrewAI가 제일 빠른 길이야.
AutoGen: 연구실에서 탈출한 프로덕션용 프레임워크.
AutoGen은 마이크로소프트 리서치에서 만든 건데, 딱 그 느낌이 나. 핵심 아이디어는 '대화를 통해 소통하는 에이전트'야. 진짜로 서로 메시지를 주고받고, 토론하고, 의견이 갈리면 논쟁하면서 대화를 통해 결론에 도달해.


