시니어/리드 AI 엔지니어에게 묻습니다: '실무 수준'임을 증명하는 포트폴리오 프로젝트는 무엇인가요?
Senior/Lead AI engineers: what portfolio project actually makes you say "this person knows production"?
핵심 요약
단순한 API 조합을 넘어, 장애 처리와 평가 체계 등 실무적 엔지니어링 역량을 보여줄 수 있는 프로젝트 방향을 논의합니다.
- 실무 역량 증명 — 단순 튜토리얼 복제가 아닌 장애 처리, 비용 관리, 평가 파이프라인 구축이 핵심임
- 에이전트 시스템 추천 — 결정론적 워크플로우와 도구 호출 검증, 인간 개입(HITL)을 포함한 2번 안이 가장 실무와 유사함
- 평가(Eval)의 중요성 — 합성 데이터뿐만 아니라 실제 실패 사례를 기반으로 한 수동 평가셋과 개선 기록이 필수적임
- 기술 스택 단순화 — 여러 프레임워크를 섞기보다 잘 이해하고 있는 기술로 견고하게 구축하는 것이 더 높은 평가를 받음
요즘 너나 할 것 없이 죄다 "PDF랑 대화하기" 같은 Streamlit 앱이나 뻔한 LangChain 래퍼로 포트폴리오 채우고 있잖아. 솔직히 그런 걸로는 이제 취업 어림도 없지.
난 AI 엔지니어/Applied ML 직무를 노리고 있는데, 장난감 같은 프로젝트 4개 만드는 것보다 2~3달 동안 제대로 된 엔드투엔드 시스템 하나를 바닥부터 만들어보려고 해. 단순히 API 갖다 붙이는 수준이 아니라, 실패 상황 대응, 지연 시간(latency), 비용, 신뢰성까지 고려하는 진짜 엔지니어링 역량을 증명하고 싶거든.
지금 세 가지 방향을 고민 중인데, 요즘 업계에서 뭘 제일 쳐주는지 좀 봐주라.
-
제대로 된 LLM 라우팅/게이트웨이 서비스: 시맨틱 캐싱(Redis), 토큰 예산 관리, 쿼리 복잡도에 따라 저렴한 소형 모델과 고성능 모델을 오가는 폴백 라우팅, 그리고 비용이랑 지연 시간을 추적할 수 있는 완벽한 관측성(Langfuse / OpenTelemetry) 확보.
-
확정적(deterministic) 가드레일이 포함된 에이전트 시스템: 엄격한 상태 머신(LangGraph 또는 커스텀)을 활용한 다단계 워크플로우, Pydantic 검증을 거친 툴 호출, 휴먼 인 더 루프(human-in-the-loop) 폴백, 그리고 PR 올릴 때마다 합성 테스트 케이스를 돌리는 자동화된 평가 도구(DeepEval/Ragas).
-
로컬 추론 마이크로서비스 + 파인튜닝: 특정 도메인 작업에 맞춰 소형 오픈 모델(예: Llama/Qwen)을 QLoRA로 파인튜닝하고, vLLM으로 양자화된 가중치를 배포한 뒤, 베이스라인 대비 지연 시간/처리량 벤치마크 측정.
채용 담당자나 팀장 형들한테 물어볼게.
-
이 중에서 현업에서 매일 겪는 골치 아픈 문제랑 제일 가까운 게 뭐야?
-
깃허브 레포 딱 열었을 때, "이 새끼는 진짜 프로덕션 좀 아네" 싶게 만드는 '그린 플래그'가 뭐야? 반대로 "아, 또 튜토리얼 베꼈네" 싶은 건 뭐고? (평가 파이프라인, Docker/CI 설정, 통합 테스트, 에러 핸들링 같은 거?)
-
사람들이 맨날 놓치는 공통적인 구멍이 뭐야?
내 아이디어가 좀 핀트 나갔으면 가차 없이 까줘. 그냥 헛짓거리 안 하고 진짜 실력 인정받을 만한 걸 만들고 싶으니까.


