어떤 에이전트 하네스(agent harness)를 사용하시나요? 그 이유는?
Which agent harness do you use and why?
핵심 요약
다양한 에이전트 하네스 중 사용자의 경험과 선호도를 공유하며, 특정 모델과의 조합 및 자동 압축 기능의 안정성에 대한 논의가 활발함.
- 에이전트 하네스 선택 — 사용자마다 선호하는 도구와 모델 조합이 다름
- 성능 및 안정성 — 자동 압축(auto-compaction) 기능의 완성도가 도구 선택의 핵심임
- 모델 조합 — Qwen 3.8-27B 모델이 하네스와 함께 사용 시 강력한 성능을 발휘함
- 커스텀 및 오픈소스 — 직접 포크하거나 수정하여 사용하는 사례가 많음
며칠마다 새로운 게 계속 튀어나오네... 이런 새로운 하네스(harness)들이 claude code나 pi 같은 거랑 비교하면 어떤지, 혹시 갈아탄 사람 있음?
어떤 하네스를 쓰는 게 좋을지, 왜 그런지도 좀 알려줘.
수정: claude code, deepagents(langgraph), opencode, pi, trueforge까지 이것저것 다 써봄.
내 생각은 이럼-
claude code - 완성도랑 관리형 서비스 측면에선 제일 낫긴 한데, 비용이랑 토큰 소모가 너무 심함.
deepagents - 좀 더 구조화된 에이전트 프레임워크를 원하고 오픈소스 스택의 유연성을 챙기고 싶다면 꽤 괜찮은 중간 지점임. 좀 더 긴 작업들로 빡세게 테스트해 볼 생각임.
https://github.com/truefoundry/trueforge
왜냐고?? - 실제 에이전트 작업으로 벤치마크도 돌려봤거든. 같은 모델, 같은 프롬프트, 같은 태스크로 비교해 봄.
비교하려고 돌린 벤치마크 결과 추가함.
14개의 크로스 시스템 태스크를 돌렸고, 그 뒤에 MCP 서버 3개(CRM, 이슈 트래커, 문서 저장소)를 붙여서 claude 관리형 에이전트, langchain의 deepagents, 그리고 오픈소스 에이전트 하네스인 trueforge를 비교함.
가장 놀라웠던 결과:
Claude Managed Agents + Opus 4.8:
11/14 태스크 해결 | 실행당 $11.8 | 실행당 1,000만 토큰
TrueForge + Opus 4.8:
11/14 태스크 해결 | 실행당 $8.6 | 실행당 370만 토큰
같은 모델, 같은 벤치마크인데도 놀랍게 trueforge가 토큰은 63% 정도 덜 쓰고 비용은 30% 정도 저렴했음.
도구 사용량에서도 비슷한 차이가 났는데, trueforge는 태스크당 평균 19번 도구를 호출한 반면, Claude Managed Agents는 32번이었음.
그다음엔 모델을 바꿔서 테스트해 봄.
trueforge + GLM-5.2:
11.7/14 태스크 해결 | 실행당 $3.0 | 실행당 380만 토큰
이 벤치마크에선 Claude Managed Agents + Opus 조합보다 평균 해결률이 살짝 더 높으면서 비용은 75%나 저렴했음.
해결률은 비슷한데 토큰 절감 효과가 엄청나서 진짜 흥미롭더라.
이 정도면 한번 써볼 만한 듯.
근데 아직 초기 단계라 OSS 런타임에 제대로 된 트레이싱이나 평가 툴이 없음. 자체 코드 실행 샌드박스도 없어서 따로 붙여야 하고, 컨텍스트 압축도 의도적으로 손실이 발생하게 설계됨.
그러니까 지금 당장 기능 하나하나 따져보면 성숙한 관리형 에이전트 플랫폼이나 다른 하네스를 완전히 대체할 수준은 아님. 그래도 핵심 런타임이 이미 이런 작업들에서 경쟁력이 있다는 점, 그리고 오픈 상태로 모델에 종속되지 않고 내 인프라에 직접 배포할 수 있다는 점은 확실히 흥미로움.
이게 내가 쓴 벤치마크 키트임 https://github.com/truefoundry/trueforge/tree/main/benchmark


