오픈 소스 모델 중립적 에이전트 하네스 'TrueForge' 개발: Claude Managed Agents 대비 동일 성능에 최대 75% 비용 절감
We built an open-source, model-neutral agent harness and compared it with claude managed agents - for the same model, got same accuracy, upto 75% lower cost
핵심 요약
Claude와 동일한 성능을 내면서 토큰 효율성과 비용을 획기적으로 개선한 오픈 소스 에이전트 하네스 TrueForge를 소개합니다.
- 비용 효율성 — 동일한 모델과 벤치마크에서 Claude 대비 토큰 사용량 63%, 비용 30% 절감함
- 모델 중립성 — 특정 모델에 종속되지 않고 OpenAI 호환 엔드포인트를 통해 다양한 모델 활용 가능
- 성능 최적화 — 컨텍스트 관리와 도구 호출 최적화를 통해 에이전트 루프의 효율성을 극대화함
- 오픈 소스 공개 — 벤치마크 방법론과 하네스를 공개하여 누구나 재현 및 검증 가능함
우리는 TrueForge라고 부르는, 모델에 구애받지 않는 오픈 소스 범용 에이전트 하네스를 개발해 왔는데, 이 하네스 자체가 실제로 얼마나 중요한지 궁금해졌어.
그래서 DevRev Enterprise-Bench에 있는 14개 태스크를 여러 하네스/모델 조합으로 돌려봤고, 블라인드 판정을 통해 각각 세 번씩 테스트했지.
가장 놀라웠던 결과는 이거야:
Claude Managed Agents + Opus 4.8:
11/14 태스크 해결 | 실행당 $11.8 | 실행당 1,000만 토큰
TrueForge + Opus 4.8:
11/14 태스크 해결 | 실행당 $8.6 | 실행당 370만 토큰
똑같은 모델, 똑같은 벤치마크, 똑같은 평균 해결률.
그런데 TrueForge는 토큰을 63%나 덜 썼고, 실행 비용도 30% 정도 더 저렴했어.
도구 사용량에서도 비슷한 차이가 났는데, TrueForge는 태스크당 평균 19번 도구를 호출한 반면, Claude Managed Agents는 32번이나 호출했거든.
이 차이는 에이전트 루프 자체에서 오는 거야. 턴마다 전달되는 컨텍스트를 줄이고, 압축하고, 도구 호출 횟수를 줄이고, 큰 출력물은 가능한 한 모델 컨텍스트에서 제외했으니까.
그다음엔 모델을 바꿔봤어.
TrueForge + GLM-5.2:
11.7/14 해결 | 실행당 $3.0 | 실행당 380만 토큰
이 벤치마크에서 Claude Managed Agents + Opus보다 평균 해결률은 살짝 더 높으면서, 비용은 75%나 더 저렴했지.
개인적으로 하네스를 모델 중립적으로 유지했을 때 얻는 가장 흥미로운 결과가 바로 이거라고 봐.
두 가지 독립적인 레버를 쥐게 되는 셈이지.
-
런타임을 더 토큰 효율적으로 만든다.
-
작업 부하에 맞는 가성비 좋은 모델을 골라 쓴다.
TrueForge 자체는 꽤 단순해. 에이전트 루프, 컨텍스트 관리, 도구/MCP, 서브 에이전트, 승인 절차, 지속 세션, 샌드박스 통합 같은 걸 처리하거든. MIT 라이선스고 OpenAI 호환 엔드포인트랑 다 작동하니까, 호스팅된 모델이든 직접 돌리는 모델이든 다 연결해서 쓸 수 있어.
아직 초기 단계이긴 해.
이 OSS 런타임에는 아직 제대로 된 트레이싱이나 평가 툴이 없어. 자체 코드 실행 샌드박스도 제공하지 않으니 직접 연결해야 하고, 컨텍스트 압축도 의도적으로 손실을 감수하는 방식이야.
그러니까 TrueForge가 지금 당장 성숙한 관리형 에이전트 플랫폼을 기능 하나하나 다 대체할 수 있다고 말하려는 건 아니야.
내가 흥미롭다고 생각하는 건, 핵심 런타임만으로도 이미 이런 태스크에서 경쟁력이 있고, 오픈 소스이면서 모델 중립적이고, 자기 인프라에 직접 배포까지 가능하다는 점이지.
벤치마크 하네스랑 방법론을 레포에 다 올려뒀으니까 직접 재현해 보고, 모델도 바꿔보고, 비교가 불공정하다 싶으면 우리한테 알려줘.
Repo:


