Codex + Halv: SWE-rebench 작업에서 정답당 토큰 51.1% 절감
Codex + Halv: 51.1% fewer tokens per correct answer on SWE-rebench tasks
핵심 요약
코딩 에이전트 워크스페이스인 Halv를 사용해 SWE-rebench 작업에서 토큰 효율성과 문제 해결 능력을 개선했다고 주장함.
- 성능 개선 — 정답당 토큰 51.1% 절감 및 작업 해결률 30% 향상함.
- 기술 스택 — 컨텍스트 압축, 코드 내비게이션, 출력 필터링 기술을 결합함.
- 작업 효율성 — 코딩 에이전트의 불필요한 컨텍스트 낭비를 줄이고 저장소 검색을 최적화함.
halv.ai
원문 사이트로 이동
Halv는 코딩 에이전트를 위한 데스크톱 워크스페이스인데, 쓸데없는 컨텍스트 낭비를 줄여주고 리포지토리 검색 효율을 확 높여줌. 동일한 20개의 SWE-rebench 태스크로 Codex에 Halv를 썼을 때랑 안 썼을 때를 비교해 봤음.
결과:
- 정답당 토큰 사용량 51.1% 감소
- 전체 토큰 사용량 30.2% 감소
- 20개 중 10개 태스크 해결 (Codex 단독 사용 시 7개 해결)
모델, 태스크, 검증기 전부 동일함. Halv는 컨텍스트 압축, Crux 코드 내비게이션, RTK 출력 필터링을 한데 묶어서 사용했음. 결과 다운로드해서 직접 확인해 봐도 됨. 방법론은 블로그에 다 나와 있음.
여기서 확인 가능: https://halv.ai


