에이전트 검증 및 AgentHarness 평가에 최적화된 Apodex-1.0 소형 모델(0.8B, 2B, 4B 오픈 웨이트) 공개
Releasing Apodex-1.0 Smol Models (0.8B, 2B, 4B Open-Weights) optimized for Agentic Verification + AgentHarness Evals
핵심 요약
에이전트 작업의 검증 단계에 특화된 0.8B~4B 크기의 소형 모델 Apodex-1.0과 평가 프레임워크 AgentHarness가 공개되었습니다.
- Apodex-1.0 공개 — 에이전트 검증에 특화된 0.8B, 2B, 4B 소형 모델을 오픈 웨이트로 배포함.
- AgentHarness 프레임워크 — 에이전트 워크플로우를 로컬에서 단계별로 평가할 수 있는 도구를 오픈 소스로 제공함.
- 검증 특화 모델 — 대형 모델 대신 소형 모델을 사용하여 에이전트 루프 내의 팩트 체크 및 도구 호출 검증을 효율화함.
- 커뮤니티 피드백 요청 — 로컬 에이전트 워크플로우에서의 소형 모델 활용 및 최적화 방식에 대한 의견을 구함.
안녕 r/LocalLLaMA 형들,
이번에 Apodex 1.0을 출시했어. 메인 API랑 같이 우리 Smol 모델(0.8B, 2B, 4B) 가중치도 싹 다 공개한다.
우리 핵심 연구는 긴 호흡의 작업에서 **독립적인 검증(independent verification)**을 하는 거야. 단순히 파라미터 사이즈만 키워서 쌩으로 생성하는 게 아니라, 에이전트 루프 안에서 특정 하위 작업(출처 교차 검증, 가설 검증, 도구 기반 합성 등)을 처리하는 작고 특화된 로컬 모델들을 실험해 왔거든.
로컬 에이전트 워크플로우에 대해 형들 생각도 궁금해서 오픈 웨이트랑 평가 도구(evaluation harness)를 공유해.
🧠 셋업: 이 Smol 모델들은 어디에 쓰는 물건인가?
로컬에서 긴 호흡의 에이전트를 돌릴 때, URL 깨졌는지 확인하거나 정규식 검증하는 사소한 단계마다 70B 넘는 거대 모델을 돌리는 건 진짜 개비효율적이잖아.
그래서 우리는 이 0.8B, 2B, 4B 모델들을 우리 AgentOS 런타임 안에서 서브 에이전트로 작동하게끔 특화시켰어. 얘네는 다음 작업에 최적화돼 있어:
- 팩트 체크/교차 검증: 외부 텍스트 출력을 진실이 아니라 '주장'으로 간주하고 검증함.
- 실행 및 검증: 정확한 도구 호출을 생성하고, 메인 컨트롤러로 넘기기 전에 구조적 출력을 먼저 검증함.
📊 플래그십 모델 벤치마크 (참고용)
이런 검증 루프를 대규모로 돌렸을 때 전체 아키텍처가 어느 정도 성능을 내는지 보여주려고, 우리 플래그십 모델(Apodex-1.0-H) 점수를 가져왔어:
- DeepSearchQA: 94.4 | BrowseComp: 90.3
- HLE-Text: 60.8
- SuperChem: 74.2
- FrontierScience Research: 46.7 (프론티어 과학 추론은 우리 모두에게 여전히 빡센 병목 구간이지)
🛠️ 오픈소스 컴포넌트 & 로컬 평가
우리가 50단계 넘게 진행해도 에이전트 워크플로우가 엇나가지 않게 테스트하고 평가하려고 쓰는 프레임워크인 AgentHarness를 오픈소스로 풀었어.
오픈 웨이트 모델은 Hugging Face에 올렸고, 평가 코드는 GitHub에 있어.
(참고: 서브레딧 규칙 준수하려고 Hugging Face 링크, GitHub 저장소, 무료 얼리 액세스 웹 플랫폼은 아래 고정 댓글에 다 달아놨어.)

