홈랩 운영 에이전트로 3대의 기기에서 파이(pi) 구동 중인데, 다들 어떤 로컬/API 모델 쓰시나요?
Running pi across 3 machines as a homelab ops agent - what local/API models are you all using ?
핵심 요약
홈랩 운영 에이전트를 위해 다양한 로컬 및 API 모델을 테스트 중인 작성자가 안정적이고 효율적인 모델을 추천받고자 합니다.
- 운영 에이전트 환경 — 백업, fail2ban, vaultwarden 등 자동화 작업을 수행하는 시스템 관리자 역할임.
- 로컬 모델 테스트 — Devstral, Qwen3-coder 등에서 발생한 도구 호출 오류와 Gemma 4의 의외의 성능을 공유함.
- API 모델 비교 — DeepSeek, Kimi, Qwen3-coder의 속도와 비용, 성능 차이를 분석함.
- 모델 추천 요청 — 안정적이면서도 비용 효율적인 에이전트용 모델을 찾고 있음.
다들 안녕,
내 환경부터 간단히 설명하자면, 집에서 기기 3대(24GB AMD, 16GB AMD, 12GB NVIDIA, 전부 Tailscale 연결)에 pi를 돌리고 있어. 내 셀프 호스팅 스택 전반을 관리하는 운영 에이전트 용도야. "웹앱 짜줘" 같은 용도가 아니라, 잠 안 자는 시스템 관리자 느낌이지. 백업, fail2ban, vaultwarden, 부동산 스크래퍼 같은 거 돌리는 용도임.
지난 이틀 동안 내가 돌릴 수 있는 모델들 전부 다 로컬이랑 OpenRouter에서 빡세게 테스트해 봤거든. 근데 "벤치마크 점수 높다고 장땡"은 아니더라고. 직접 에이전트로 굴려보니까 벤치마크는 별 의미 없다는 걸 뼈저리게 느꼈음. 그래서 다들 어떤 모델 정착해서 쓰는지, 왜 그걸 쓰는지 궁금해서 물어봐.
로컬 쪽은... devstral 24b는 두 번이나 뻗었어. 에러 메시지도 없이 그냥 작업 중간에 멈추고 다시 안 돌아옴. qwen3-coder 30b는 ollama로 툴 호출을 아예 못 해. 툴을 실행하는 게 아니라 그냥 텍스트로 툴 호출하는 법을 적고 앉아있어서 쓸모가 없더라. gemma 4 26b가 의외의 승자였는데, 기기 3대에서 다 깔끔하게 돌아가. 12GB 카드에서는 VRAM 다 못 채워서 시스템 램까지 끌어다 쓰는데도 문제없이 잘 작동함.
API 쪽(OpenRouter)은... deepseek v4 flash는 "내 정체성을 확인해 보겠다"는 말만 15k 토큰 동안 반복하면서 무한 루프 돌길래 그냥 강제 종료함. kimi k2.5는 꼼꼼하긴 해. 테스트하다가 내 스크립트에서 진짜 버그 2개 찾아냈거든. 근데 느리고 비싸. qwen3 coder next는 진짜 미친 듯이 빨라. 체감 속도가 5배는 빠른데, 캐시 읽기를 너무 많이 해서 결과적으로 셋 중에 제일 비싸게 나오더라.
다들 로컬이나 API 뭐 쓰는지, 왜 그걸 골랐는지 궁금해. 특히 성능 좋으면서 가성비까지 챙긴 모델 찾은 사람 있으면 공유 좀 해줘. 오늘 밤엔 성능이랑 가격 둘 중 하나만 골라야 하는 상황이라 좀 현타 오네 ㅋㅋ


