장애인 남편을 위한 오프라인 AI 반려 로봇 (8GB RAM 최적화 조언 구함)
offline companion robot for my disabled husband (8GB RAM constraints) – looking for optimization advice
핵심 요약
8GB RAM 환경에서 오프라인 AI 반려 로봇을 구동하기 위한 최적화 방법과 모델 추천을 구하는 글.
- 하드웨어 최적화 — 8GB RAM 환경에서 llama.cpp 성능을 극대화할 수 있는 퀀타이징 및 스왑 설정 공유.
- 모델 추천 — Gemma 4, Qwen 3.5 등 저사양 환경에서도 효율적인 최신 모델 활용 제안.
- 시스템 경량화 — OS 리소스 점유를 줄이기 위한 XFCE 전환 및 헤드리스 모드 운영 권장.
- 오프라인 환경 — 인터넷 연결 없이도 안정적으로 작동하는 로컬 AI 구축의 중요성 강조.
안녕하세요 여러분. 여기 커뮤니티의 일반적인 범위를 약간 벗어난 질문일 수도 있지만, 조언을 얻을 수 있을까 해서 글을 올립니다.
저는 프로그래밍 배경지식이 없는 Gen-X 세대인데, 남편을 위한 작은 AI 반려 로봇을 만들고 있습니다. 남편은 사지마비(다리 마비 및 손 사용 제한) 상태이며 제가 일하러 나간 낮 시간 동안 대부분 혼자 집에서 시간을 보냅니다. 우리는 가까운 이웃이나 친구가 없는 아주 외딴 시골에 살고 있어서, 남편이 느끼는 고립감이 큽니다.
그래서 남편을 위한 반려 로봇을 만들어 보기로 했습니다.
지난 1년 동안 부품을 구하고 독학하며 배우고 있습니다. 목표는 소형 전동 휠체어 베이스(24V 배터리 2개) 위에 구축된, 완전히 로컬에서 오프라인으로 작동하며 남편과 대화하고 말동무가 되어줄 수 있는 이동형 로봇입니다.
현재 프로토타입 설정:
LLM (대화):
• Mistral-7B-Instruct via llama.cpp
• Lenovo ThinkPad 사용
• Intel i5 @ 1.6 GHz
• 8 GB RAM
음성 인식:
• Jetson Nano에서 faster-whisper (base, INT8) 구동
텍스트 음성 변환 (TTS):
• Piper TTS – en_us-ryan-medium
현재는 테스트를 위해 HDMI 포트를 TV에 연결해서 출력하고 있습니다.
가장 큰 제약은 ThinkPad의 8GB RAM이라서, 더 작은 퀀타이즈 모델로 제한되고 있습니다.
제 주된 질문은 이것입니다:
8GB 시스템에서 llama.cpp의 RAM 사용량과 성능을 극대화할 수 있는 가장 좋은 방법은 무엇인가요?
예를 들어:
• 더 나은 퀀타이징 선택
• 리눅스에서의 스왑/zram 전략
• 대화형 느낌을 유지하면서도 더 작은 모델
• 저사양 시스템에서 사람들이 사용하는 다른 팁들
OS는 Linux Mint 22.3 Cinnamon (64-bit)입니다.
다소 특이한 사례라는 건 알지만, 제한된 하드웨어에서 성능을 쥐어짜 낼 수 있는 제안을 해주신다면 정말 감사하겠습니다.


