CPU에서 59 t/s로 구동되는 POCKET-35B 에이전트 모델
POCKET-35B agentic model on cpu 59 t/s
핵심 요약
GPU 없이 CPU에서 35B 모델을 구동한다고 주장하는 POCKET-35B 모델에 대한 소개와 성능 논란.
- 모델 성능 — CPU 환경에서 59 t/s의 빠른 속도로 구동 가능함.
- 하드웨어 요구사항 — GPU 없이 일반 PC나 스마트폰에서 실행됨.
- 기술적 논란 — 고도로 양자화된 MoE 모델로 실제 35B 연산량과는 차이가 있음.
- 다양한 라인업 — 기기 사양에 맞춰 선택 가능한 여러 GGUF/MLX 버전 제공.
https://huggingface.co/FINAL-Bench/POCKET-35B-GGUF
GPU 없이 PC에서, 심지어 스마트폰에서도 돌아가는 35B 모델. 순수 llama.cpp 사용. 포크(fork)도, CUDA도, 클라우드도 필요 없음.
POCKET 라인업 — 기기에 맞춰 선택하세요
| Repo | File | Size | Runs on | Best for | Korean PPL* |
| --- | --- | --- | --- | --- | --- |
| **POCKET-35B-GGUF** | `Q4_K_M` | 21 GB | PC / server (32 GB RAM) | top quality | **5.79** |
| **POCKET-35B-GGUF** | `Q2_K` ⭐ | 13 GB | mini-PC, no GPU | **daily driver** | 6.49 |
| **POCKET-35B-GGUF** | `IQ1_M` | 8.2 GB | 16 GB RAM box | smallest full model | 9.69 |
| **POCKET-KR-GGUF** | `IQ2_M` | 5.1 GB | Android 8 GB+ | 🇰🇷 Korean phone | 7.95 |
| **POCKET-KR-MLX** | 2-bit | 5.1 GB | 🍎 **iPhone / iPad / Mac** | 🇰🇷 Korean, Apple-native | 7.95 |
| **POCKET-EN-GGUF** | `iPhone-mix` | 5.3 GB | 🍎 iPhone (PocketPal) | 🌍 English phone | — |
| **POCKET-EN-GGUF** | `PC-mix` | 6.8 GB | PC / Android | 🌍 English, best quality | — |
