오늘 Hugging Face 데일리 페이퍼들 아주 재밌게 읽었음
I enjoyed the daily HF papers today
핵심 요약
로컬 LLM과 에이전트 최적화 관련 흥미로운 Hugging Face 논문 3편을 공유함.
- KV 캐시 압축 — DeepSeek-V4.1-Flash의 FP4 및 교차 계층 재사용 기술을 다룸.
- 에이전트 루프 최적화 — SoL-Pi를 통해 에이전트 하네스의 토큰 사용량을 절반 가까이 절감함.
- 코딩 에이전트 설계 — 176가지 설정을 통해 에이전트 하네스 구성 요소의 기여도를 실증적으로 분석함.
HF Daily Paper에 올라온 상위 논문 3개, 로컬 LLM이나 에이전트 하네스 최적화 같은 최신 기술 파고드는 사람이라면 진짜 흥미롭고 재밌게 읽을 만해서 공유함.
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
https://huggingface.co/papers/2609.19969
Cross-layer KV 재사용이랑 FP4 KV 캐싱을 합쳐서 전체 KV 캐시를 토큰당 890바이트까지 줄였음. V4-Flash 대비 4분의 1 수준임.
SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
https://huggingface.co/papers/2609.20519
에이전트 하네스를 개선하는 자동 연구 루프인데, 성능은 그대로 유지하면서 토큰 사용량을 44.7%에서 49.0%까지 줄여버림.
An Empirical Study of Harness Design for Coding Agents
https://huggingface.co/papers/2609.20804
코딩 에이전트 하네스 설계에 관한 연구임. 계획 수립, 액션 스페이스, 컨텍스트 관리 방식을 176가지 설정으로 다 바꿔가면서 각 요소가 실제로 얼마나 기여하는지 싹 다 뜯어봄.
나도 아직 읽는 중인데, 다들 자유롭게 의견 좀 나눠보자.

