초당 900토큰 출력 LLM 제공업체: 써보신 분 계신가요? 함정이 뭘까요?
LLM providers with ~900 tok/s output: has anyone tried them? What's the catch?
핵심 요약
초당 900토큰을 지원한다는 LLM 제공업체들의 실체와 성능에 대한 의문 및 사용자 경험 공유.
- 성능 의문 — 초당 900토큰이라는 수치가 실제 사용 환경에서도 유지되는지 검증 필요함
- 제공업체 비교 — 라우터 서비스와 개별 제공업체 간의 가격 및 속도 차이 분석
- 실제 사용 후기 — LithosAI 등 특정 업체의 고속 모드 성능 및 가격 경쟁력 확인
- 기술적 한계 — 캐시 적중률과 양자화 여부가 실제 성능에 미치는 영향 논의
다들 안녕.
토큰을 어디서 더 싸고 빠르게 살 수 있는지, 그리고 모델뿐만 아니라 제공업체(provider)는 어떻게 골라야 하는지 좀 알아봤거든. 그러다 Artificial Analysis라는 곳을 찾았는데, 여기 모델 정보뿐만 아니라 추론을 직접 하거나 모델 접근 권한을 파는 제공업체 정보까지 다 있더라.
내 이해가 맞다면 OpenRouter나 Opencode Go 같은 곳들은 직접 제공하는 게 아니라 그냥 라우터인 거지? 즉, 요청을 이쪽저쪽 제공업체로 전달만 해주는 역할인 거잖아.
근데 여기서 흥미로운 걸 발견했어. 몇몇 제공업체들은 엄청난 출력 속도를 자랑하더라고. 예를 들어 deepseek-v4-1-flash 모델의 경우, lithosai.com이나 inco.ai는 초당 900 토큰 정도 나온다고 주장함.
링크:
https://artificialanalysis.ai/models/deepseek-v4-1-flash/providers
내가 말하고 싶은 건, 이런 제공업체들에 대한 리뷰나 피드백이 아예 안 보인다는 거야. 다들 그냥 기본 라우터만 쓰고 제공업체 고르는 건 귀찮아하는 느낌이랄까.
질문:
-
lithosai.com이나 inco.ai, 혹은 다른 "빠르다"는 제공업체들 실제로 써본 사람 있어?
-
도대체 어떻게 그런 속도를 내는 거지? 뭐 숨겨진 함정 같은 거라도 있나?
-
왜 다들 직접 제공업체를 찾아보려고 안 하는 거야?
-
속도, 가격, 안정성 밸런스 괜찮은 믿을만한 제공업체나 라우터 추천해 줄 사람?
세 줄 요약:
DeepSeek 제공업체 중에 초당 900 토큰 나온다는 곳들을 찾았는데 리뷰가 하나도 없음. 써본 사람 있음? 이거 뭐 낚시인가?

