주말 동안 GLM-5.3-Flash API 무료 제공 - GPU 부하 테스트 도와주세요!
Free GLM-5.3-Flash API for the weekend - help me load test GPUs!
핵심 요약
작성자가 GPU 부하 테스트를 위해 GLM-5.3-Flash 모델 API를 주말 동안 무료로 공개함.
- 무료 API 공개 — 작성자가 GPU 부하 테스트를 위해 GLM-5.3-Flash 모델 API를 무료로 개방함.
- 기술 사양 — vLLM 기반으로 FP8 가중치와 데이터 병렬 처리를 적용하여 운영됨.
- 사용자 참여 유도 — 실제 환경에서의 에이전트 트래픽 테스트를 위해 자유로운 사용을 권장함.
- 보안 주의사항 — 테스트용 엔드포인트이므로 민감한 개인 정보 전송은 지양할 것을 당부함.
GLM-5.3-Flash 돌리는 테스트용 하드웨어가 좀 있는데, 이걸 좀 굴려보면서 부하 테스트를 해보려고 함. 뻔한 벤치마크 돌리는 것보다 실제 트래픽을 받는 게 훨씬 재밌을 것 같아서 말이지.
vLLM 위에서 native FP8 GLM-5.3-Flash weights를 돌리고 있고, 8-way 데이터 병렬 처리랑 전문가 병렬 처리(expert parallelism), 그리고 FP8 KV 캐시까지 적용해 놨음.
그래서... 내가 질리거나 서버가 불타버리기 전까지는 무료 API로 풀 거임.
OpenAI 호환 엔드포인트:
BASE_URL: https://api.cololocation.com/openai
API_KEY: sk-bf-0289c04f-e10e-4b67-9170-eef5c3d87632
MODEL: vllm/zai-org/GLM-5.3-Flash
가입 같은 거 필요 없음. OpenCode든 뭐든 마음껏 갖다 써봐. 잘 짜인 벤치마크 말고, 실제 환경에서 발생하는 지저분한 동시 접속이나 에이전트 트래픽에서 이 세팅이 어떻게 버티는지 보고 싶거든.
혼자서 서버 다 잡아먹는 꼴은 보기 싫어서 레이트 리밋은 좀 걸어놨는데, 그거 빼고는 마음껏 두들겨 패도 됨. 상황 봐서 조절할 예정.
쓰다가 속도 제한 걸리거나, 레이턴시 튀거나, 요청 실패하거나, 툴 콜링 문제 생기면 알려줘. 나한테도 다 데이터가 되니까.
그리고 당연한 소리지만: 이건 그냥 레딧에 올라온 아무나 쓰는 무료 엔드포인트임. 요청 로그는 다 꺼놨고 너네 데이터에는 관심도 없지만, 그래도 민감하거나 개인적인 정보는 보내지 마라.
주말 지나고 흥미로운 데이터 나오면 공유하겠음. 즐코하고 다들 잘 써봐!


