SupraLabs가 200억 개의 토큰으로 학습된 초경량 50M 파라미터 모델 Supra-50M을 공개했습니다.
초경량 모델 — 50M 파라미터 규모로 교육용 웹 텍스트 20B 토큰을 학습함.
성능 벤치마크 — GPT-2(124M) 등 더 큰 모델 대비 여러 지표에서 우수한 성적을 거둠.
향후 로드맵 — 124M 및 350M 모델 출시를 통해 추론 및 코딩 능력을 강화할 예정임.
추론 효율성 — 싱글 GPU나 저사양 하드웨어에서도 매우 빠른 속도로 동작함.
SupraLabs가 새로운 모델을 출시했습니다! - Supra-50M
Supra-50M은 SupraLabs가 Llama 스타일 아키텍처를 사용하여 처음부터 구축한 50M 파라미터 규모의 소형 인과 관계 언어 모델(BASE 및 INSTRUCT 버전)입니다. 고품질 교육용 웹 텍스트 200억 토큰으로 학습되었습니다. 비슷한 규모의 오픈 모델들보다 훨씬 작음에도 불구하고, 여러 주요 벤치마크에서 경쟁력 있거나 더 우수한 결과를 보여줍니다. 이것은 저희의 첫 번째 SupraLabs Scaling Up Plan 모델입니다.
def build_prompt(instruction, input_text=""):
if input_text.strip():
return (
"Below is an instruction that describes a task, paired with an input "
"that provides further context. Write a response that appropriately "
"completes the request.\n\n"
f"### Instruction:\n{instruction}\n\n"
f"### Input:\n{input_text}\n\n### Response:\n"
)
return (
"Below is an instruction that describes a task. Write a response that "
"appropriately completes the request.\n\n"
f"### Instruction:\n{instruction}\n\n### Response:\n"
)
while True:
print("\nEnter an instruction (or 'exit' to quit):")
user_input = input().strip()
if user_input.lower() == "exit":
break
print("\nEnter additional context (optional, press Enter to skip):")
context_input = input().strip()
print(f"\nResponse:\n{generate(user_input, context_input)}\n")
써볼 시간이 없어서 궁금한 건데, transformer 버전은 너무 느려? 왜 GGUF를 찾는 거야?
6
내 생각엔 저분 사양이 좀 낮은 것 같아. 이 모델은 Ryzen 3 3200g에서도 엄청 빨라.
6
transformer는 한 번도 안 써봤어. 난 koboldcpp/Jan에서 llama.cpp 방식으로 넘어온 케이스라. GGUF 없는 모델들이 꽤 있어서 조만간 transformer도 써보긴 해야 할 듯. 노트북 생기면 transformer 지원하는(Jan/koboldcpp도 지원할걸) TextGen(Oobabooga) 한번 써보려고.
예를 들어, 내가 어제 올린 이 스레드, 1비트 버전 GGUF를 원했거든. 확실하진 않
5
수십억 파라미터 모델이면 양자화가 필수라 맞긴 한데. 1비트? 그건 불가능할 것 같은데. 근데 이 포스트는 수천만 파라미터 모델에 대한 거잖아. 양자화 필요 없어.