코딩 테스트: Strata
Tested in Coding: Strata
핵심 요약
Strata를 사용한 코딩 테스트 결과, 속도는 향상되었으나 잦은 환각과 코드 오류가 발생하여 실무 적용에는 신중해야 한다는 평가입니다.
- 성능과 정확성 — 속도는 빨라졌지만 샘플링 문제로 인한 환각과 코드 오류가 빈번함
- 자동화의 필요성 — Strata 사용 시 철저한 자동화 테스트와 QA 프로세스가 필수적임
- 양자화 영향 — 낮은 비트 양자화가 모델의 추론 능력과 정확도에 악영향을 줄 수 있음
- 향후 기대감 — 기술적 잠재력은 높으나 현재는 초기 단계로 안정성 개선이 필요함
아마 욕 좀 먹을 글이 될 것 같은데, 그래도 팩트 기반으로 솔직하게 적어볼게. 바로 본론으로 들어간다.
내 이전 'Tested in Coding' 시리즈를 본 사람들은 알 거야:
https://www.reddit.com/r/LocalLLaMA/comments/1vvsokm/tested_in_coding_q8_k_xl_qwen38_27b_vs_bf16/
배경
오해 없게 말하자면, 난 토큰 생성 속도에 목매는 사람이 아니야. 난 llama.cpp를 써서 Qwen3.8-Flash-Next-UD-IQ3_XXS 모델을 Q8_0 KV-캐시로 돌리고 있고, 평균 30~40t/s 정도 나와. 프리필(Prefill)은 530t/s로 느린 편인데(이 서브레딧 글들을 보니 정상인 듯해). VRAM 한계 때문에 Flash Next는 llama.cpp에서 220,000 컨텍스트로 돌리고 있어.
일단, 난 뭘 새로 써보기 전에 무조건 조사하고 공부부터 해. Strata용 샘플링 파라미터를 제대로 설정 안 했을 때 생기는 문제들도 다 파악했지. 이번 리뷰를 위해 Strata에서 temperature 0.7~1.0, top_p, 심지어 presence_penalty랑 frequency_penalty까지 온갖 샘플링 설정을 다 테스트해 봤어.
업데이트 참고: 완전한 테스트를 위해, Strata에서 돌린 모델은 Qwen3.8-Flash-Next-UD-IQ4_XS, Q8_0 KV-캐시였어.
Reasoning은 llama.cpp랑 Strata 둘 다 xhigh로 설정했어.
둘째로, 내 커스텀 하네스는 자동화(24시간 논스톱 코딩)되어 있고 튜닝도 잘 되어 있어서(압축은 60초 안에 끝남) 업무 시간 외에는 내가 직접 모니터링해. Flash Next가 내뱉는 추론 과정이랑 코딩 결과물은 전부 다 읽어본다고.
주요 사건
12시간 동안 코딩 돌려본 결과, 발견한 문제점들은 다음과 같아:
# 주요 사건 1
릴리즈용 실행 보고서를 작성하자마자, 자기가 보고서를 만들었는지 헷갈려함:
"잠깐, 아까 툴 결과에 'Task #XXXXX 보고서가 생성되었습니다'라고 떴던가? 내가 진짜 만든 건가? 확인해 보자. XXXXXXXX.txt / XXXXXX.txt를 다시 생성하고 npm test 베이스라인(post + post2 CLEAN)을 돌린 다음에 보고서를 썼나? 압축 후 메시지들을 다시 보자. 테이블/세부 정보 만들고 읽은 다음에, post npm test를 돌리고, 그다음 분류기(처음엔 NEEDS REVIEW, e2e는 그린, 그다음엔 post2 CLEAN), 마지막으로 fitness ALL GREEN… 내가 압축 후에 post/classifier/fitness 작업을 다 하긴 한 건가?"
# 주요 사건 2
툴 출력값을 읽다가 환각 증세 보임:
"아까 glob 출력값은 분명 XXXXXXXX...였는데, 읽기 툴은 파일을 찾을 수 없다고 하네... 똑같은 glob을 다시 돌려도 같은 경로가 나와. 근데 왜 첫 번째 읽기 시도는 ...XXXXXXXXXXXX에서 실패한 거지?? 잠깐, 내가 보낸 Read 명령어에는 XXXXXXX\ 경로가 있었는데 — '파일을 찾을 수 없음'이라고 떴어. 근데 glob은 그 경로를 반환하잖아. 내가 오타를 냈나? 내가 보낸 건 XXXXXXXXX였나...? 내가 보낸 건 \20260\였지, \202605\가 아니었어!! 맞네, '5'를 빼먹었어. 올바른 디렉토리로 다시 시도해야지.


