Strata, RTX 4090에서 Qwen3.8 Flash Next 125B를 초당 124 토큰으로 돌려
- GitHub의 Strata 저장소가 Qwen3.8 Flash Next 125B를 RTX 4090, 128GB DDR5, Ryzen 7950X3D 조합에서 초당 124 토큰으로 생성했다는 수치를 내걸었고, 스타 10.3k에 포크 915를 기록함
- 속도의 근거는 2비트 양자화(Q2)와 MoE 전문가 일부 제거이며, Coder 버전은 전문가 절반을 들어내 전체 모델 SWE-bench Verified 점수의 91%를 32GB RAM에서 냄
- 커뮤니티 벤치마크에는 RTX 2060 8GB에서 Q2_0이 128k 컨텍스트 기준 디코드 초당 33 토큰, 프롬프트 처리 초당 600 토큰을 냈다는 기록이 있음
- README와 커밋 상당수를 AI가 작성했고 Claude가 공동 저자로 표기됐으며, 설치도 docs/AI_SETUP.md를 따라 AI 에이전트에 맡기는 방식을 안내함
- 댓글에서는 정확도 수치가 빠져 있다는 점을 문제로 지적하며, 4비트는 성능이 유지되지만 2비트는 광범위하게 성능이 떨어진다는 논문(arXiv 2608.08188)을 근거로 들었음
Hacker News opinions
4090에 128GB DDR5, 7950x3d에서 돌려봤는데 124 tok/s 나옴. 생각보다 잘 돌아가서 공유함
그거 Qwen 3.8 27B랑 비교하면 어떤지 아는 사람 있음? 증류 모델이랑 풀 MoE 버전을 비교해보고 싶음
왜 놀라운 거임? 앤트로픽 모델보다 2.5배 빠른데 데이터 주권에 프라이버시까지 챙기니까 최선의 시나리오 아님?
Coder 버전은 3600x에 48GB 램, 3080에서 30 tok/s 나옴. 램이 2000MHz에 SSD도 구린데 크롬이랑 영상까지 켜놓고도 이 정도임. thinking은 low로 낮춤. 다른 작업은 Ornith 1.5 35B가 20 tok/s로 씀
그 숫자는 어떤 양자화로 나온 거임?
양자화 모델의 실효 지능을 계산해본 사람 있나? 양자화 벤치마크 공개가 표준이 돼야 함
README에 Coder는 전문가 절반을 제거하고 전체 SWE-bench Verified의 91%를 32GB 램에서 낸다고 적혀 있음
최근 논문 보면 4비트는 성능이 유지되는데 2비트는 광범위하게 망가짐. 이 저장소는 2비트에 전문가까지 뜯어냄
MoE 오프로드에서 생성 속도는 쉬운 절반임. 16k 컨텍스트에서 프롬프트 처리는 어떻게 나옴?
커뮤니티 벤치마크 공개돼 있음. RTX2060 8GB에서 Q2_0이 128k 기준 디코드 33 tok/s, 프롬프트 600 tok/s고 IQ3_XXS는 21 tok/s, 240 tok/s 나옴
AI한테 이 PC에 설치시켜 달라고 하라니. bash에 파이프하는 것보다 더 위험한 거 아님?
curl | bash가 보안상 왜 문제인지 모르겠음. 어차피 같은 도메인에서 소프트웨어 설치하는 거잖음
3090에서 돌려봤는데 진짜 빠름. PHP 코드베이스 보안 감사 정도는 잘 해냄
이거 또 Claude가 KV 캐시를 q4 이하로 양자화한 거 아님? README가 전부 AI 생성이라 안 적혀 있음
4090 같은 건 99%가 못 사는 하드웨어임. 크롬북이나 8GB 폰에서 뭐가 잘 돌아가는지가 궁금함
이 카드 MSRP가 $1600이었음. LLM 구독료를 대체하면 본전 금방 뽑음. 슈퍼컴에서 고급 PC로, 다시 $1600 그래픽카드로 내려온 것뿐임
저 VRAM 모델 얘기가 안 나오는 건 그냥 쓸모가 없어서임. Qwen3.8 27b가 좀 바꿨지만 24GB로도 부족함
Q2로 대충 양자화하면 당연히 빠르지. 전문가 절반 뜯어낸 Q1도 링크해뒀음. 장기 코딩은 추론이 필요한데 그게 안 되니까 공짜 점심은 없음
Q2 양자화면 관심 없음. 이런 100 tok/s 프로젝트는 다 똑같이 2비트 양자화이고 정확도 얘기는 어디에도 없음. 4비트가 하한선임
IQ3_XXS도 됨. 나는 Strata에서 60 tok/s 나오는데 llama.cpp에서는 21 tok/s였음. 출력도 더 나음
큰 모델은 Q2도 잘 버팀. Kimi K3 2비트 양자도 긴 컨텍스트에서 추론 잘 하고 일관성도 유지함
ds4도 이걸 지원함. 나는 q4 매일 쓰는데 잘 됨. GLM 5.3이랑 실사용 비교하면 어떨지는 모르겠는데, 그건 형편없음