Qwen, Qwen4 선행 구조 담은 6B 활성 MoE Flash-Next 가중치 공개
- Qwen이 Qwen3.8-Flash-Next 가중치를 공개함. 주 모델은 125B 파라미터 MoE이고 토큰당 6B를 활성화하며, 별도 N-gram 임베딩 파라미터 51B를 더함
- Qwen은 Qwen3.7-Plus와 비교해 학습 비용을 약 1/9로 낮추고 코딩·오피스 작업 성능을 높였다고 밝힘. DeepSWE 1.1은 58.7, SWE-bench Pro는 62.5, CoWorkBench는 73.9점으로 제시함
- Gated DeltaNet으로 이력을 압축하고 Qwen Sparse Attention이 마이크로 블록 단위로 문맥을 고르는 하이브리드 어텐션을 사용함. Qwen은 이 구조가 Qwen4 계열에 쓰일 초기 공개판이라고 설명함
- 잔차 스트림을 4개 분기로 넓히고 동적 게이트로 읽기·쓰기를 조절하는 Gated Residual을 도입함. 로컬 문맥으로 N-gram 테이블을 찾는 임베딩은 호스트 메모리에 내리고 비동기 사전 적재할 수 있음
- 기본 문맥 길이는 262,144 토큰이고 YaRN으로 100만 토큰까지 확장됨. QwenCloud의 100만 토큰 기본 서비스는 입력 100만 토큰당 $0.16, 출력은 $0.47로 책정됨
Hacker News opinions
DeepSeek V4 Flash보다 나아 보임.
활성 파라미터가 작은 MoE인데도 벤치마크 수치가 꽤 인상적임.
Qwen 소식을 매일 속보처럼 올릴 필요가 있나 싶음.
Qwen4를 예고하는 새 구조고, Qwen3.7-Plus의 약 1/9 학습비로 전반적 성능을 넘었다는 주장이라 이번 건은 다름.
AMD AI나 애플 맥에서 로컬로 돌리는 사람에게는 앞으로 몇 달 작업에 블로그 글보다 더 직접적인 소식임.
Qwen3.6 35B A3B에서 넘어갈 만한 릴리스 같음. 메모리는 충분하지만 연산이 약한 환경에 맞을 듯하고, 6장 Nvidia L4에서 vLLM로 돌릴 수 있을지는 직접 시험해봐야겠음.
이번 모델은 Qwen4 구조의 미리보기라는 점이 흥미로움. N-gram을 처음 공개 적용한 듯하고, 27B보다 빠르고 싸게 서빙할 MoE라 맥이나 Strix Halo 같은 대체 연산 장비에도 맞을 것 같음.
3.8 27B를 이렇게 확실히 이길 줄은 몰랐음. 2026년 8월에 5천 달러 맥북에서 초당 30토큰으로 Opus 4.6 Max급을 자가 호스팅한다는 얘기는 꽤 놀라움.
그 비교는 싫음. 인상적인 모델이어도 더 큰 모델 수준의 세계 지식을 전부 가진 건 아니고, 지능의 상당 부분을 가져온 쪽에 가까움.
호스팅 모델과 비교하면 GPT 5.6 Luna는 DeepSWE 67%, 이 모델은 59%임. Luna 가격은 입력과 출력 각각 \1.20이고 Qwen은 \0.47임.
내 홈랩에는 넣어볼 생각임. 작은 모델처럼 과하게 생각하지 않고, 좀 더 직접적으로 추론했으면 좋겠음.
중국 모델은 이제 원시 벤치마크 점수보다 토큰 효율 분석이 먼저 궁금함.
테스트 시점 연산에서 이른바 과잉 사고는 모델이 여러 번 처리하며 활성화 잔차를 다듬는 부분도 큼. 사고 토큰을 의미 없는 점으로 채워도 성능이 오르는 연구가 있음.
실사용에서는 과잉 사고가 작업마다 다르더라. 열린 문제에서는 Qwen이 재검토를 많이 하지만, 요구사항이나 절차가 분명하면 짧고 직접적으로 답해서 전체 작업 완료 시간이 늘었다고 느끼진 않았음.
지금은 llama.cpp나 vLLM 메인 버전에서 쉽게 돌리기 어렵더라. 새 아키텍처 지원이 아직 없었음.
vLLM 전용 릴리스와 실행 레시피는 이미 나왔음. llama.cpp와 vLLM 메인라인 지원도 1일에서 3일 안에는 들어갈 듯함.
DeepSeek Flash보다도 가격이 낮아 보였는데, 게시글 하단 수치를 다시 보니 DeepSeek 0723은 100만 토큰당 입력 \0.075라 Qwen보다 쌈.
Unsloth Desktop에 올라왔고 1비트 양자화본은 72.5GB임. 다만 llama.cpp가 아직 GGUF 아키텍처 qwen4exp를 지원하지 않아 업데이트를 기다려야 함.