Slotstream, 48GB 맥에서 104GB Qwen3.8-Flash-Next를 약 12 tok/s로 실행
- Slotstream은 48GB Mac에서 104GB 규모의 Qwen3.8-Flash-Next를 약 12 tok/s로 실행한다고 밝힘
- 해커뉴스 토론자는 MoE 전문가를 Apple Silicon 통합 메모리에 일부 유지하고 SSD에서 나머지를 읽는 방식이
mlx-moe-offload,streamlx,mlx-moe,mlx-flash등 여러 저장소에 이미 있다고 지적함 - 작성자는 새 구현의 목적이 성능을 어디까지 끌어올릴 수 있는지 보는 실험이며, 저장소를 유지보수하겠다고 답함
- 토론에서 16GB M3의 Qwen3.6-35B-A3B 실행 성능으로 열 경고와 메모리 피크를 관리한 상태에서 7-8 tok/s라는 사례가 제시됨
- SSD 스트리밍은 모델 가중치를 읽기만 하므로 SSD 수명 문제를 일으킬 쓰기 작업은 아니라는 답변이 나옴
Hacker News opinions
이미 mlx-moe-offload, streamlx, mlx-moe, mlx-flash, deepseek-v4-flash-mlx가 같은 식으로 Apple Silicon의 통합 메모리에 상주 부분을 두고 SSD에서 MoE 전문가를 읽어 온다. 새 저장소를 또 만들기보다 기존 구현과 벤치마크하거나 MLX/MLX-LM에 합치는 편이 낫다고 봄.
오픈소스에서는 예전부터 비슷한 구현이 계속 나왔음. 아쉽지만 이상한 일은 아님.
나도 중복 문제는 동의함. 그래도 이건 얼마나 빠르게 만들 수 있는지 보는 개인 실험이고, 유지보수도 하겠음. 기존 구현을 복제한 게 아니라 처음부터 다른 관점으로 만든 시도라고 생각함.
올해 이런 식의 중복 프로젝트가 너무 낭비처럼 느껴짐. 협업할 역량이 있는 사람 외에는 각자 결과물을 내놓고, 같은 걸 하는 저장소만 잔뜩 늘어나는 분위기임.
여러 사람이 같은 문제를 처음부터 풀어보는 건 좋다고 봄. 기존 프로젝트의 방식에 갇히지 않고 다른 해법을 찾을 수도 있고, 디스크 스트리밍은 가능하지만 성능이 아직 충분하지 않다는 점도 드러남.
전력 소비량은 얼마인지 궁금함.
아직 전력은 측정하지 않았음. 넣겠음.
16GB 통합 메모리에서 5 tok/s가 나온다는 건 열 경고를 무시한 게 아니라면 믿기 어려움. 나는 16GB M3에서 Qwen3.6-35B-A3B를 돌리며 메모리 피크와 열 경고를 관리하면 7-8 tok/s 정도 나옴.
내 48GB M5에서는 더 큰 모델보다 컨텍스트가 필요함. Qwen3.8-27B-oQ4e-fp16-mtp로 71,680 토큰까지 잡았는데, rapid-mlx와 4비트 Qwen3.8-27B면 약 200k까지 된다는 얘기가 궁금함.
12 tok/s는 Claude와 비교하면 아직 거리가 큼. 완전히 같은 조건은 아니어도, 큰 메모리 탑재 하드웨어 가격까지 생각하면 쉽게 바꿀 선택지는 아님.
Flash-Next가 27B보다 코드 작업 등에서 정확히 무엇을 더 해결하는지 궁금함. 로컬 비코딩 에이전트라면 지시 이행과 도구 사용 성능 향상이 가장 큰 차이일 듯함.
SSD를 망가뜨릴까 걱정할 필요는 적어 보임. 이 방식은 쓰기가 아니라 읽기임.