antirez, 애플 실리콘 Metal에서 네이티브로 도는 MiniMax-H3 추론 엔진 h3.c 공개
- antirez(Salvatore Sanfilippo)가 만든 h3.c는 MiniMax-H3 모델을 Apple Silicon Metal에서 네이티브로 구동하는 추론 엔진임
- MiniMax-H3는 33B 파라미터 규모의 diffusion 기반 모델로 이미지+오디오, 임베디드 비디오+오디오 생성을 지원함
- 128GB M5 Max에서 이미지+오디오, 비디오+오디오 렌더링이 각각 74.58초, 76.99초에 끝나고 피크 메모리는 약 40.1GB, swap 없음
- HN 댓글에선 ComfyUI + GGUF quant(Q5_K_M, Q8_0)로 이미 M5 Pro 64GB에서 구동 중이지만 9초 클립 생성에 1시간 넘게 걸린다는 비교가 나오며 h3.c의 속도 개선 기대가 큼
- Minimax AMA에서 언급된 sparse attention 지원 여부가 논의되고 antirez가 --sparse-attention 옵션을 테스트 중이라는 언급이 있음
Hacker News opinions
이거 128GB 메모리 있어야 돌아가는거 아냐? 난 96GB밖에 없는데 혼자 소외되는 느낌이네.
README 보면 40GB 정도만 쓰던데? 모델 자체가 33B니까 96GB면 충분할듯.
M5 Pro 64GB로 ComfyUI에서 MiniMax H3 돌리고 있는데 진짜 잘 됨. city96의 ComfyUI-GGUF 노드로 Q5_K_M quant 쓰고, Q8_0은 34GB라 64GB면 해상도만 낮추면 돌아가. 근데 속도가 문제라 480x864 20스텝짜리 9초 클립 만드는데 한시간 넘게 걸려서 이 프로젝트로 속도 개선되면 기대됨.
내 M1 Max 64GB랑 비교하면 M5 Pro가 얼마나 빠른지 궁금하네.
DGX Spark가 LLM 작업에서는 밀리지만 diffusion 쪽에서는 좀 만회하는 지점이네, diffusion이랑 cuda는 땅콩버터랑 잼처럼 잘 맞잖아.
이거랑 비교할 대안이 뭐가 있는지, 이게 왜 더 나은지 좀 알고싶다.
Minimax AMA에서 H3가 sparse attention 지원 가능하다고 했는데 그러면 속도가 확 빨라질텐데 관련 소식 있나 궁금하네. H3 진짜 쿨함. (수정: reddit 글 보고 --sparse-attention 옵션 테스트 중)
128GB M4 Max Mac Studio에서 15초짜리 480p 비디오 생성하는데 한시간 반 걸리는데 Codex한테 배포 맡겨놨어. 속도 많이 빨라지길 바람.
결과 나오면 꼭 공유해줘!