M5 Ultra Mac Studio 리뷰: 256GB 통합 메모리로 로컬 AI 에이전트를 돌린다
- MacStories가 M5 Ultra Mac Studio(256GB 통합 메모리)를 나흘간 테스트하고 로컬 AI 에이전트용 머신이라고 평가함. 작성자는 Qwen3.8-Flash-Next를 Open Minis와 Hermes Agent의 기본 모델로 바꿨음
- Qwen3.8 27B 토큰 생성 속도(8K/64K/128K/256K 컨텍스트): RTX 5090 59/51/44(256K 미지원), M5 Ultra 48/39/32/24, M3 Ultra 31/23.5/20/15 tok/s
- 512GB 메모리 옵션이 10월에 풀리고 2TB 저장 모델은 $15,000를 넘을 전망. 댓글은 이 가격이 OpenAI Pro 12년치 구독료와 맞먹는다고 지적함
- 댓글 다수는 5090이 VRAM 32GB라 GLM Flash나 Qwen Next 같은 큰 모델이 올라가지 않지만 256GB Mac Studio는 가능하다고 봄. dense 27B 비교 자체가 부적절하다는 반론도 나옴
- M7 Ultra가 2028년 1.5TB 통합 메모리로 나와 Nvidia Blackwell급 AI 성능을 노린다는 Mark Gurman 보도가 인용됨
Hacker News opinions
$12,299면 월 200불씩 토큰 사서 5년 쓰는 돈인데 5090 PC는 그 절반이잖아. 토큰 가격이 오르면 자체 하드웨어가 싸질 수도 있겠지만 글쎄.
내가 관심 있던 숫자는 아래 차트에 숨어 있더라. 8K/64K/128K/256K에서 5090이 59/51/44, M5 Ultra가 48/39/32/24, M3 Ultra가 31/23.5/20/15임. M3에서 M5로 오면서 프롬프트 처리량이 확 뛰었고 GLM 5.3-flash는 로컬에서 30 tok/s 정도 나옴.
dense 27B는 Mac에 맞는 모델이 아님. 대역폭은 낮고 메모리는 많은 환경엔 MoE가 훨씬 낫지.
5090 수치가 너무 나쁘게 나왔는데. ninfer에 NVFP4랑 MTP 쓰면 200 tok/s 넘김.
Apple이 TTFT 지표 개선에 실리콘 설계를 집중했으면 좋겠음. M3 Pro에서 넘어와도 5090 TensorCore에 비하면 뒤처져 보임. 인수 한 번이면 균형이 바뀔지도.
M5 Ultra의 진짜 강점은 5090이 못 올리는 큰 모델을 돌린다는 거임. Nvidia가 VRAM으로 시장을 갈라놓는 게 6000 Pro가 1만 5천 달러를 넘긴 이유고, 5090 후속은 2028년이나 2029년에나 나올 듯.
5090은 600W 넘게 먹는데 Mac Studio는 절반 수준임.
27B dense로 비교하면 5090이 불리할 수밖에 없음. Qwen3.8 Next를 5090 32GB에 올려서 TPS 재보면 거의 0에 가까움.
내 m5 max에서도 dflash 붙이면 27B가 256k 컨텍스트에서 75tps 나옴. 8k에선 80부터 시작하고. 기본 수치만 보고 판단하면 아쉬움.
512GB 옵션은 10월에 풀리고 4~6천 달러 더 붙어서 2TB 구성이면 1만 5천 달러를 넘음. OpenAI Pro 12년치 가격임.
로컬 AI가 돈을 아껴준다고 생각하면 실망할 가능성이 큼. 쓸 만한 모델을 돌리려면 비용은 이유가 못 됨. 다른 이유는 많지만.
512GB는 별로임. 가중치가 그만큼 커지면 심하게 느려져서 256이 스위트 스팟임.
테스트한 모델이 구성대로면 18k인데, 이걸 보고 5090이 좋은 딜처럼 보일 줄은 몰랐음.
macOS가 발목 잡는다는 말엔 동의 못 함. 리눅스식 툴링은 macOS에서도 거의 다 됨.
개발자가 쓴 리뷰가 아니라서 로컬 모델로 20x 구독만큼 생산성이 나오는지는 아직 모름. 새 하드웨어 커널에 남은 최적화 여지도 궁금함.