CUDA 앱을 AMD GPU에서 돌리는 Windows 저장소 공개, ZLUDA와 ROCm/HIP 조합으로 RX 9060 XT에서 검증
- Speedstu가 Windows에서 ZLUDA와 ROCm/HIP를 묶어 CUDA 타깃 응용을 AMD GPU에서 실행하는 저장소 CUDA-for-AMD-Windows를 공개했고, 현재까지 RX 9060 XT(gfx1200, RDNA4) 한 장에서만 CUDA 지원 LibTorch 워크로드로 검증됨
- 저장소에 GPU 스캐너와 자동 감지를 추가해 AMD GPU 모델, gfxXXXX 아키텍처, ROCm/HIP 설치, 드라이버 정보, 프로젝트 검증 여부를 보고함
- 작성자가 RX 6000/7000/9000 카드로 테스트를 확장하려 하며, 저장소의 GPU 호환성 이슈 템플릿으로 성공과 실패 리포트를 받는다고 밝힘. 저장소는 현재 star 1개, 커밋 6개
- 댓글에서 RDNA1(5700 XT)은 WMMA, BF16, INT8 부재로 학습용으로 부적합하다는 지적이 나왔고, 중고 Radeon VII가 약 $260이라 그쪽이 낫다는 조언이 붙음
- 댓글에서는 HIP, SYCL, OpenCL 같은 개방형 표준으로 가야 한다는 요구와 함께, Nvidia의 해자는 언어가 아니라 디버거와 프로파일러를 포함한 전체 스택이라는 반론이 나옴
Hacker News opinions
Windows에서 CUDA 앱을 AMD GPU로 돌리는 셋업을 만들어봤음. ZLUDA에 ROCm/HIP를 얹는 방식이고, 내 RX 9060 XT(gfx1200)에서 CUDA 켠 LibTorch로 긴 학습까지 돌려봤음.
GPU 스캐너도 넣었는데 AMD GPU 모델, gfxXXXX 아키텍처, ROCm/HIP 설치 여부, 드라이버, 프로젝트 검증 여부까지 자동으로 잡아줌. RX 9060 XT면 gfx1200, RDNA4, HIP 감지, 검증 완료로 나옴. RX 6000이나 7000, 9000 카드 있으면 호환성 리포트 좀 부탁함.
옆길로 새지만 ZLUDA라는 이름 좋음. 폴란드어로 망상이나 기만이라는 뜻이라 딱 맞음.
RDNA1 카드로 CUDA 돌릴 방법이 있었으면 좋겠음. 내 5700 XT 두 장은 서랍에 처박혀 있음.
RDNA1은 별로임. WMMA도 없고 BF16, INT8도 없어서 페널티가 너무 큼. FP16도 패킹하고 풀어야 해서 카드를 몇 장 붙여도 대역폭만 갈아넣게 됨. 그냥 파는 게 나음. 중고 라데온 VII가 260달러쯤 하니까 그쪽에 7900XTX 얹는 게 훨 낫다.
나는 맥용으로 cuda-metal 만들었음.
그거 모델 뭐 돌아감?
딴 얘기지만 좀 짜증나는 게, 다들 HIP나 SYCL, OpenCL 같은 열린 표준에 집중했으면 좋겠음. LLM 추론 대부분이 닫힌 하드웨어에 닫힌 드라이버, 닫힌 SDK에서 도는 게 견딜 수가 없음.
나도 그러고 싶은데 그건 Khronos가 할 일이고, 미국 벤더들 사이를 묶는 데 계속 애를 먹고 있음. MLX나 MPS, ROCm 생태계가 너무 쪼개져 있어서 Nvidia를 위협할 수준이 안 됨.
SDK 쪽은 관심 모델을 에이전트한테 다시 구현시키고 가중치만 쓰는 건 어때? 요즘은 기성 구현을 참고용으로만 보고 Codex를 몇 시간 굴려서 내 환경에 맞게 더 빠르게 뽑아 씀.
AI가 Nvidia 해자를 무너뜨릴 거임. CUDA나 PTX를 HIP, SYCL, Metal로 옮기는 게 사소해지면 CUDA는 해자가 아니라 중간 표현이 됨.
그거 ZLUDA가 이미 하고 있는 거 아님?
이 분야 바깥 사람들은 클릭베이트 소리만 함. GPU 코드를 프로로 내본 적 없으면 이런 얘기 하지 마셈. 소스 언어는 한 번도 해자가 아니었음. Nvidia는 하이퍼스케일러에 팔고 그쪽은 셰이더쯤 손으로 옮길 사람이 널렸음. 해자는 전체 스택이고 앞으로도 그럴 거임. GPU 동기화 에러나 펌웨어 버그로 커널 패닉 디버깅해보고 형편없는 프로파일러랑 싸워본 적 없으면 무슨 말인지 모를 거임.
when, AI 얘기할 때 자주 나오는 키워드임. 항상 온다지만 영영 안 오는 것. 그동안 해자는 관성과 귀찮음 위에서 더 깊어지고 있고 Nvidia는 그걸 아주 잘 앎.