llama.cpp가 curl 원라이너 설치 사이트 llama.app 공개, ollama와 정면 경쟁 구도 형성
- llama.cpp 프로젝트가 "curl -LsSf https://llama.app/install.sh | sh" 한 줄로 설치되는 공식 사이트 llama.app을 새로 공개함
- Pi라는 로컬 코딩 에이전트와 "llama serve" 후 pi-llama 플러그인 설치로 API 키 없이 로컬 모델을 자동 연결하는 워크플로를 지원함
- Qwen 3.6, Gemma 4, GPT-OSS, Gemma 3 등 최신 오픈 모델을 Apple Silicon부터 H100, MI300까지 하드웨어별 커널로 바로 실행 가능하게 제공함
- 해커뉴스 댓글에서는 curl 파이프 설치 방식에 대한 보안 우려와, ollama가 llama.cpp를 백엔드로 쓰면서도 제대로 크레딧을 주지 않았다는 비판이 나옴
- Framework 13 노트북에서 최근 PR 하나가 AMD ROCm 지원을 깨뜨렸는데 한 달 가까이 수정되지 않고 있고, LM Studio의 ROCm 런타임도 같은 문제를 겪고 있음이 지적됨
Hacker News opinions
url 처음 봤을 때 좀 의심스러웠는데 llama.cpp 깃허브에도 링크돼 있더라, llama.pages 저장소도 확인했는데 llama.app으로 링크 걸려 있음. curl 파이프는 여전히 못 믿겠지만 사이트 자체는 진짜인듯
Arc A770에서 돌려보려는데 OpenVINO 지원 넣은 바이너리가 없어서 직접 빌드했다가 이틀 걸리고 실패함
이틀이면 너무 오래 걸린 거고, llama.cpp랑 openvino 둘 다 요즘 CPU면 몇 분이면 컴파일 끝남
curl로 bash에 바로 꽂는 설치 방식 자체가 좀 꺼려짐, git clone하고 cmake로 빌드하는 게 몇 줄이면 되는데 왜 이렇게까지 하는지 모르겠음
러스트 설치도 그렇고 curl|bash가 점점 표준처럼 되는 중인데, 어차피 로컬 LLM에 에이전트 돌릴 사람이면 그게 제일 큰 보안 문제는 아닐듯
https만 되고 믿을 만한 저자면 다른 설치 방법이랑 뭐가 다른지 모르겠음, 결국 신뢰 문제일 뿐
git clone이 안 어려운 건 이미 방법을 아는 사람 얘기고, 쉬운 설치가 제품 흥망을 가르는 경우가 많음, ollama가 그걸 증명한 사례라고 봄
github 릴리즈에 배포별 미리 빌드된 바이너리도 있고 homebrew, arch 리포지토리에도 올라와 있어서 꼭 컴파일할 필요는 없음
M3 pro 18GB로 Gemma 3 12B는 돌릴 수 있을 것 같은데, 이 정도 작은 모델로 코딩 이상의 뭘 할 수 있을지 궁금함
Qwen3.6-35B-a3b를 양자화하면 gemma 12b랑 비슷한 메모리로 돌아가면서 더 똑똑하고, 세밀하게 지시하면 코딩도 됨
llama.app은 결국 ollama.com이랑 직접 경쟁하는 구도인듯, llama.cpp가 유저 경험을 직접 갖고 싶어했던 거로 보임
ollama는 llama.cpp를 백엔드로 쓰는데 체감상 더 느리고, llama.cpp는 이미 llama-server로 웹UI를 오래전부터 갖고 있었음
ollama가 llama.cpp에 제대로 크레딧도 안 준 거로 유명했음, 사실상 래퍼일 뿐인데
ggerganov랑 팀이 새 모델 지원을 빠르게 넣으면서도 품질 유지하는 거 보면 로컬 추론은 llama.cpp가 제일 나은 선택임
70B120B급이면 llama-server 아니면 vLLM 정도가 진지한 선택지고, 27B35B급은 그 밑에서 커버됨
맥에서는 MLX가 llama.cpp보다 성능 낫다고 들었는데 OS 종속적인 얘기 아닌가 싶음
이건 Meta랑 관련 없냐, llama라는 이름 쓰는데 어디에도 attribution이 없어서 상표권 문제 있을 것 같은데
ggml-org의 llama.cpp고 Meta랑 무관하며 몇 년째 이 이름으로 존재해왔음, 메타도 알면서 문제 안 삼는 걸 보면 상표 위반 아니거나 신경 안 쓰는듯
Framework 13에서는 잘 쓰고 있는데 최근 PR 하나가 ROCm 지원을 깨놓고 한 달째 안 고쳐지고 있고, LM Studio도 자체 ROCm 런타임이 같은 AMD GPU를 인식 못 해서 결국 Vulkan으로 우회해야 함
ollama가 llama.cpp를 쓰는 거라 llama.cpp가 ollama보다 나은지 아닌지가 아니라 사실상 같은 엔진 문제임