DeepSeek 4.1 Flash, 프런티어 모델과 구분 안 될 만큼 싸고 성능 좋다는 사용 후기
- DeepSeek 4.1 Flash는 한 달간 여러 프로젝트에서 쓴 필자가 Opus 5.5와 구분하기 어려울 만큼 성능이 좋고, frontier 모델보다 자릿수 단위로 저렴함
- OpenCode Go 월 10달러 구독으로 사용량이 사실상 무제한이며, 대부분 세션은 1달러 아래로 끝난다고 필자가 밝힘
- DeepSeek가 V1 대비 KV 캐시를 약 437배 줄여 GPU 메모리 부담을 낮춤, 필자는 이 덕분에 긴 코딩 세션도 1달러 아래로 묶인다고 설명함
- 필자는 자가 호스팅이 비용 면에서는 의미가 없다고 보지만, 프라이버시가 목적이면 캐시 최적화로 로컬 실행이 가능해질 것으로 전망함
- 필자는 중요한 작업에서 Opus 5.5로 최종 코드 리뷰를 맡기고, 수정은 DeepSeek가 실행하는 방식을 씀
Hacker News opinions
VRAM 표를 보면 FP16은 1,664GB, INT4도 416GB라 개인이 돌리긴 힘듦. GPU 값이 미쳐서 체감은 더 안 와닿음.
정치인이 램값 내린다고 하면 찍어준다는 심정임. 메모리 회사들 가격 담합 전력 있고 벌금도 수억 달러 냈음. 마이크론은 증산 대신 자사주 매입 중이라더라.
크기로 보면 Flash보다 Pro에 가까운 것 같음. 속도 빼고는 거의 Pro 급이라고 봄.
샘 올트먼 탓 하는 건 좀 과함. 메모리는 원래 계속 커져왔고 미국이랑 동아시아에 공장 증설 계획 많음. 내년쯤 64GB가 기본이 될 듯.
n-gram 테이블은 시스템 RAM이나 NVMe에서 스트리밍할 수 있어서 VRAM 전부 올릴 필요는 없음. 그래도 DGX Spark 한 대론 안 들어간다더라.
나도 DeepSeek v4.1 Flash 논문 기능 대부분 직접 구현해봤음. KV 캐시랑 압축 어텐션 덕에 환각이 적은 것 같다는 감은 있는데 테스트는 더 해봐야 함.
오픈 모델이라 제공자끼리 가격 경쟁함. 그래서 직접 안 돌려도 싸게 쓸 수 있는 거임.
기사는 로컬 얘기만이 아님. OpenCode Go나 OpenRouter로 API 호출하는 것 자체가 프런티어 랩한테 가격 압박이 될 듯함.
로컬이면 중고차 한 대 값이고, vast.ai 같은 데서 빌리면 훨씬 쌈. 프런티어 지능은 기대 말고 타협점으로 쓰기 좋음.
API로 빌려 쓰면 그 8장짜리 클러스터가 나 혼자 쓰려고 계속 도는 거임? FP16이면 1,664GB를 상시 점유하는 건지 궁금함.
DwarfStar 같은 프로젝트 덕분에 MoE 모델도 소비자 하드웨어에서 돌아감. 하드웨어 해자가 점점 얇아지는 중임.
1070ti 출시가가 450달러 안팎이었고 5070도 500~600달러대에 나왔음. 성능은 300% 차이인데 값은 비슷하니 GPU가 너무 오래 비쌌다는 말은 좀 과함.