Cloudflare, Kimi와 GLM 모델에 KV 캐시 FP8·가중치 INT4 양자화 적용해 메모리 절반으로
- Cloudflare가 Moonshot의 Kimi K2.6과 Z.ai의 GLM 5.2 모델을 SGLang 기반으로 서빙하면서 KV 캐시를 16비트(BF16)에서 8비트 부동소수점(FP8)으로 양자화해 캐시 크기를 절반으로 줄임
- Kimi K2.6 기준 FP8 KV 캐시 적용으로 GPU에 저장 가능한 컨텍스트가 약 68만6천 토큰에서 137만 토큰으로 2배 늘어남
- 동시 요청 64개 기준 FP8 캐시는 초당 2,192토큰을 처리해 BF16 최대치(32개 요청, out of memory 직전) 대비 약 41% 높은 처리량과 약 30% 낮은 토큰당 비용을 달성함
- GLM 5.2의 가중치를 FP8에서 INT4로 압축해 체크포인트가 705GB에서 421GB로, 8-way 텐서 병렬 배치 시 GPU당 메모리가 88GB에서 52GB로 줄어 같은 하드웨어에서 약 118만 토큰의 KV 캐시 여유가 생김
- GSM8K, MMLU 등 평가 스위트에서 FP8/INT4 양자화 전후 정확도 차이가 거의 없었으며, 동시 요청 1개 기준 INT4 가중치는 FP8 대비 디코딩 속도가 55% 빨라짐
Hacker News 의견들
글 읽다가 "It's worth being precise about where the benefit comes from, because it isn't raw speed" 이 문장에서 AI 냄새 감지기 딱 울리더라. AI 글 자체는 좋아하는데 읽는 건 진짜 싫음
저건 하도 자주 나와서 이제 댓글 달기도 지침. 여기 글 절반이 저런 식이라 AI 생성 문체 필터링 기능 있었으면 좋겠음
Cloudflare 블로그는 애초에 사람이 읽으라고 쓴 게 아니라 에이전트가 걸러 먹을 원자재용임. The Atlantic보다 더 뻥튀기된 분량이라 나도 잘 안 읽음
KV 캐시 양자화 얘기를 투명하게 공개한 건 좋은데, 다른 프로바이더들은 조용히 양자화해놓고 미양자화 가중치만 홍보하는 거 아닌가 의심스러웠음. 근데 여기도 테스트가 코딩 벤치마크 없이 부실함, Kimi K2.6 하나만 테스트한 것도 아쉬움
vLLM 쪽 연구도 FP8이 LiveCodeBench 포함해서 정확도 손실 거의 없다고 결론냈더라 참고할만함
"답이 전혀 안 바뀐다"는 건 너무 센 주장 아님? 토큰 확률 분포 사이 통계적 거리라도 계산해서 보여줬어야지, 안 그러면 그 주장 그대로 믿기 어려움
가격 페이지 링크 눌렀는데 대시보드로만 연결되고 실제 가격이 안 보임, 이게 뭐임
openrouter에 cloudflare 프로바이더 가격 정리되어 있음
모델 양자화해놓고 블로그에만 살짝 언급하고 모델 페이지엔 경고 하나 없음. 그러면서 벤치마크는 컨텍스트 짧은 태스크로만 돌려서 차이 없다고 포장함. 코딩 에이전트는 KV 양자화로 타격 클 텐데 이거 사실상 사기 아니냐
가중치 양자화랑 활성화(캐시) 양자화는 다른 얘기니까 그렇게까지 몰아붙일 건 아닌 듯
이런 GPU 서빙 최적화하는 직군 타이틀이 보통 뭐임? SRE/인프라 쪽에서 GPU 지식 얹은 사람들이 헤드카운트 제일 많음, 리눅스 시스어드민+네트워킹+스케일링+장애대응이 기본임
INT4 말고 bitsandbytes의 nf4 같은 더 나은 4비트 포맷도 있는데 왜 굳이 int4를 썼는지 궁금함
Cloudflare가 ZDR(제로 데이터 보존) 옵션을 추론에 제공 안 하는 게 제일 수상함. 트래픽 다 MITM 시키더니 이제 AI 대화까지 추적당하는 꼴임