GLM 5.3 Flash 한 달 챌린지, 2B 토큰 중 절반만 지켜지고 에너지 사용은 계획의 3.5배
- Wagtail 개발팀이 9월 한 달을 GLM 5.3 Flash로만 코딩하는 실험을 했지만, 전체 2B 토큰 중 목표 모델 몫은 50%(1B)에 그침
- 목표 모델 사용분은 $68, 4kWh, 365g CO2로 예산 안이었으나, 프로토타입에 non-Flash 모델을 잘못 골라 하룻밤에 450M 토큰 / $150 / 5kWh를 씀
- 추론 제공자 용량 부족으로 GLM 5.3 Flash 성능 저하가 나타나 DeepSeek V4.1 Flash, Qwen 3.8 Flash로 갈아탐
- Wagtail 작업 벤치마크에 참여한 14개 모델 중 DeepSeek V4.1 Flash가 정확도 95%, 작업당 14.9Wh, $0.09로 앞섬
- 10월 계획으로 에너지와 비용 상시 측정, 실험 예산 편성, 오케스트레이터/스카우트/구현/리뷰어 에이전트 분리를 내걺
Hacker News 의견들
솔직히 좀 무모한 챌린지였는데, 뭐가 실제로 사용량과 비용을 만드는지는 확실히 배웠음
Flash랑 non-Flash 비교는 어땠어? 작업을 나눠서 쓴 거야?
한 달 더 남으면 DeepSeek v4.1 flash랑도 비교해봐
Flash는 코더로 꽤 괜찮은데 플래너랑 리뷰어를 붙여야 함. 나는 astra low로 플래닝, sol 6.1 medium으로 리뷰 돌림
그럼 오픈 웨이트로 남기려면 뭘 쓰겠어?
나는 플래닝이랑 리뷰도 Flash로 하는데 이름과 달리 실행엔 너무 느림. z.ai 구독이라 직접 호스팅은 안 함
솔직히 이해가 안 감. 뭐가 잘못된 선택이었고 어떤 모델이 나았을까?
글 쓴 사람인데, 챌린지 대상은 GLM 5.3 Flash였고 바이브 코딩 빌드는 전부 non-Flash로 돌렸음. 한 세션이 월 지출의 4분의 1, 예산의 150%였는데 그냥 눈치를 못 챘음
에너지 사용량은 어떻게 측정한 거야?
Neuralwatt에서 GPU 에너지만 받음. 토큰보다 모델 효율이 훨씬 잘 보임
4kWh면 전체 비용의 1%밖에 안 됨. EV로 15마일, 물 10갤런 끓이는 정도라니 데이터센터 과잉 건설이라는 생각이 듦
나도 사용량이 무섭게 늘고 있음. 두 달 전엔 토큰을 10분의 1로 썼는데 이번 달은 추론에 30kWh 씀
그건 변동 직접 에너지만 아님? 데이터센터 건설, 냉각, 칩 생산, 유휴율은 안 들어갔잖아
중국이 AI 에너지 효율에서 앞서 있는 것 같음. aidatacenterindex.com에서 미국이랑 비교한 게 있더라
평범한 사람 차가 50% 덜 효율적이 되면 난리 나겠지
공급이 제약이고 추론 비용을 내는 가구는 3%뿐이라 앞으로 더 늘어날 수밖에 없음
데이터센터 환경 공포는 과장됐음. 재택근무 하루면 일주일치 AI 사용을 상쇄하고 물 사용은 골프장 하나 수준임
1.21GW 데이터센터 하나는 5.5W 쓰는 사용자 2억 명분임. 글에서 GLM 5.3 전체 모델은 10~100배 범위라고 했으니 말이 안 되는 얘기도 아님
규모가 커지면 환경 영향은 생김. 다운사이드는 중앙에 모으고 업사이드는 나눠주니까 문제가 가려지는 것뿐임
나는 Qwen3.8-Flash-Next 쓰는데 계획만 제대로 세우면 대부분 처리함. 2배 빨라지는 데 더 큰 시장이 필요하다고는 안 봄