딥시크, V4.1 Flash 출시 뒤 Pro 요청까지 Flash 요금으로 전환 예고
- 딥시크는 V4.1 Flash를 2026년 9월 10일 베이징 시간 전후에 정식 출시하며, 성능·비용·속도·작업 완료 시간에서 V4 Pro를 모두 앞선다고 발표함
- 정식 출시 뒤 V4.1 Pro가 나오기 전까지 Pro 모델로 들어오는 모든 요청을 V4.1 Flash로 전환하고 Flash 요금을 청구하겠다고 밝힘
- 9월 10일 12시 베이징 시간부터 비혼잡 시간 기준 입력 캐시 적중은 단가 $0.003, 캐시 미적중 입력은 $0.15, 출력은 $0.6으로 책정하며 혼잡 시간에는 각 가격이 2배가 됨
- HN에서는 Pro에서 검증한 운영 흐름을 예고 없이 Flash로 바꾸면 JSON 형식 준수나 도구 호출 같은 행동이 달라질 수 있어, 교체 전에 회귀 테스트할 기간이 필요하다는 의견이 나옴
Hacker News opinions
원문 출처가 플랫폼 사용량 페이지의 배너 공지였음. 처음엔 링크가 없어서 한참 찾았네.
Flash가 이전 Pro를 계속 추월하는 속도를 유지하면 좋겠음. 다만 Anthropic이나 OpenAI가 증류 방어를 더 세게 할 수도 있겠지.
오픈 웨이트로 나오고 현재 V4 Flash Vision과 같은 아키텍처와 크기면 좋겠음. 지금 모델은 128GB 장비에서 돌릴 수 있는 LLM 중 제일 낫다고 봄.
API로 모델 이름을 직접 지정하면 새 모델을 쓸 수 있는 듯한데, API 목록에는 아직 안 뜸.
V4 Pro도 괜찮았는데 더 싸고 빠른 모델이 바로 나온다니 좀 당황스러움. 그래도 GLM 5.3 Flash가 GLM 5.2보다 싸고 좋았던 전례는 있음.
Pro 요청을 Flash로 강제 전환하고 Flash 가격만 받겠다는 건 대형 미국 업체라면 하기 어려운 방식 같음.
V4 Flash로 Rails 앱과 테스트까지 여러 번 만들어 봤는데 값 대비 정말 잘했음. 내 Omarchy 기본 에이전트는 Flash고, 대부분 작업에 Claude 비용을 낼 이유를 잘 모르겠더라.
몇 달째 중국 Flash 모델을 거의 주력으로 씀. 답변 한 번에 몇 푼 수준이고, 새 수학을 발명하는 모델보다 빠르고 싸고 일관된 모델이 내겐 더 필요함.
에이전트 작업에서는 중국 Flash 모델이 Gemini Flash보다 과업당 비용이 20%에서 30% 수준인데 품질도 더 낫다고 봄. 다만 DeepSeek Flash는 도구 호출이 실패하면 재시도 루프에 빠질 때가 있고, 비텍스트 입력은 Gemini가 앞섬.
DeepSeek의 추론 강도는 low, high, max 셋뿐인데 low는 사실상 추론 끈 수준이고 high와 max는 너무 오래 생각해서 비용이 커짐. 중간 단계가 필요함.
웹 채팅 Flash는 영어로 물어도 중국어 사고 과정과 중국어 답을 내놓거나, 재시도할 때마다 언어가 바뀌는 일이 잦았음. 영어로 답하라고 덧붙이면 어느 정도 조절되지만 불안정함.
이 문제는 웹 UI만의 일은 아님. V4 Flash 7/31을 코딩 하니스에 붙였을 때 무한 루프, 환각, 조기 종료, 잘못된 도구 호출도 겪었음.
가격이 거의 4배 오른다는 말은 잘못 봤음. 현재 Flash 출력 가격은 0.66이고, 새 가격은 0.60으로 내려가는 것임.