Google, 코드·에이전트용 Gemini 3.7 Flash 공개. 3.6 대비 벤치마크 성능과 토큰 가격 개선
- Google이 Gemini 3.7 Flash를 공개함. 3.6 Flash 출시 3주 뒤 나온 코딩·에이전트용 모델이며, 도입 가격은 기존 3.6 Flash의 100만 토큰당 비용 절반임
- 소프트웨어 엔지니어링 평가에서 FrontierCode 1.1 Main은 34.4%에서 43.6%로, DeepSWE v1.1은 49.0%에서 65.3%로 3.6 Flash 대비 상승함
- 웹 개발 평가 WebDev Arena Elo는 1538에서 1588로 상승했으며, Google은 스크린샷·이미지·디자인 시스템을 입력받아 레이아웃과 앱 기능을 더 적은 프롬프트로 생성한다고 설명함
- 복잡한 문서 처리 평가 GDP.pdf는 22.0%에서 34.0%로, 업무 자동화 평가 AutomationBench는 17.0%에서 30.4%로 상승함
- Google은 Nano Banana와 3.7 Flash를 결합해 텍스트 프롬프트에서 캐릭터·아이템·텍스처를 실시간 생성하는 3D 게임 사례를 제시함
Hacker News opinions
12월 2026년까지 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75라는 도입 가격이면 그 전에는 큰 Flash 업데이트가 없다는 뜻처럼 보임.
3.6 나온 지 3주밖에 안 됐음. 가격 경쟁력 때문에 내놓은 것 같고, 원하면 연말 전에도 3.8은 낼 수 있다고 봄.
Gemini 4가 곧 나온다는 말이 맞으면 새 Flash 업데이트도 적어도 하나는 더 나올 것임.
Cognition FrontierCode 기준 Terra가 가격은 절반쯤이고, Grok 4.6은 더 낫고 더 싸 보임. 이 조건에서 3.7 Flash를 고를 이유가 잘 안 보임.
Google은 이제 Google One과 Workspace 구독자를 겨냥하는 듯함. 그래도 Microsoft처럼 Windows와 기업 고객 기반이 두텁진 않음.
난 고컨텍스트에서 처리 속도, 지연 시간, 가동률 때문에 아직 3.6 Flash를 씀. Grok 4.6은 내 내부 벤치에서 점수가 더 낮거나 느렸음.
토큰당 가격만 보면 안 됨. Artificial Analysis 스위트 실행 비용은 Grok 4.6이 $1,068, Gemini 3.7 Flash가 $485라서 실제 작업 비용은 Flash가 절반 이하임.
내 작업에서는 3.6 Flash High가 Luna xhigh보다 약 10배 빨랐고 결과도 비슷했음.
Gemini는 Pro 모델을 또 낼 건지 궁금함. 빠르지만 성능은 중간 정도인 모델 틈새에만 집중하는 것처럼 보임.
모델 카드를 보면 벤치마크에 따라 GPT 5.6 Terra나 Sonnet 5와 비슷한 구간임.
Google이 5주 전에 나온 OpenAI와 Anthropic의 중간급 모델과 맞먹는 빠른 모델을 냈는데도, 최고급 모델이 아니라고 불평하는 건 이상함. Sonnet과 Terra, Luna에도 시장이 있다면 Flash에도 시장이 있는 것임.
Sonnet 5 대부분의 벤치마크를 이기고 가격이 절반 이하라면 충분히 경쟁력 있음. Google이 최고 성능 선두는 아니어도 다시 경쟁권에 들어온 듯함.
텍스트만 다루면 DS V4 Flash나 Pro가 13배에서 26배 싸고 성능도 비슷해 보임. Flash 3.7의 확실한 장점은 TPU 덕분으로 보이는 속도와 멀티모달 정도임.
텍스트만 쓰는 비코딩 앱에서는 속도가 실제 차이를 만듦. 사용자가 AI 기능이라고 기대하지 않는 기능에서 몇 초나 몇 분을 기다리게 할 수는 없음.
대규모 처리에서는 Flash 외 대안이 잘 안 됐음. DeepSeek, Luna, Mistral은 시간당 문서 100만 건을 넣으면 요청 3건 중 1건이 실패했는데 Gemini Flash는 됐음.
Artificial Analysis 점수는 3.6 Flash 52에서 3.7 Flash 56으로 올랐지만, 작업당 출력 토큰은 2.6만에서 3.7만으로 늘었음. 그래도 토큰 가격을 절반으로 내렸으니 작업당 비용은 더 쌈.