구글, 같은 가격의 Gemini 3.8 Flash와 보안 특화 Flash Cyber 공개
- 구글이 Gemini 3.8 Flash를 공개했으며, 입력 100만 토큰당 $0.75와 출력 100만 토큰당 $3.75로 3.7 Flash와 같은 도입 가격을 유지함
- Gemini 3.8 Flash Cyber는 취약점 탐지와 자동 패치에 초점을 둔 보안 모델이며, 구글의 Fairwind Program에서 신뢰받는 방어 담당자에게 제공됨
- 두 모델은 같은 기반 모델을 쓰며, 장시간 실행하는 에이전트 루프가 모델을 반복 평가하고 개선하도록 설계됐다고 구글이 설명함
- 구글은 3.8 Flash가 장기 소프트웨어 엔지니어링 평가인 DeepSWE v1.1에서 다수의 더 큰 프론티어 모델을 앞섰다고 밝힘
- 3.8 Flash는 HLE-Verified에서 54.9%를 기록했으며, 구글은 금융 에이전트 V2와 Harvey 법률 에이전트 벤치마크에서도 3.7 Flash와 다른 프론티어 모델보다 높았다고 주장함
Hacker News opinions
발표 페이지는 이미 404인데 Gemini 채팅 웹에서는 아직 3.8 Flash를 쓸 수 있더라. 아카이브와 모델 카드는 남아 있음.
구글이 외부에 프론티어 모델을 내는 일은 사실상 접고 컴퓨트 판매로 가는 것 같음.
그렇게 보기엔 Flash가 Opus와 Sol에 가까운 벤치마크를 내고 있음. 외부 판매를 포기했다고 단정하기 어려움.
3.5 Pro는 건너뛰고 Gemini 4가 다음 플래그십일 거라는 WSJ발 얘기가 있음. Flash가 한 달 단위로 나오는 걸 보면 4 Flash와 Pro를 같이 낼 수도 있겠지.
모델 카드의 안전성 비교 표기는 이상함. 열 제목은 3.8 대 3.7인데 Tone 항목은 Gemini 3 Flash 대비 수치라서, 표의 20%는 라벨을 무시하게 만듦.
3.7 Flash는 빠르긴 정말 빠르지만, 작은 프로젝트를 넘는 코드베이스에서는 Sol이 훨씬 잘하더라. 나는 프로토타입이나 프로덕션 코드가 아닌 작업에 Flash를 씀.
DeepSWE 공개 순위에서는 Opus 5도 이겼고 Artificial Analysis 점수는 59라는데, 실제 써보는 품질은 아직 봐야 함.
그 59는 Opus 5의 medium effort와 같은 점수일 뿐이고, 기본으로 쓰는 Opus 5 high는 61점임. Opus 5 max는 63점이고 medium은 같은 결과에 출력 토큰도 4배 적음.
DeepSWE가 공개 벤치마크라 오염됐을 가능성도 있음. TerminalBench 4.0은 19.1%로 Opus 5의 51.8%와 큰 차이가 남.
직접 토큰 많이 쓰는 코딩에 써보니 Claude나 Sol과는 비교가 안 됐음. 프롬프트를 더 줘야 하고 결과도 낮아서, 넉넉한 Antigravity 할당량으로 구독 한도 찼을 때 쓰는 작업용 모델 정도임.
승인을 몇 초마다 직접 눌러야 해서 자동 승인 모드의 Claude나 ChatGPT보다 실사용은 느려짐. agy --dangerously-skip-permissions를 쓰면 권한 확인은 건너뛸 수 있음.
Gemini는 업데이트할수록 쓸모가 줄어드는 느낌임. 예전 3 Pro에서는 PDF 편집이 됐는데 3.1 Pro는 주어진 PDF를 편집하거나 새 PDF를 만드는 것도 못 했음.