Claude Fable 5·Mythos 5·Opus 5 요청 오류 급증, 80분 만에 복구
- Claude 상태 페이지는 Mythos 5.1, Fable 5.1, Opus 5 요청에서 오류가 급증했다고 밝혔고, 영향 시간은 5:50pm PT(00:50 UTC)부터 7:10pm PT(02:10 UTC)까지 약 80분임.
- 장애는 claude.ai, Claude API(api.anthropic.com), Claude Code, Claude Cowork 네 서비스에 영향을 줬음.
- 00:57 UTC 조사 시작, 01:17 UTC 원인 확인, 01:35 UTC에 Fable 5·Mythos 5 계열이 정상 성공률로 돌아왔고 그 시점까지 Opus 5 오류만 남아 있었음.
- 02:11 UTC에 영향받은 모델 전체의 성공률이 정상으로 돌아왔다고 알렸고, 추가 문제가 없는지 모니터링에 들어감.
- 해커뉴스 토론에서는 Grok도 같은 시각에 문제가 있었다는 얘기와 us-east-1의 EC2 장애가 겹쳤다는 추측이 나왔고, 상태 페이지가 Atlassian Statuspage로 돌아간다는 점도 언급됨.
Hacker News opinions
Grok도 같은 시간에 터졌다던데 콜로서스 데이터센터 쪽 문제 아닐까.
'Subscribe to incident' 기능도 안 됐음. 연락처 넣고 제출하는 데서 멈춰버렸는데 지금은 제대로 되는 것 같더라.
장애가 나면 진행 중이던 작업도 날아가고 시간도 날아가고 태운 토큰은 두 번 다시 못 돌려받음. 이번 장애 동안 몇백만 달러어치 추론이 그냥 증발한 건데 환불은커녕 언급조차 없음.
상태 페이지를 Atlassian Statuspage로 쓰는 건 책임을 남한테 넘기려는 것이라는 얘기도 있고, 자체 인프라가 죽을 때 상태 페이지까지 같이 죽는 걸 막으려는 것이라는 얘기도 있음. 통일성 때문이라는 말도 나옴.
Opus 5.5가 화요일에 나온다는 소문이 있던데, 예전에도 출시 직전에 장애가 터진 적 있음.
그 루머 출처가 어디임? HN이랑 레딧에 계속 이런 글만 돌아서 루머가 있다는 건 알겠는데 근거는 못 찾겠음.
us-east-1 EC2가 오늘 밤 좀 터졌는데 이거랑 관련 있는 걸 수도.
Anthropic 직원들이 새 Claude 모델 인터뷰하느라 기존 모델 모니터링을 까먹은 거 아님? 다른 회사에서 배포할 때마다 이랬으면 구글 검색이 업데이트마다 죽는 꼴이라 바로 욕먹었을 텐데.
/model claude-opus-4-8로 바꾸고 계속 일했음. opus-4-6으로 돌아가도 잘 되더라.
긴 계획 짜다가 중간에 끊겨서 codex 켜고 '~/.claude에 있는 세션 x 읽고 이어서 해줘' 했더니 다 끝내주더라.
지난주에 ChatGPT 50% 할인으로 구독했는데 요즘 Claude는 점점 안 씀. 응답도 더 빠르고 요금제에 astra도 들어감.
요 며칠 'safeguards flagged'가 부쩍 늘었음. 펜테스트도 아닌 그냥 리버스 엔지니어링인데 Fable 켜면 20초 만에 Opus 4.8로 떨어지고 심하면 Sonnet까지 내려감.
서버 방화벽 바꾸고 재부팅하다가 커널이 죽어서 밖으로 튕겼음. 복구하느라 진땀 뺐음.
Claude는 모든 개발자를 대체할 것처럼 얘기하면서 SLA는 two nines임.
이런 장애가 자주 터지는데 매번 HN 프론트페이지에 올라오는 게 이해 안 됨. LLM 서비스 세세한 얘기 그만하고 사람들이 뭘 만드는지 얘기하자.
장애가 나면 캐시 가격이 적용돼야 할 요청이 캐시 요금으로 안 나가는 경우가 얼마나 되는지 궁금함.
출시 전마다 이러는 데자뷰임. Opus 5.5랑 Fable 5.2가 오늘 밤 나온다는 얘기도 있음.