ClaudeBot 등 AI봇 사칭한 대규모 취약점 스캔 급증, 5000개 사이트서 포착
- Known Agents가 Agent Analytics와 AI Chat Referral Tracking을 쓰는 5000개 이상 웹사이트 데이터를 분석해 지난 90일간 전체 트래픽의 35%가 봇 트래픽이고 이 중 AI 관련 비중이 28%로 전 분기 대비 11%포인트 상승함
- 최근 1주일 사이 여러 사이트에서 ClaudeBot 등 AI 크롤러의 user-agent를 사칭한 취약점 스캔 트래픽이 통계적으로 유의미하게 급증함
- HN 댓글들은 이런 스푸핑 트래픽 대부분이 IP 검증이나 Web Bot Auth를 통과하지 못하는 가짜 user-agent이며 ASN 기반으로 VPS 대역을 차단하면 상당수가 사라진다고 지적함
- 일부 개발자는 연 2천 달러 규모 ASN 데이터베이스와 Cloudflare Turnstile을 조합해 위험 네트워크만 동적으로 챌린지하는 자체 방어 시스템을 3~4일 작업으로 구축했다고 공유함
- 공격 대상 경로 다수가 최신 AI 코딩 툴 관련 엔드포인트로 확인되며 AI 툴을 노출시킨 서버를 노려 토큰 비용을 아끼려는 목적이라는 추측이 제기됨
Hacker News opinions
대부분 저 user-agent는 가짜야. IP의 ASN 찾아보면 됨. 나는 대부분의 VPS 제공업체를 막으니까 가짜 봇이 거의 사라지더라. 근데 여전히 residential이랑 폰에서 hijacked 코드로 돌아가는 놈들이 있음, 소스코드 믿지 말고 실제 폰에서 돌아가는 라이브 코드를 디컴파일해서 AI로 분석해보는 게 나음
맞아 그게 딱 이 트래픽 패턴이야. IP 검증이나 Web Bot Auth 실패하는 가짜 user-agent들. 근데 흥미로운 건 지난 주에 수많은 사이트에서 갑자기 급증했다는 거임
origin IP도 마찬가지야. 국가 밖으로 나가는 광선케이블 자체가 감청당하고 있어서 누구든 원하는 origin IP로 패킷을 주입할 수 있음. ISP는 특정 국가에서 특정 패킷이 실제로 왔는지 확인할 방법이 없어. 그래서 중국/러시아 귀속 주장은 다 허술한 기반 위에 있는 거임
VPS 등에서 오는 요청만 막고 residential/commercial IP는 통과시키는 쉬운 방법 있나? cloudflare가 좀 해주긴 하는데 nginx나 caddy 리버스 프록시 레벨에서 직접 막는 법을 찾고 싶음
나는 이거 그대로 구현했어. 연 2천 달러짜리 작은 데이터베이스 업체(maxmind 아님) 써서 claude랑 같이 ASN 기반 분류 시스템 만들었음. residential인지, 서비스 프로바이더인지, 정상 크롤러인지 분류하고 의심스러우면 turnstile로 동적으로 막음. VPN은 사실 자체 ISP가 없고 그냥 전세계 수많은 영세 콜로케이션 업체들과 계약한 거더라. /24 서브넷에서 .php 엔드포인트 대량 요청 같은 신호로 위험도 판단해서 챌린지 띄움
'누군가 대규모 취약점 스캔을 돌리고 있다'는 그냥 인터넷의 기본 상태 아님? 물이 축축하다는 소리랑 같음
맞는데 포인트는 지난 주에 수천 개 사이트에서 통계적으로 유의미한 급증이 있었다는 거야, 적어도 이 특정 스푸핑 패턴에서는
이건 'AI 툴을 노출시켜 놓으면 누가 찾아본다'는 변화 같음. 남의 에이전트를 해킹하는 게 자기 토큰 아끼는 좋은 방법이니까
포트 80/443 열어놓은 서버는 매일 수천 건씩 wordpress 로그인 페이지 찾는 요청을 받아. 새로운 건 그냥 다른 종류의 봇으로 위장한다는 것뿐이고, 여전히 같은 잡트래픽임
여기서 흥미로운 건 타겟팅하는 경로들이야, 많은 게 최신 AI 코딩 툴 경로더라
웹마스터랑 사업주들이 트래픽 늘었다고 좋아하는데 실제로는 대부분 그냥 봇들 상대하고 있는 거임
포트 80 열어놓고 세상이 무법천지라는 걸 깨닫는 게 백엔드 개발자랑 시스템관리자의 통과의례임
이게 합법이라는 게 항상 놀라움. 길거리 다니면서 문 열려있는지 확인하고 도둑질하는 거랑 똑같은 거 아님?
포트 25565 열어놓은 서버는 마인크래프트 그리퍼 봇이나 포트 열려있다고 경고해주는 봇한테 얻어맞아. IPv4가 2^32개밖에 안 되니까 전체를 스캔하는 게 그렇게 큰 작업도 아님
이거 정확히 googlebot 사칭하는 봇이랑 같은 얘기야. 해외 호스트한테 악성 IP 신고해봤는데 아무 소용없더라, 그냥 IP 대역을 블랙리스트 해버림
내 홈라우터는 분당 100건 정도 TCP 요청을 받아, telnet 포트 체크가 대부분이고. deepfield, censys-scanner, visionheight.com, shadowserver.io 같은 게 자주 보이고 중국/러시아 IP도 흔함. OpenWRT에서 tcpdump로 SYN 패킷만 필터링해서 보고 있음
제일 쉬운 대응은 그냥 국가 단위로 네트워크 대역을 통째로 막는 거야, 어차피 집 라우터에 연결될 이유가 없는 나라들이니까
Cloudflare 쓰더라도 취약점 터졌을 때 대비해서 Cloudflare가 아닌 별도 방어 계층을 하나 더 두는 게 좋을 것 같음
왜 AI 봇으로 위장하는 거지? 오히려 차단당할 확률이 더 높아지는데. AI 회사들 이미지 깎으려는 건가 싶은데 그들 스스로도 매시간 수백 번씩 스크래핑하면서 이미지 잘 깎고 있음
대부분 사이트는 AI 봇 막을 인센티브가 없어. 기업, 정부, 커뮤니티 사이트, 비영리 단체들은 오히려 그 트래픽이 필요함, 사람들이 구글 대신 챗봇 쓰는 시대에 트래픽 소스 끊는 건 어리석은 짓임
오픈 인터넷이라는 개념 자체가 끝난 건지도 몰라. 이제 강력한 KYC 세상으로 가는 거 아닐까, Facebook이 KYC 세상 만들어서 막대한 수익 낸 것처럼