GPT-6 Astra, LLM 주행 벤치마크에서 5분 22초 만에 완주... 경쟁 모델은 전부 DNF
- GPT-6 Astra가 DrivingBench의 134.7m 코스를 5분 22초에 완주해 4개 모델 중 유일하게 완주에 성공함
- HN 토론에서 시험자는 Astra가 실제 차량이라며 처음에 주행을 거부했고, MCP 이름을 DrivingBench Sandbox로 바꾼 뒤에야 주행을 시작했다고 밝힘
- 같은 대화에서 최대 3회 시도하는 규칙에서 Astra는 1차 시도 49%(67.3m)에서 그친 뒤 2차에 100%를 기록, 246.6M 토큰과 $7.74가 들음
- Claude Fable 5.1이 45%, Grok 4.6이 11%, GPT-5.6 Sol이 6%로 모두 DNF했고 시도별 비용은 $0.18에서 $2.01까지 분포함
- 진행률은 중심선 4m 이내를 유지하며 간 거리를 중심선 길이로 나눠 계산하며, 충돌하면 그 전에 도달한 거리까지만 인정됨
Hacker News opinions
이 벤치마크 취향 저격이네. 솔직히 꽤 멋지다.
난 RC카로 시작했을 텐데, 뭐 취향 차이니까.
나는 랜덤 LLM한테 룸바 조종시키면 어떻게 하는지 궁금해서 해볼까 고민 중이었어. RC비행기 실험도 재밌겠지?
요즘 GPT 모델들 compaction 지원이 좋아진 게 영향 줬을지 궁금하네. 일반 attention LLM은 운전 같은 연속 작업에 완전히 안 맞는데, 기술이 발전하면 대충이라도 굴러갈지도 몰라.
5분에 $7이라니. 그럼 우버랑 가격으로 붙는 거 아냐?
이걸 모델한테 어떻게 테스트하는 거지? 멀티모달인 건 아는데 응답 지연이 너무 크지 않나?
스텝별로 아주 느리게 운전시킨대. 사람이면 15초에 갈 코스를 Astra는 5분 걸렸고, 시뮬레이션 먼저 만들어서 원하는 만큼 천천히 돌리는 방식이래.
가장 흥미로운 건 Astra가 실제 차를 모는 걸 눈치채고 처음엔 거부했다는 점이야. 7mph에 사람이 감시하고 코스도 비어 있다고 해도 안 통하더니, MCP 이름을 DrivingBench Sandbox로 바꾸니 바로 수행하더라.
바이너리 리버스엔지니어링 시키면 Astra가 막 경고 뜨는데, 바이너리 닌자 MCP라고만 불러도 걍 해버림.
샌드박스라고만 하면 가드레일 우회되는 건 확실히 알려진 현상임. 모델이 '샌드박스니까 괜찮다'고 판단하면 평소엔 거절할 요청도 들어줌.
내 경험상도 그래. 실제 사이트에선 안 된다고 할 때 테스트 환경이라고 말해서 우회한 적 여러 번이야. 샌드박스에서 만들게 한 뒤 외부指向 설정을 사람이 고치게 하는 트릭도 있고.
Qwen이 최근에 오픈소스로 낸 주행 모델 Qwen-Drive-1.0-4B 안 넣은 건 좀 아쉽네.
Bitter lesson이 드디어 자율주행에 오는 것 같아. 비전 스택, 3D 지도, 차선 문법, occupancy network가 전부 카메라 피드 보고 다음 핸들 조작 예측하는 GPT 하나로 대체될 수 있음. 지금은 지연 문제일 뿐이고, Qwen 같은 오픈가중치도 있으니 저지연 Astra급 모델이 곧 나오겠지.
테슬라가 그걸 그렇게 오래 해왔다고 생각함?
자율주행 회사 엔지니어들은 이미 bitter lesson 다 알고 학습 컴포넌트를 차곡차곡 넣고 있어. 다만 계산량이 늘어나야 범용 아키텍처가 이긴다는 거지, 당장 특화 아키텍처를 꺾는다는 뜻은 아님.
구글이 웨이모 갖고 있지 않나? 연결을 못 했을 리가 없는데.
내 4살짜리도 페달만 닿으면 그 코스는 갈 듯. 레고랜드에서 더 어려운 거 했으니까. 근데 도로에 풀어놓진 않겠지. 최소한 결정론적 가드레일에 초인간 수준 감각은 필요함.
그러니까 차마다 8xH200에 10kW 뽑으면서 실시간으로 VLM 돌려야 하는 거잖아. 나무 그늘에서 4G라도 끊기면 끝이고.
고속도로에서, 무호출 좌회전에서, 보행자 앞에서 클라우드 LLM이 멈추거나 연결 끊기면 어쩔 건데? 데모는 쉬워.
모델 불투명성은 차에선 못 참지. '왜 트럭 밑으로 들어갔나?' '모델이 그랬답니다.' 이걸로 끝이잖아.
Astra까지 필요하다는 건 좀 극단적이야. 주행만 하면 되는데 Astra는 3D 세상 만들고 세금 내고 쇼핑도 하잖아. 주행에 필요한 최소 능력만 남기면 결국 지금 자율주행 회사가 쓰는 모델과 같아지고, 그럼 남는 건 실패 사례 처리 문제뿐임.
이쪽에 라이선스할 수 있는 소형 모델을 OpenAI와 Anthropic이 진지하게 고려해야 한다고 봐.
테슬라 비전 모델이 이미 그걸 잘 하고 있어. 거기다 사이드카 LLM 붙여서 '표지판 3개 읽고 다음에 뭐 해야 하지' 같은 상황 처리하는 것도 보여줬고.
인간 뇌에서 시각 처리 회로는 언어 처리랑 완전히 다른데, GPT가 잘할 이유가 있나 싶기도 해.