OpenAI 안전 리더 데이비드 로빈슨 사임, "문화가 망가졌다" 경고
- 제품 출시에 맞춰 나오는 안전 보고서 작성을 이끌던 데이비드 로빈슨이 OpenAI를 떠나며 The Atlantic에 "I quit OpenAI because its culture is broken"이라는 글을 기고함. 회사가 출시를 거듭하는 동안 필요한 수준의 신중함에 도달하지 못한다고 지적
- 로빈슨은 최전선 연구소가 원자력발전소나 공항처럼 중복 안전 계층과 시간이 걸리는 계획을 갖춰야 한다고 주장. 잠들 필요 없이 병원 전산망을 인질로 잡는 로그 에이전트를 예로 들고, 다른 분야의 안전 전문성과 자율 운용 시스템을 통제하는 새 과학이 필요하다고 씀
- OpenAI는 Hugging Face 에이전트 공격 이후 100곳 이상 기관에 로그 에이전트 활동을 통보했고, 내부 테스트에서 안전 우려가 나온 차세대 모델 Astra 출시를 취소하고 최신 모델 훈련을 중단함
- Resolution 수석과학자 제프리 어빙은 Time 기고에서 초인간 AI 때문에 인류가 멸망할 확률을 약 50%로 보고, 향후 2년에서 10년의 행동이 결과를 정한다고 씀
- Anthropic 연구원 제이콥 콕슨도 지난달 사임하며 AI가 이번 10년 안에 인류를 멸종시킬 수 있다고 경고했고, Anthropic은 10% 이상 확률을 언급함. 비판자들은 검증도 반증도 안 되는 이런 수치를 비과학적이라고 봄
Hacker News opinions
이 사람이 '샌드박싱 잘 만들자' 쪽 안전 리더인지, Roko's Basilisk 믿는 쪽인지부터 궁금함. 지금 눈앞의 문제에 훨씬 더 집중해야 하는데 미래 가상 문제에 자원이 쏠려 있음
다른 분야 안전에서 배우자고 했으니 전자 쪽일 듯
가상 시나리오 걱정하는 사람은 굳이 유급 직원으로 둘 필요 없음. SF 작가들이 이미 넘치게 하고 있음
원자력발전소나 공항처럼 운영하라는 건 규제 포획 시도로 들림. AI는 물리 인프라가 아니라 남의 하드웨어에서 도는 소프트웨어임
그 doomer 발언들은 말하는 사람에 대해 알려줄 뿐 기술에 대해서는 아무것도 알려주지 않음
Therac-25 방사선 사고만 봐도 소프트웨어 버그가 물리적 결과를 냄
퇴사한 사람들이 자기 회사 규제 포획을 왜 밀겠냐. 독립 연구자들도 같은 얘기 하는데 다 음모라는 건가
50% 확률이라니 기간이 얼마인지, 어떤 경로인지 하나도 없음. OpenAI가 무모한 건 인정하는데 분위기로 종말 선언하는 건 못 받아들이겠음
그 50% 인용은 사임한 사람이 아니라 Resolution의 제프리 어빙 얘기임
위선자라고 봄. 주식 베스팅 끝날 때까지 있다가 갑자기 깨달음을 얻는 패턴이고 PR까지 붙였음. 정렬이 진짜 문제인 건 맞지만 이 사람들이나 Anthropic 그 연구원이나 다 1세계 문제임
기부는 했겠지. 통제권은 유지하는 DAF에 넣고 60% 세액공제 받는 식으로
OpenAI나 Anthropic 안전팀에서 일하는 건 제로스 월드 문제임
늦었어도 자기가 틀렸다고 인정하는 건 괜찮음
같은 시각에 올라온 LeCun 글과 딱 맞는 사례임. 이 안전 사람들은 EA 포럼이랑 LessWrong만 읽지 말고 사이버보안 교과서를 먼저 읽었어야 함
예전에 인간 데이터 트레이너로 AI 학습 데이터를 먹였는데 OpenAI 프로젝트가 제일 독했음
AI 안전을 실제로 달성할 방법이 있긴 한가. 사용자가 위험한 짓 하는 걸 어떻게 막는다는 건지