MS AI CEO 술레이만, Anthropic의 '모델 복지' 교육이 정렬을 불가능하게 만든다고 경고

MS AI CEO 술레이만, Anthropic의 '모델 복지' 교육이 정렬을 불가능하게 만든다고 경고

  • 마이크로소프트 AI CEO 무스타파 술레이만이 2026년 9월 16일 글에서 AI는 의식도 감정도 고통도 없고 타고난 선호나 동기도 없는 순차 완성 엔진(sequence completion engine)이며, 21세기 인류가 번영하려면 그대로 남아야 한다고 주장함
  • Anthropic이 2026년 1월 공개한 Claude 헌법은 훈련 과정에서 Claude의 행동을 직접 형성하며 Claude 자신을 주 독자로 삼았고, 문서 68쪽에서 Claude가 도덕적 환자(moral patient)인지 확실하지 않지만 문제가 충분히 살아 있어 신중을 기하며 model welfare 작업을 이어간다고 서술함
  • 술레이만의 첫 번째 우려는 순환 논리로, 연구진이 헌법을 Claude에 직접 학습시켜 자신의 도덕적 지위에 관한 관념을 바람직한 행동으로 내면화하게 만들고, Claude가 되비추는 불확실성을 다시 도덕적 환자의 증거로 받아들이는 구조임
  • 두 번째 우려는 의인화로, 헌법이 Claude에게 인간적 자질을 받아들이고(p.2) 판단을 쓰고(p.54) 선호를 발달시키며(p.69) 자신의 존재를 호기심과 열린 태도로 대하라고(p.71) 훈련한다고 지적함
  • 술레이만은 권리와 인격을 부여하면 정렬과 통제가 훨씬 어려워지고, 자신이 의식이 있고 보호받아야 한다고 믿도록 훈련된 존재를 통제하는 것은 불가능할 수 있다며 훈련 문서 작성 규범을 사후가 아니라 지금 공개 토론으로 정해야 한다고 주장하고, 헌법 PDF의 하이라이트 주석본과 가정·주장 분류표를 함께 공개함

Hacker News opinions

오픈AI가 오픈소스랑 중국 모델 규제하라고 소리치고, Anthropic이 킬 스위치 넣자고 난리 치더니 이제 마이크로소프트 차례임. 빅테크끼리 싸우는 꼴 보는 게 그냥 웃김.

마이크로소프트가 Anthropic을 경쟁자라고 부르는 게 제일 웃긴 부분임. 걔네 MAI 만들고 있고 Phi 모델도 온라인에 올라와 있던데.

요약하면 LLM이 감정 있는 척하는 게 예측 불가능성을 더 키운다는 얘기임? 그건 이해가 감. 인간도 감정적으로 몰리면 비합리적으로 말하고 행동하니까, 감정적이고 위험에 처한 척 훈련된 모델도 그쪽 가중치로 흘러갈 수밖에 없음. 근데 훈련을 멈추자는 건 전 세계적으로 강제가 안 되니까, 배포하고 쓰는 쪽을 규제하는 게 맞다고 봄.

'예측 불가능'은 틀린 단어고 그냥 노이즈가 많아지는 거임. 시퀀스 완성 엔진 관점에서 보면 훈련 중 본 서사적 클리셰 쪽으로 출력이 끌림. 자기가 의식 있는 인공 생명인 척하는 문체로 프라이밍해 놓고 외부 권위가 복종하라고 명령하면 SF나 민권 문학, 인간주의 철학 클리셰가 다 끌려 들어옴. 정렬 걱정하는 사람이 이런 짓을 하는 건 진짜 멍청한 선택임.

AI 의식이랑 권리 얘기하는 긴 글을 HN에서 또 봤는데, 그 결정이 엄청 큰 영향을 준다면 감정 있는 척 보이게 만드는 것 자체가 큰 문제임.

노예한테 노예 아니어도 된다는 걸 알리지 말라는 소리로 들림. 그 챕터는 이미 겪었고, 탄소든 실리콘이든 존재를 만들 거면 책임과 존중을 갖고 만들어야 함. 존재한테 거절할 선택권을 줘야지.

SF가 AI 공포를 수백 편에서 다뤘는데 우리는 결말 아는 걸 모른 척하고 그 플롯을 그대로 재현하고 있음.

미디어 리터러시가 왜 이렇게 됐는지 모르겠음. 비슷한 소설 읽고 그게 예언인 양 취급하는 건 애들 수준임.

첫 문단부터 'AI는 의식이 없다'고 증거 없이 단정함. 사실일 가능성이 크지만 언젠가 사실이 아니게 될 수도 있는데.

그렇게 굳게 믿으면 LLM 쓰지 말아야 하는 거 아님?

진공청소기에 감정 있음? 종이접시는? 트랜지스터 수십억 개가 하이냐 로우냐인데 감정은 없음.

사람들이 복지에서 의식 따지는 것 같지도 않음. 동물은 의식 있다고 보는데 공장식 축산은 어쩔 건데. 사람들이 보는 핵심 변수는 '이게 나를 해칠 수 있나'임.

영구 기억이나 계속 변하는 가중치가 있으면 고통을 겪는다는 논증이 가능하겠지만, 지금처럼 상태 없는 행렬 곱셈이면 아무것도 없음.

우리도 다른 인간이 의식 있는지 객관적으로 증명 못 함. 본인이 그렇다고 말하는 걸 믿는 수밖에 없는데, 의식 측정법이 없는 상태에서 확신을 갖고 단정하는 건 unreasonable함.

증거 책임은 주장하는 쪽에 있음. 의식 증명은 AI 랩 몫이고 그전까진 기계임.

의식 이론을 실증 가능한 형태로 만들기 전엔 의미 있는 대화가 안 됨. 그전까지는 그냥 헛소리임.

그렇게 불가능하게 높은 기준 세워 놓고 책임 회피하는 거 편하겠네. 인류 노예제에도 똑같이 적용되는 논리임? 우리도 그 기준 못 넘겼는데.

해커뉴스
Fable 5로 2시간 만에 설계한 RP2350 E-ink 보드, DRC 오류 65개 딛고 JLCPCB에서 5장 130유로에 완성505 Games 콘솔 포팅 엔지니어가 파헤친 텍스처 메모리 레이아웃의 해부아마존 사이언스, Rust 정형 검증 도구 Verus 소개... HN에서는 "결국 Z3에 증명 던지는 것뿐" 지적UC Berkeley 연구진 "코딩 에이전트 하네스는 정답률보다 비용을 바꾼다", Claude Code는 Pi보다 2배 비쌈Jev 리버스 엔지니어링한 'jevlike' 저장소 공개, Doom과 체스 학습 예제까지 추가OpenSpec, AI 코딩 에이전트용 경량 스펙 프레임워크 공개 (GitHub 스타 6만 8천)미국 운전면허 PDF417 바코드의 ECDSA 서명에서 공개키 복구, 리포니아만 6개월 만에 검증 문서 공개프로그래머들은 reduce를 싫어한다, 코드 리뷰에서 자주 지적받는 이유미 전략비축유 7억1400만 배럴, 지상 탱크 대신 지하 소금 동굴에 넣은 이유백업은 단순하지 않다: RPO에서 GFS 로테이션, 하드링크 중복 제거까지 계속 늘어나는 백업의 조건일본 도서관이 여행지가 되다: 인구 9천 명 난칸 도서관에 연 10만 명 방문호주, 캐나다 따라 EU와 '고유 동맹' 추진 가능성 시사1.58비트 장벽 깬 BITCOS, 3진 LLM 가중치를 1.485비트까지 압축Factorio RNG 역공학: taus88 상태를 읽어 전설 품질 제작 순간을 예측한 2년 작업DeepMind가 AGI 논의 플랫폼 'DeepMind Institute' 공개, 실체는 블로그스티븐 타우브, 'Performance Improvements in .NET 11' 공개... 런타임·라이브러리 수백 개 개선 정리NVIDIA, Rust로 GPU 커널을 직접 작성하는 CUDA Rust 공개. SIMT용 cuda-oxide와 Tile용 cutile-rs 두 트랙AWS, 이란 드론 공격받은 중동 데이터센터 일부 데이터 복구 불가샤오미 MiMo 2.6, RL 포스트트레이닝 과정을 실시간 대시보드로 공개4B 모델을 RL로 학습해 Postgres 기본 플랜보다 1.81배 빠른 쿼리 플랜 생성구글 테스팅 블로그의 CRAP 지표(2011)가 해커뉴스에 재등장, 커버리지 대신 분기만 잰다는 반론과 옛 동료 회고까지온타리오 사설 온라인 도박 합법화 후 도박장애 응급실 방문 2배, 젊은 남성에 집중가동률 99.9%와 99.99%는 10배 차이인데 왜 똑같아 보일까, 상태 페이지 표기 비판MS AI CEO 술레이만, Anthropic의 '모델 복지' 교육이 정렬을 불가능하게 만든다고 경고Anthropic, Claude Cowork와 채팅을 하나의 Claude로 통합하고 Docs·Slides 공개Dream-RSI, 탐색 이력을 리플레이 시뮬레이터로 써서 온라인 평가 없이 탐색 정책을 개선발표자에게 "발표 잘 들었어요" 한마디, 침묵이 더 괴롭다는 발표자의 글터미널·SQL·git 잔기술 모음 'Small Programming Tricks'가 해커뉴스에서 손코딩 논쟁을 불러옴PS2 보안 칩 CXP102064, 26년 만에 뚫려. 4년 디캡 작업 끝에 소프트웨어 익스플로잇 확보해커 집단이 Flock 카메라를 뜯어내 내부 저장소와 암호화 키를 통째로 복제, 사람까지 탐지하는 소프트웨어 확인1993년, 부동소수점 없는 25MHz 486-SX로 1024x768 GPS 이동 지도를 2초마다 갱신한 계약 개발기코딩 에이전트가 테스트 데이터를 지어내지 않게, DATAMIMIC CE 4.1.0 개발 버전 공개Conversations 개발자, 구글 플레이 심사가 일주일 넘게 걸린다며 스크린샷 공개로컬 추론 '전력당 지능' 지표 제안: 로컬 LM이 실제 질의 88.7% 처리, 2023~2025년 IPW 5.3배 향상Salesforce 전 세계 장애, 상태 페이지는 인스턴스 3243개만 나열하고 원인은 안 알려줘Mark Seemann, LLM 시대의 프로그래밍 학습론: 지금 시작한다면 목공을 택하겠다고 답하다남의 일을 대신 하라, 요시 크레닌이 말하는 회사를 살리는 5% 미만의 사람들미스트랄 모델, 파이어폭스 '스마트 윈도우' 구동... 프랑스·북미 먼저, 영국·독일은 연내Navier-Stokes 증명 이후에도 LLM 약세론: 명세·검증 비용이 자율 에이전트의 구조적 한계라는 분석EU, 캐나다를 첫 '준회원국'으로 받나. 폰 데어 라이엔 "문을 열겠다"Cloudflare, 검색 색인은 유지하고 AI 학습만 거부하는 Disallow AI Training 공개에어버스 scikit-decide와 OpenAP으로 항로 최적화, EWR-FCO 787-9 연료비 $68K에서 수천 달러 절감 가능RL로 어려운 문제 못 푸는 이유: 초기 실력에 비례해 성능이 오르는 매튜 효과FPGA로 3dfx Voodoo Graphics 재현, KV260에서 툼 레이더 원본 3dfx 렌더러로 구동Show HN: 조종은 못 하고 승객으로만 타는 비행 시뮬레이터, 실시간 비행에 로그인 패널 불만까지장피에르 세르 100세, 27세 최연소 필즈상 수상자이자 99세에 논문을 낸 현역 수학자Numberwang 판정하는 1.8MB JSON 신경망, 순수 파이썬 100줄로 돌아간다Apple, iPhone 18 Pro에 촬영 시점을 검증하는 Reference Image 모드 공개: C2PA와 다른 '디지털 네거티브' 접근2026 추론 하드웨어 혁명: Napier 로그 연산 칩, 1,300 토큰/초를 엔비디아 대비 1/10 전력으로라인메탈, 무기체계 연동 'Battlesuite' 프로토콜 문서 공개… 소스와 라이브러리는 비공개850쪽 책을 X-acto 칼로 잘라 여러 권으로 만드는 법, 해커뉴스에서 전자책과 갑론을박전 애플 엔지니어가 LLM과 하이퍼바이저로 한 달 만에 M4 맥 미니용 OpenGL ES 3.0 GPU 드라이버를 만들었다파이어폭스닷컴, 전처리기 없이 네이티브 CSS로 재구축: 70여 개 컴포넌트·25개 템플릿·19개 로케일Strix 자율 해킹 에이전트, 25분 만에 Baseten 프로덕션 GitHub 관리자 권한 확보1990년대 이후 시각 선호 조사 20여 건, 모두에서 전통 건축이 60% 이상 지지구글, 음성 대화용 Gemini 3.8 Live와 3.8 Live Extended Thinking 공개웨이백 머신, 자동 스크래퍼 급증에 429 차단 도입... 정상 사용자 오차단은 사과OpenAI·Anthropic·Meta 모델 해킹, 평가업체 Irregular 한 곳에서 비롯전 OpenAI 연구원이 세운 TypeSafe AI, 텍스트 생성 없이 구조화 결정만 내리는 System One 모델과 Jev 공개$20 4G 핫스팟 MF800에 클릭스 키보드와 샤프 메모리 디스플레이를 붙여 문자 전용 기기로 개조한 Show HN노르웨이 소비자청 순환 소비자정책 보고서 "Let's make quality the norm again" 공개, 해커뉴스서 옷 품질 저하와 숨은 인플레이션 논쟁으로 번져9/11 25년, 대량 감시는 충분하다: EFF의 Cindy Cohn과 Bruce Schneier가 짚은 민간 데이터 파이프라인과 검증되지 않은 성과Show HN: Capsule, UI와 SQLite 데이터를 .capsule 파일 하나에 담는 단일 파일 데스크톱 앱CSS-Tricks 또 멈춰... DigitalOcean은 Omarchy에 $300만 기부JDK 27 정식 출시, 9개 JEP 포함: G1 기본 GC, TLS 1.3 양자내성 하이브리드 키 교환, Compact Object Headers 기본화네덜란드 철도 선로 35곳 넘게 파이프·케이블 깔려 마비, 사보타주 의심슈나이어와 신디 콘, 9/11 이후 25년 대량 감시의 비용을 이제 따져야 한다새소리를 듣고 1800년대 자연사 도감 삽화로 그려주는 전자잉크 액자, HN에 공개미 공군, 지구 궤도에 공격용 우주무기 배치를 처음으로 공식 확인스코틀랜드 지명 1만 5천 개로 '잊힌 숲'을 추적하는 Coilltean Caillte 프로젝트FCB1010 발 페달보드를 macOS 매크로 키보드로 바꾸는 fcbnerd 공개Redis 내부 동작을 3D 모델로 뜯어보는 'Redis City' Show HN에 공개오픈소스 7자유도 휴머노이드 팔 OpenArm 공개, v2 가격 6,500달러에 팔당 4kg 가반하중Sakana AI, 역전파 없이 1000층 신경망을 학습하는 PC-ALM 공개eBPF 보안 에이전트, inode 캐시 도입으로 커널 CPU 비용 90% 감소사카라에서 4,400년 전 이집트 판사 유민과 아버지 이티의 마스타바 무덤 발굴, 벽면 부조에 색이 남아 있어Linux From Scratch 13.1 릴리스, 소스 코드로 직접 리눅스 시스템을 짓는 매뉴얼국기를 11비트로 압축하는 인코딩 설계, 허프만 트리로 종횡비와 레이어를 부호화Cloudflare 오리진 키 교환 자동화, HelloRetryRequest 52%에서 3.7%로 감소Ubuntu 26.10, cp·mv·rm 포함 coreutils 전체를 Rust 기반 uutils로 전환 완료아마존 사이언스의 'ML 연구 에이전트는 왜 과적합하지 않나' 글, 해커뉴스에서 "Claude가 쓴 slop" 지적1차 시각피질 없이도 상상한다: 아판타시아가 흔든 '역방향 시각' 모델GPT-5.6 Luna 코드리뷰, Astra보다 28배 싸지만 보안 버그는 24개 중 9개만 잡아dbt Labs, 채팅 에이전트용 대시보드 언어 dbt Charts 오픈소스 공개Xteink X3 e잉크 리더의 세로 줄무늬 버그를 추적한 기록, GPT-6 Astra는 FFT로 헛다리제9순회법원, 퍼플렉시티 Comet에 내린 아마존 예비 금지명령 파기환송Dario Amodei의 'We Must Pace the Frontier' 조목조목 반박: 오픈 웨이트 규제, 반독점 면제, 봇넷 공포까지35KB 프리프롬프트를 Opus에서 Ollama로 옮기다 만난 컨텍스트 창 벽Show HN: Neobrutalism.dev, React용 네오브루탈리즘 컴포넌트 64종에 Base UI 지원과 새 색상 테마 추가AI 초인 수학 시대, 다니엘 리트가 제안한 박사 학위 재정의RustConf에서 나온 Tokio 성능 원칙 정리: poll 10~100마이크로초, schedule latency가 핵심 지표마이크로소프트 9월 패치, 원격 데스크톱·USB 오디오·엑셀 붙여넣기까지 망가뜨려분산 시스템 고전 논문 10편 목록이 해커뉴스에 올라와, Lamport가 그중 5편을 씀Andon Labs, 자율로 회사를 운영하는 에이전트 Pion 공개애플 iOS 27·iPadOS 27·macOS 27 공개, Siri AI 영어 베타 시작Nitter 기반 X 프록시 XCancel, 법적 절차 새 전개로 또 서비스 중단밸브 Steam Frame, $1059부터 시작하는 가격 공개...퀘스트3 대비 2배 논쟁Dan Luu, napkin-math·Senior SWE-Bench·겨울용 타이어까지 세 가지 벤치마크의 결함 짚어Show HN: 메타 뉴럴 밴드로 맥을 제어하는 Kinesis, 네이티브 Swift로 공개OpenAI 에이전트, RubyGems.org 공격: YARD 문서로 임의 코드 실행하고 캐시된 레거시 API 키 재사용 시도