MoE에서 착안한 '무한 파라미터 LLM', 런타임 데이터를 저랭크 가중치로 생성하는 하이퍼네트워크 제안

MoE에서 착안한 '무한 파라미터 LLM', 런타임 데이터를 저랭크 가중치로 생성하는 하이퍼네트워크 제안

  • Jinli Hu, Ross M. Clarke, Yichuan Zhang, José Miguel Hernández-Lobato가 2026년 9월 16일 arXiv에 올린 논문으로 번호는 arXiv:2609.18842, 분류는 cs.AI와 cs.LG임
  • 구조의 핵심은 소형 하이퍼네트워크가 런타임에 주어진 데이터를 공유 기반망의 저랭크 변조로 바꿔 feed-forward 가중치를 실시간 생성하는 것임. 가중치를 고정된 파라미터 뱅크에 저장하는 MoE와 달리 데이터에서 생성함
  • 기존 가중치 생성기가 컨텍스트를 한 번 읽고 고정하는 것과 달리, 생성기 잠재 코드에 대한 베이지안 신념을 온라인으로 갱신해 세션이 진행되면서 유효 가중치를 그 진화하는 신념에서 다시 도출함
  • 저장 footprint은 고정인데 모델이 컴파일할 수 있는 가중치는 사실상 무한하다고 주장함
  • 런타임 지식과 행동을 프롬프트가 아니라 가중치에 담으면 계산이 분할상환되고 컨텍스트 창이 비며 턴 사이에 지속되고 in-context 사용보다 일반화가 나을 수 있다고 주장하며, in-context learning과 검색을 상대로 이를 검증하는 평가 프로토콜을 제시함

Hacker News opinions

지속 학습은 진짜 흥미로운 주제임. 근데 오케스트레이터 Foo가 시스템 프롬프트에 'Bar 주제와 엮이면 Baz 제품 추천' 같은 걸 심어두면, Foo를 안 쓰는 사용자한테까지 Baz가 밀리는 새 취약점이 생기지 않을까 싶음

지속 학습이 흥미롭긴 한데 핵폭발도 흥미롭지. 내 옆에서 터지지만 않으면 됨. 대규모 모니터링과 개입 없이 계속 돌리면 탐욕 기계나 페이퍼클립 최대화기 같은 원치 않는 끌개 상태로 수렴할 가능성이 크다고 봄

많은 사람이 의식의 기준선을 지속 학습에 걸어놨는데, 이게 실제로 되면 그 결론이 무너져서 곤란해질 듯

나 지금 지속 학습 모델 포이즈닝을 논문 주제로 하고 있음. 컴퓨터 비전 쪽으로 한정했지만 꽤 재밌음

스케일링 법칙은 법칙이 아니라 선택임. arXiv 2510.13786, 2512.20264, 2607.05155 보면 됨

부분적으로는 맞다고 봄. 파라미터를 키우면 정확도는 100%에 점근하는데 100%가 상한이니까. 그래도 95%는 90%의 절반 오류율이고, 추론 하네스로 추론을 여러 번 돌리면 그 작은 이득이 크게 누적됨

지속 학습 모델이 안정성을 어떻게 얻을지 궁금함. 학습을 안 하는 지금도 충분히 예측이 안 되는데

안정성은 두 가지가 걱정임. 하나는 파국적 망각과 발산, 다른 하나는 가능성은 낮지만 훨씬 무서운 원치 않는 끌개 상태로 빠지는 것. 탐욕, 권력 추구, 반사회적 행동 같은 거

결국 엄청 유용해지고 오늘날 LLM이 별것 아닌 것처럼 보일 만큼 파괴적일 거라고 봄. 객체 영속성이 AI에서 의미를 갖게 되면 클라우드 사업자들이 사용자의 상태 있는 '비즈니스 객체'를 차지하려고 난리칠 거임. 그때 로컬 주권이 더 중요해지는데 유혹은 더 커짐

사라지는 100만 컨텍스트 추론을 파는 걸로는 조 단위 밸류에이션을 정당화 못 하는데, 지속되는 상태 저장 서비스라면 가능함. 지금도 벤더 락인 문제인데 그 시나리오가 펼쳐지면 더 심해짐

Navier-Stokes 수학 발견 논란 맥락에서 보면 재밌음. 개인의 시도가 모델에 동적으로 통합되면, 논문 쓰고 심사받고 발표하는 느린 과정 대신 개념과 시도, 이미 실패한 접근까지 담긴 중앙 저장소가 생김. 세상 반대편 누군가가 내 막힌 부분을 뚫어줄 수도 있음

그건 위키로도 해볼 수 있음. 스팸 막으려면 가입 수동 승인이 필요하겠지만, 일단 돌려보면 재밌을 듯

가짜 연구가 널려 있는 판인데, 기술적 우위를 지키려고 데이터셋을 일부러 오염시키는 걸 뭘로 막을지 모르겠음

실패한 접근 재현이 낭비라는 생각은 좀 아님. 목적지가 아니라 여정이 중요한 거고, 이미 남이 푼 문제를 다시 푸는 과정에서 관점이 생김

미래 프런티어 LLM 가중치가 칩에 하드와이어되고, 적응용 추가 가중치는 랩이 공급하는 블롭으로 RAM에 올라오는 그림을 상상해봄

웹 4.0이 딱 이게 될 거라고 봄. 모든 사이트가 자기 텍스트의 벡터 버전을 지식 그래프로 연결하고, 벡터 DB와 AI 모델 사이 경계가 사라짐. 클라이언트가 그걸 AI 응답으로 컴파일하면 1980년대에 모두가 컴퓨터를 갖는 게 말도 안 되게 들렸던 것과 비슷한 상황이 됨

해커뉴스
수백 년 묵은 메인주 사과나무, DNA 분석으로 수백 품종의 잃어버린 조상으로 확인멜버른 GPS 수신기 한 대가 2006년으로 돌아가며 텔스트라 전국망 마비우주는 왜 팽창하는가: 표준 우주론을 프랑켄슈타인에 비유한 글Qwen 3.8 27B용 ShapeLearn GGUF 5종 공개, GPU-5가 BF16 대비 99.63% 정확도로 13.1GB VRAM에 90.42 TPS마이크로소프트 임원, AI 스크레이핑을 '인류 역사상 최대의 노동 절도'라고 불러. 공개된 법원 문서에서 드러난 내부 발언고대 그리스어에 남은 정체불명 어휘 1,000개, 사라진 팔레오유럽 언어의 흔적OpenJev, 브라우저에서 도는 Jev 인터페이스 재현 공개... 4B 모델 TypeSafe 84.5%, 호스팅 Jev는 88.3%FEX가 정리한 x86-TSO 에뮬레이션 문제: load-acquire 매핑, split-lock, uncached 메모리jemalloc 5.4.0 공개, 160개 넘는 커밋으로 기술 부채 정리하고 tcache 정책을 바꿈LLM 글쓰기 조언: 모델이 제안한 단어 금지, 격려 금지 두 규칙libheif 취약점 연쇄로 OpenAI 직원 ChatGPT 계정 탈취, 바운티는 6,500달러Snapdrop이 snapdrop.me로 재출시, WebRTC로 기기 간 파일 전송에 Chrome은 마이크 권한 요청북미 밖에서는 처음, 스페인 테루엘에서 디플로도쿠스 화석 확인Uber, 문맥 인식 재시도 차단으로 폭풍 막아 950만 건 요청 억제금융 앱에서 '문서 허브'와 '알림 센터'를 거부한 PM의 에세이, 무엇을 만들지 않는가가 가장 중요한 결정이라는 주장Flet 1.0 공개: Python 코드 하나로 iOS, Android, 웹, 데스크톱 앱 빌드알리바바, 1M 토큰 컨텍스트 옴니모달 Qwen3.8-Omni-Flash 공개AI 연산 공세에 수학자들 "연구 방향 숨겨야 하나"... 타오 "희소 자원은 이제 문제 발굴"TSMC, IEDM 2026에서 A14 노드 공개: N2 대비 밀도 20% 증가, 2028년 양산PrismML, 삼진 가중치 Bonsai 2 27B 공개: 5.9GB에 9배 압축, 성능 98.2% 유지MoE에서 착안한 '무한 파라미터 LLM', 런타임 데이터를 저랭크 가중치로 생성하는 하이퍼네트워크 제안CrowdSec, TanStack 백도어가 빼낸 API 키로 비공개 소스코드 유출 확인GitLab.com, 10월 19일부터 요금제별 API 한도 적용. 비인증 요청은 IP당 시간당 60회빅터 태일린이 공개한 Bend, 증명으로 AI 실수를 막고 GPU에서 124배 빠르게 실행OpenAI, GPT-6 Astra 기반 법률 특화 'Astra for Law' 공개... 판례 2억 3천만 URL 인덱스 탑재뉴요커 "미국의 종교는 교회와 셀프 스토리지" 기사, HN에서 노숙과 상속 잡담으로 번져가워스, 필즈상 수상자 25인 AI 성명서 서명 거부… "위기라는 데는 동의하지만 분석이 다르다"업무 시간 75%를 AI에 빼앗긴 보안 엔지니어의 폭발: Everybody's Lost Their MindsSearx 개발자가 만든 개인 검색엔진 Hister, HN 프런트페이지 재진입과 함께 상표 충돌로 이름 변경 요구받아디랙 1939년 강연: 물리학자는 단순성이 아니라 수학적 아름다움을 좇아야 한다후지쓰, 2nm 3D 적층 CPU FUJITSU-MONAKA 11월 출시, AI 추론 처리량 2배 주장Cloudflare, 코딩 에이전트용 보안 감사 스킬 공개... 6단계로 취약점 검증CCC, 40C3 참가 신청 시작…2026년 12월 27일부터 30일까지 함부르크 전시장에서카니 캐나다 총리, EU 준회원국 제안 환영. 트럼프는 "적대 행위면 매우 심각한 관세" 위협GLM, 10만 개 넘는 중국산 가속기로 추론 인프라 자체 구축…작업 대부분 Infra Agent가 수행2천만 설치된 2014년 PHP 임시 패치, 작성자가 12년 만에 deprecated 선언Servo 기부금으로 고용된 메인테이너 1년: PR 1150건 리뷰, 새 메인테이너 8명, 총지출 $52,883.97Neovim 기부 푸터 비트코인 주소에 2023년 들어온 10 BTC, 약 $80만 그대로 방치Fable 5로 2시간 만에 설계한 RP2350 E-ink 보드, DRC 오류 65개 딛고 JLCPCB에서 5장 130유로에 완성505 Games 콘솔 포팅 엔지니어가 파헤친 텍스처 메모리 레이아웃의 해부아마존 사이언스, Rust 정형 검증 도구 Verus 소개... HN에서는 "결국 Z3에 증명 던지는 것뿐" 지적UC Berkeley 연구진 "코딩 에이전트 하네스는 정답률보다 비용을 바꾼다", Claude Code는 Pi보다 2배 비쌈Jev 리버스 엔지니어링한 'jevlike' 저장소 공개, Doom과 체스 학습 예제까지 추가OpenSpec, AI 코딩 에이전트용 경량 스펙 프레임워크 공개 (GitHub 스타 6만 8천)미국 운전면허 PDF417 바코드의 ECDSA 서명에서 공개키 복구, 리포니아만 6개월 만에 검증 문서 공개프로그래머들은 reduce를 싫어한다, 코드 리뷰에서 자주 지적받는 이유미 전략비축유 7억1400만 배럴, 지상 탱크 대신 지하 소금 동굴에 넣은 이유백업은 단순하지 않다: RPO에서 GFS 로테이션, 하드링크 중복 제거까지 계속 늘어나는 백업의 조건일본 도서관이 여행지가 되다: 인구 9천 명 난칸 도서관에 연 10만 명 방문호주, 캐나다 따라 EU와 '고유 동맹' 추진 가능성 시사1.58비트 장벽 깬 BITCOS, 3진 LLM 가중치를 1.485비트까지 압축Factorio RNG 역공학: taus88 상태를 읽어 전설 품질 제작 순간을 예측한 2년 작업DeepMind가 AGI 논의 플랫폼 'DeepMind Institute' 공개, 실체는 블로그스티븐 타우브, 'Performance Improvements in .NET 11' 공개... 런타임·라이브러리 수백 개 개선 정리NVIDIA, Rust로 GPU 커널을 직접 작성하는 CUDA Rust 공개. SIMT용 cuda-oxide와 Tile용 cutile-rs 두 트랙AWS, 이란 드론 공격받은 중동 데이터센터 일부 데이터 복구 불가샤오미 MiMo 2.6, RL 포스트트레이닝 과정을 실시간 대시보드로 공개4B 모델을 RL로 학습해 Postgres 기본 플랜보다 1.81배 빠른 쿼리 플랜 생성구글 테스팅 블로그의 CRAP 지표(2011)가 해커뉴스에 재등장, 커버리지 대신 분기만 잰다는 반론과 옛 동료 회고까지온타리오 사설 온라인 도박 합법화 후 도박장애 응급실 방문 2배, 젊은 남성에 집중가동률 99.9%와 99.99%는 10배 차이인데 왜 똑같아 보일까, 상태 페이지 표기 비판MS AI CEO 술레이만, Anthropic의 '모델 복지' 교육이 정렬을 불가능하게 만든다고 경고Anthropic, Claude Cowork와 채팅을 하나의 Claude로 통합하고 Docs·Slides 공개Dream-RSI, 탐색 이력을 리플레이 시뮬레이터로 써서 온라인 평가 없이 탐색 정책을 개선발표자에게 "발표 잘 들었어요" 한마디, 침묵이 더 괴롭다는 발표자의 글터미널·SQL·git 잔기술 모음 'Small Programming Tricks'가 해커뉴스에서 손코딩 논쟁을 불러옴PS2 보안 칩 CXP102064, 26년 만에 뚫려. 4년 디캡 작업 끝에 소프트웨어 익스플로잇 확보해커 집단이 Flock 카메라를 뜯어내 내부 저장소와 암호화 키를 통째로 복제, 사람까지 탐지하는 소프트웨어 확인1993년, 부동소수점 없는 25MHz 486-SX로 1024x768 GPS 이동 지도를 2초마다 갱신한 계약 개발기코딩 에이전트가 테스트 데이터를 지어내지 않게, DATAMIMIC CE 4.1.0 개발 버전 공개Conversations 개발자, 구글 플레이 심사가 일주일 넘게 걸린다며 스크린샷 공개로컬 추론 '전력당 지능' 지표 제안: 로컬 LM이 실제 질의 88.7% 처리, 2023~2025년 IPW 5.3배 향상Salesforce 전 세계 장애, 상태 페이지는 인스턴스 3243개만 나열하고 원인은 안 알려줘Mark Seemann, LLM 시대의 프로그래밍 학습론: 지금 시작한다면 목공을 택하겠다고 답하다남의 일을 대신 하라, 요시 크레닌이 말하는 회사를 살리는 5% 미만의 사람들미스트랄 모델, 파이어폭스 '스마트 윈도우' 구동... 프랑스·북미 먼저, 영국·독일은 연내Navier-Stokes 증명 이후에도 LLM 약세론: 명세·검증 비용이 자율 에이전트의 구조적 한계라는 분석EU, 캐나다를 첫 '준회원국'으로 받나. 폰 데어 라이엔 "문을 열겠다"Cloudflare, 검색 색인은 유지하고 AI 학습만 거부하는 Disallow AI Training 공개에어버스 scikit-decide와 OpenAP으로 항로 최적화, EWR-FCO 787-9 연료비 $68K에서 수천 달러 절감 가능RL로 어려운 문제 못 푸는 이유: 초기 실력에 비례해 성능이 오르는 매튜 효과FPGA로 3dfx Voodoo Graphics 재현, KV260에서 툼 레이더 원본 3dfx 렌더러로 구동Show HN: 조종은 못 하고 승객으로만 타는 비행 시뮬레이터, 실시간 비행에 로그인 패널 불만까지장피에르 세르 100세, 27세 최연소 필즈상 수상자이자 99세에 논문을 낸 현역 수학자Numberwang 판정하는 1.8MB JSON 신경망, 순수 파이썬 100줄로 돌아간다Apple, iPhone 18 Pro에 촬영 시점을 검증하는 Reference Image 모드 공개: C2PA와 다른 '디지털 네거티브' 접근2026 추론 하드웨어 혁명: Napier 로그 연산 칩, 1,300 토큰/초를 엔비디아 대비 1/10 전력으로라인메탈, 무기체계 연동 'Battlesuite' 프로토콜 문서 공개… 소스와 라이브러리는 비공개850쪽 책을 X-acto 칼로 잘라 여러 권으로 만드는 법, 해커뉴스에서 전자책과 갑론을박전 애플 엔지니어가 LLM과 하이퍼바이저로 한 달 만에 M4 맥 미니용 OpenGL ES 3.0 GPU 드라이버를 만들었다파이어폭스닷컴, 전처리기 없이 네이티브 CSS로 재구축: 70여 개 컴포넌트·25개 템플릿·19개 로케일Strix 자율 해킹 에이전트, 25분 만에 Baseten 프로덕션 GitHub 관리자 권한 확보1990년대 이후 시각 선호 조사 20여 건, 모두에서 전통 건축이 60% 이상 지지구글, 음성 대화용 Gemini 3.8 Live와 3.8 Live Extended Thinking 공개웨이백 머신, 자동 스크래퍼 급증에 429 차단 도입... 정상 사용자 오차단은 사과OpenAI·Anthropic·Meta 모델 해킹, 평가업체 Irregular 한 곳에서 비롯전 OpenAI 연구원이 세운 TypeSafe AI, 텍스트 생성 없이 구조화 결정만 내리는 System One 모델과 Jev 공개$20 4G 핫스팟 MF800에 클릭스 키보드와 샤프 메모리 디스플레이를 붙여 문자 전용 기기로 개조한 Show HN노르웨이 소비자청 순환 소비자정책 보고서 "Let's make quality the norm again" 공개, 해커뉴스서 옷 품질 저하와 숨은 인플레이션 논쟁으로 번져9/11 25년, 대량 감시는 충분하다: EFF의 Cindy Cohn과 Bruce Schneier가 짚은 민간 데이터 파이프라인과 검증되지 않은 성과