Reflection이 501B 오픈웨이트 MoE 모델 Beam 공개, 가중치는 이번 달 말
- Reflection이 첫 오픈웨이트 모델 Beam을 공개함. 총 501B 파라미터에 활성 23B인 희소 MoE 구조로 코딩, 추론, 에이전트 작업을 겨냥함.
- 프리트레이닝에 23.8T 토큰을 썼고, RL은 NVIDIA GB300 10.5K에서 4주간 1억 건 넘는 롤아웃을 생성함.
- 벤치마크는 SWE Bench Pro v2-Hard 77.2, Terminal Bench v2.1 80.1, SWEBench Verified 80.9, GPQA Diamond 90.5로 GLM 5.2와 비슷한 수준이나 Kimi K3에는 뒤짐.
- GLM-5.2와 비슷한 추론 점수를 3~4배 적은 추론 컴퓨팅으로 낸다고 주장함.
- 가중치와 기술 보고서, 모델 카드는 이번 달 말 공개 예정이며 지금은 얼리 액세스 신청만 받음.
Hacker News 의견들
가중치도 없고 기술 디테일도 없이 얼리 액세스 신청 링크만 던지는 발표임. 오픈 모델 늘어나는 건 좋은데, 근거가 없으면 가중치랑 HF 레포부터 올려야지.
"proprietary dataset"이라는 말도 웃김. 보여주기 싫다는 뜻이거나, 별 특별한 데이터가 없어서 비밀 재료 있는 척하는 거임.
데이터는 어디서 구하는지 궁금함. GPU랑 전기 다 있는데 데이터가 없으면 공개 데이터셋부터 시작하면 됨. fineweb만 50TB임. scale.com data-engine에서 사는 방법도 있고.
Claude한테 물어보면 알려줌. 중국 회사들이 그렇게 한다던데, 계정 수천 개에 레지덴셜 프록시 돌려서.
데모 이미지에 "이 퍼즐은 며칠 된 거라 학습 데이터에 없음"이라고 써놨는데, 그 퍼즐 2025년 8월에 LessWrong에 이미 올라왔음.
퍼즐 나이보다 요즘 모델은 다 검색한다는 게 문제 아님? 어차피 검색 능력이 붙어 있음.
프리트레이닝 1일차에 런치 모니터링하러 방에 있었는데, 처음부터 학습하는 걸 보는 게 정말 좋았음. 그런데 그런 대규모 학습에서 무슨 텔레메트리를 보나?
성능 차트가 더 좋은 오픈소스 모델을 접힌 아래로 밀어서 자기가 이긴 것처럼 보이게 만듦. 실제로는 아님.
그 링크 보고 DeepSeek 4.1 Flash를 한번 봐야겠다는 생각만 들었음.
DeepSeek v4.1 Flash보다 크고 더 비싸고 측정된 모든 지표에서 더 나쁜데, 내가 뭘 놓친 건가.
새로 들어오는 랩은 다 환영함. 첫 릴리스부터 기록을 깨야 하는 건 아니잖아. 미국 랩의 새 진입이라는 게 포인트임.
"Beam advances the Western open-weight frontier"라는 문구가 포인트임. 외국 모델 못 쓰게 하는 정부 계약이 있으면 이게 팔림.
아직 오픈도 아니고 API로도 못 씀. 비교 대상도 Inkling, GLM 5.2 같은 비 SOTA 모델이고, GLM 5.3과 DeepSeek V4.1 Flash는 표에는 넣고 차트에서는 뺐음.
개선이 필요하다고 인정하는 회사라니 반가움. Kimi K3가 원시 성능에서 앞선다는 걸 인정한 부분.
하드웨어 요구사항이 궁금함. 추론 속도 최적화면 작은 하드웨어에 유리할 수도 있는데, 파라미터 대비 자원을 많이 먹을 수도 있고.