StepFun의 1M 컨텍스트 MoE 모델 Step 5 Preview가 OpenRouter에 등장함, 활성 파라미터는 27B임
- StepFun의 Step 5 Preview는 600B 전체 파라미터 중 27B만 활성화되는 희소 MoE 구조이고 컨텍스트 창은 1.0M임
- 입력 $1, 출력 $2.70 per 1M 토큰으로 가격이 책정됐고 캐시 읽기는 $0.05임, 실제 가중 평균 입력 단가는 $0.0922 수준임
- 현재 StepFun 단독 제공자로만 호스팅되며 P50 지연 3.47초, 처리량 64 tps, 최근 3일 가용성 99.74%를 기록함
- 소프트웨어 엔지니어링과 금융 등 전문 업무 강점을 내세우며 대형 코드베이스와 문서를 다루는 장기 도구 호출 에이전트용으로 설계됨, 다만 구조화 출력 오류율은 14.59%로 높게 나타남
- 상위 트래픽 앱은 OpenClaw(313B 토큰), Hermes Agent(59.6B 토큰), Cline(45.5B 토큰)임
Hacker News opinions
아티피셜 애널리시스 점수로 보면 경쟁력이 별로 없어 보임. 나중에 더 잘하라는 식으로 넘어감
속도는 빠른 편임. OpenRouter 평균이 115 tokens/sec이라 돈 조금 더 내고라도 빠른 추론을 쓰고 싶음. 근데 평균 지연이 1.5초라 에이전트 작업에서는 체감이 다를 수 있음
아티피셜 애널리시스 벤치마크는 편향이 있어서 최종 판단 기준으로 보기는 어려움. 여러 용도를 한꺼번에 재는 종합 지수는 파워 유저한테는 별로 쓸모없음
이거 space bunny 알파 모델 아니냐는 얘기가 있었는데 테스트해보니 아닌 것 같음. Space Bunny는 Minimax 계열 힌트가 있었음
ZenMux에는 최소 2주 전부터 올라와 있었음. 숨기고 있던 모델은 아님
이 모델이 왜 재밌냐는 질문이 있었는데, StepFun이 3.5 때 SOTA에 가까운 모델을 냈던 팀이라 새 모델이 나오면 관심을 받는 편임. 오픈 모델이라는 점도 큼
무료로 풀려 있는 동안만 쓸 만하고 그 뒤는 글쎄임
새 아키텍처 같은 걸 좀 보고 싶음. LLM은 다 비슷비슷해 보여서 아쉬움
Artificial Analysis를 멘탈 크러치로 쓰고 있는데, 이 기준으로는 Gemini 3.8 Flash보다 똑똑하고 살짝 쌈. OpenCode에서 일주일 정도 써볼 생각임. 근데 Muse Spark 1.3에서 갈아탈 만큼 끌리지는 않을 것 같음
Step 모델은 128GB 공유 메모리 장비에서 돌아가는 첫 로컬 모델이었음. Qwen Flash Next랑 비교해보고 싶은데, 600B-A27B라 228GB로는 못 돌리는 게 아쉬움