Fireworks, Kimi K3 기반 Ember-1 공개: 추론 토큰 40% 줄이고 품질 유지
- Fireworks Research가 Kimi K3를 바탕으로 만든 Ember-1을 9월 23일 공개함. 같은 답을 내면서도 생성 토큰을 40% 줄인 것이 주장의 핵심임.
- Kimi K3 같은 추론 모델은 생성 토큰의 90% 이상을 내부 추론에 쓰고, 멀티턴 에이전트 작업에서는 이전 추론을 매 턴 다시 읽게 되어 컨텍스트가 턴 수에 대략 제곱으로 늘어남.
- 공개 벤치마크 7개와 고객 2곳의 프로덕션 A/B 테스트에서 K3의 추론을 35~50% 줄여도 정확도가 유지된 것으로 확인됨.
- 성과는 reasoning effort 단순 하향이 아니라 재학습으로 얻었고, 팀은 실험 50회 이상과 평가 200회 이상을 돌리며 추론을 줄이는 새로운 학습 알고리즘을 개발함.
- 학습은 Fireworks Serverless Training에서 진행했고 고객 데이터는 쓰지 않은 채 자체 데이터로 수학·코딩·검색·툴 사용·소프트웨어 엔지니어링에서 훈련함. Ember-1은 Fireworks 특화 모델 시리즈의 첫 작품임.
Hacker News opinions
사람 지능만 분석 마비에 빠지는 게 아니고 AI도 똑같이 그런 듯.
일부 중국 모델은 thinking trace에 전체 답변을 써놓고 유저한테 또 출력해서 내용이 걸쳐짐.
요새 AI 글은 전부 pareto frontier 얘기야. 나만 계속 못 보고 있었나?
걍 '가성비 최고'라고 하면 될 걸 굳이 pareto frontier라는 표현을 씀.
Kimi K3에서 추론 토큰을 줄인 거라 딱히 신선하지도, 처음 들어보는 벤치마크 위의 pareto라 끌리지도 않음. 그런데 라이선스까지 Kimi K3보다 닫혀 있으면 더 뭣이고.
벤치마크는 절반만 얘기해줌. 토큰 줄이다가 뭘 잃었는지(예를 들어 Golang 원래 끝내줬는데 지금 떨어짐?) 구분이 안 나옴. 차트로 그릴 수 없는 정보라 아쉬움.
GLM 5.3 Flash도 비슷한 결과일 텐데 비교를 안 해봤네.
폐쇄형이든 오픈이든 오픈 모델 쪽이 이런 작업으로 빠르게 앞서나가는 거 아님? 리눅스, 위키피디아가 그랬던 것처럼.
글쎄, 폐쇄형 랩은 빌려가기만 하고 돌려주질 않아서 그게 안 될 듯.
리눅스가 이겼던 원인이 기술이 아니라 조직 자유도였다고 봄. 빅 컴퍼니 병 안 걸리면 AI도 진영이 갈릴 거고, OpenAI랑 Anthropic이 Google 때리는 게 그 증거임.
Qwen 3.8도 로컬 모델 중에 유난히 생각이 길어. 이런 기법이 다른 모델에도 일반화될까?
대형 모델에는 되겠지만 Qwen 3.8 27B는 아닐 것 같음. Kimi K3가 2.8조 파라미터라서 CoT를 줄여도 품질이 안 떨어지는 게 커 보이는데 근거는 그냥 감임.
오픈 가중치 위에서 학습해놓고 정작 가중치는 안 내놓는 거잖아. 내가 제대로 읽은 거지?
Kimi K3 라이선스 자체에 제약이 많아서 진짜 오픈 웨이트라고 부르긴 애매함. bsl·fsl의 소스 오픈과 같은 결로 봄.
글 자체에서도 알파가 다 빠져 있음. 'task and environment feedback', 'on-policy planning and learning' 식으로 아무 정보도 안 주면서 과학적으로 들리는 표현만 나열함.
솔직히 Sol 가격 떨어진 지금은 Kimi K3 값어치가 별로임. 우리 벤치마크에서는 Sol이 품질도 비용도 Kimi보다 나았음. Sol은 2/10, Kimi는 3/15 수준.
GLM 5.3이 Kimi K3급 성능을 절반도 안 되는 가격에 내줌. 오픈 웨이트 쪽에서도 값어치가 안 남음.
내 벤치마크에서는 Ember가 아직 안 뽑힘. 계획은 Opus 5.5가 이기고 코드는 GPT-6 Sol이 더 싸면서 10/10으로 점수도 높음. Ember는 인텔리전스 인덱스가 없어 시작 점수가 0.73이라 Sol의 0.975에 비해 0.954에 그침.
Fireworks가 쓴 Serverless Training 인프라는 진짜 눈에 띔. 대형 몇 개 랩이 아니면 이런 학습 파이프라인 세워보기도 힘든데 다큐라 가능한 일임.
그건 그냥 더 비싼 장난감 아닌가 싶은데.
DeepSeek 가격에는 어떤 값어치 프로포지션도 안 남음.