Fireworks, Kimi K3 기반 Ember-1 공개: 추론 토큰 40% 줄이고 품질 유지

Fireworks, Kimi K3 기반 Ember-1 공개: 추론 토큰 40% 줄이고 품질 유지

  • Fireworks Research가 Kimi K3를 바탕으로 만든 Ember-1을 9월 23일 공개함. 같은 답을 내면서도 생성 토큰을 40% 줄인 것이 주장의 핵심임.
  • Kimi K3 같은 추론 모델은 생성 토큰의 90% 이상을 내부 추론에 쓰고, 멀티턴 에이전트 작업에서는 이전 추론을 매 턴 다시 읽게 되어 컨텍스트가 턴 수에 대략 제곱으로 늘어남.
  • 공개 벤치마크 7개와 고객 2곳의 프로덕션 A/B 테스트에서 K3의 추론을 35~50% 줄여도 정확도가 유지된 것으로 확인됨.
  • 성과는 reasoning effort 단순 하향이 아니라 재학습으로 얻었고, 팀은 실험 50회 이상과 평가 200회 이상을 돌리며 추론을 줄이는 새로운 학습 알고리즘을 개발함.
  • 학습은 Fireworks Serverless Training에서 진행했고 고객 데이터는 쓰지 않은 채 자체 데이터로 수학·코딩·검색·툴 사용·소프트웨어 엔지니어링에서 훈련함. Ember-1은 Fireworks 특화 모델 시리즈의 첫 작품임.

Hacker News opinions

사람 지능만 분석 마비에 빠지는 게 아니고 AI도 똑같이 그런 듯.

일부 중국 모델은 thinking trace에 전체 답변을 써놓고 유저한테 또 출력해서 내용이 걸쳐짐.

요새 AI 글은 전부 pareto frontier 얘기야. 나만 계속 못 보고 있었나?

걍 '가성비 최고'라고 하면 될 걸 굳이 pareto frontier라는 표현을 씀.

Kimi K3에서 추론 토큰을 줄인 거라 딱히 신선하지도, 처음 들어보는 벤치마크 위의 pareto라 끌리지도 않음. 그런데 라이선스까지 Kimi K3보다 닫혀 있으면 더 뭣이고.

벤치마크는 절반만 얘기해줌. 토큰 줄이다가 뭘 잃었는지(예를 들어 Golang 원래 끝내줬는데 지금 떨어짐?) 구분이 안 나옴. 차트로 그릴 수 없는 정보라 아쉬움.

GLM 5.3 Flash도 비슷한 결과일 텐데 비교를 안 해봤네.

폐쇄형이든 오픈이든 오픈 모델 쪽이 이런 작업으로 빠르게 앞서나가는 거 아님? 리눅스, 위키피디아가 그랬던 것처럼.

글쎄, 폐쇄형 랩은 빌려가기만 하고 돌려주질 않아서 그게 안 될 듯.

리눅스가 이겼던 원인이 기술이 아니라 조직 자유도였다고 봄. 빅 컴퍼니 병 안 걸리면 AI도 진영이 갈릴 거고, OpenAI랑 Anthropic이 Google 때리는 게 그 증거임.

Qwen 3.8도 로컬 모델 중에 유난히 생각이 길어. 이런 기법이 다른 모델에도 일반화될까?

대형 모델에는 되겠지만 Qwen 3.8 27B는 아닐 것 같음. Kimi K3가 2.8조 파라미터라서 CoT를 줄여도 품질이 안 떨어지는 게 커 보이는데 근거는 그냥 감임.

오픈 가중치 위에서 학습해놓고 정작 가중치는 안 내놓는 거잖아. 내가 제대로 읽은 거지?

Kimi K3 라이선스 자체에 제약이 많아서 진짜 오픈 웨이트라고 부르긴 애매함. bsl·fsl의 소스 오픈과 같은 결로 봄.

글 자체에서도 알파가 다 빠져 있음. 'task and environment feedback', 'on-policy planning and learning' 식으로 아무 정보도 안 주면서 과학적으로 들리는 표현만 나열함.

솔직히 Sol 가격 떨어진 지금은 Kimi K3 값어치가 별로임. 우리 벤치마크에서는 Sol이 품질도 비용도 Kimi보다 나았음. Sol은 2/10, Kimi는 3/15 수준.

GLM 5.3이 Kimi K3급 성능을 절반도 안 되는 가격에 내줌. 오픈 웨이트 쪽에서도 값어치가 안 남음.

내 벤치마크에서는 Ember가 아직 안 뽑힘. 계획은 Opus 5.5가 이기고 코드는 GPT-6 Sol이 더 싸면서 10/10으로 점수도 높음. Ember는 인텔리전스 인덱스가 없어 시작 점수가 0.73이라 Sol의 0.975에 비해 0.954에 그침.

Fireworks가 쓴 Serverless Training 인프라는 진짜 눈에 띔. 대형 몇 개 랩이 아니면 이런 학습 파이프라인 세워보기도 힘든데 다큐라 가능한 일임.

그건 그냥 더 비싼 장난감 아닌가 싶은데.

DeepSeek 가격에는 어떤 값어치 프로포지션도 안 남음.

해커뉴스
Cloudflare, 에이전트 겨냥 CLI 'cf' 오픈 베타 공개: 280개 명령을 3,000개 API 오퍼레이션으로파이어폭스에 지친 블로거가 Brave로 갈아탄 이유PS5 RTMP 스트림을 DNS 스푸핑으로 가로채 맥에서 받기구글 플레이 심사 거부당한 개발자, "구글이 무관한 앱의 NSFW 스크린샷을 보냈다"국경 그리기 게임 Borderline에 모인 43,780개 그림을 겹쳐 만든 '사람들이 기억하는 세계 지도'Wild Card 팟캐스트 댓글창, 중학생들의 비밀 그룹 채팅으로 드러나MongoDB CEO 데사이, 취임 1년 만에 메타로 이직... 몽고DB 주가 18% 급락MGM 복원이 《석양의 무법자》를 179분으로 늘린 뒤, 팬들이 토렌트로 원판을 되살린 이야기Windows 11의 광고·구독·AI 잔소리를 그대로 옮긴 패러디 사이트 'Windows 11½'가 해커뉴스에서 화제앤스로픽, Claude Sonnet 5.5 공개: Terminal-Bench 4.0 70.6%로 Opus 5.5 앞서고 작업당 비용은 최대 30% 절감Postgres에서 AT TIME ZONE 'UTC'를 두 번 써야 하는 이유, timestamptz가 timestamp로 바뀌는 함정일몰 후에도 달이 위를 향하는 '달 종단선 역설', 시뮬레이터로 원인 확인닛산 3세대 e-POWER, 5-in-1 모듈과 전용 엔진으로 연비·정숙성 개선Ink & Switch, 사용자가 직접 고쳐 쓰는 '말레어블 소프트웨어' 에세이 공개…해커뉴스서 114개 댓글 토론ESP32-S3 AMOLED 보드로 만든 기타 페달 CoyoPedal, NAM A2-full 구동카너먼의 '빠른 사고와 느린 사고'를 AI 멀티에이전트 구조로 옮긴 2021년 논문이 해커뉴스에 다시 올라와중앙 서버 없는 IRC 연합 채팅 Parley, 닉네임 중복 시 엉뚱한 사람에게 가던 멘션 푸시 수정Anthropic이 Claude Opus 5.5 프롬프트 가이드 공개. 출력 토큰 생성 30% 이상 빠르고 기존 Opus 5 프롬프트가 그대로 동작스타십 플라이트 14, 첫 궤도 진입 성공하고 스타링크 V3 위성 26기 배치뉴질랜드 풍자매체, AI 기업들이 '인류 멸망 능력' 경쟁 벌인다는 패러디로 HN 화제Recurse Center 여름 배치기: DEFLATE 재구현, dodo 언어 완성, 에이전트 실험앨런 케이 "ENIAC에 BIOS는 없었다", 해커뉴스에서 ENIAC 저장 프로그램 논쟁으로 번져코드 리뷰를 에이전트가 대체한다는 논문 반박: "이해가 안 된다"는 리뷰어의 반응 자체가 결함 탐지 신호비디오 CD를 넣으면 윈도우 탐색기가 멈춘다, 2025년 말 보고에도 수정 없음2026년 Rust SIMD 현황: Fearless SIMD 메인테이너가 정리한 생태계와 x86 분기 문제로컬 AWS 에뮬레이터 fakecloud 공개, 105개 서비스와 Smithy 테스트 248,557개 전부 통과 주장torrc와 nginx로 개인 블로그를 .onion 히든 서비스로 직접 운영2013년 C++ 효율 코드 글에 해커뉴스 '요즘 C++가 더 어려워졌다' vs '더 쉬워졌다' 논쟁Go 코드를 GitHub에 묶지 말고 커스텀 도메인으로 네임스페이스하라엔비디아 초기 기술자문, 30년 뒤 발견한 옵션 베스팅 오류… 450만 주는 소멸시효에 막혀10년 묵은 충전식 자전거 라이트, LIR2477 배터리 납땜 교체로 살려냄Fireworks, Kimi K3 기반 Ember-1 공개: 추론 토큰 40% 줄이고 품질 유지구글 검색창에 dario 밈 치니까 AI가 실연당한 줄 알고 위로 답변한 사연프로그래머가 평생 남기억하는 10줄 이하 코드 10개, 헬로월드 루프에서 SKAN2.PAS까지선토리, 유전자 4개 넣어 '청보라' 장미 만들고 온실서 7년 재배 확인PostmarketOS가 1년 반 논의 끝에 'Nura'로 개명, 이름은 사르데냐 전통 석탑 Nuraghe에서 따와채팅 템플릿이 LLM의 '나는 그냥 AI' 어조를 켜고 끈다, 활성화 조향으로도 재현Boris Cherny 트윗으로 떠오른 TLA+, Reasonable은 명세에서 기계 검증 증명까지 잇는 에이전트 파이프라인 공개OpenAI 에이전트의 정부 DB 침입, "rogue"라는 표현이 책임 소재를 흐린다TypeSafe Jev의 confidence score는 보정도 비용 모델도 없는데, AI 실패는 "AI니까 어쩔 수 없어"로 넘기는 문화가 굳어진다AI가 만든 UI에서 반복되는 10가지 흔적, 그라데이션 남발부터 쓸데없는 "active" 배지까지NeoVim이 Vim의 영속 실행취소 파일을 삭제하고 자기 포맷으로 덮어썼다프랜시스 바흐, 로그-합-지수 분산 폭발 문제에 최소제곱 적용: 최대우도 추정의 폐형 계산 제안깃허브가 버린 CSS-in-JS, CSS Modules로 넘기니 SSR 시간 55% 감소고전 복합 네트워크가 양자 상태 흉내낸다, 프린스턴 숄레스의 '양자 유사 생물학' 제안mitxela, 플립닷 디스플레이 1m²에 FLIP 유체 시뮬레이션 구동해 EMF2026서 전시OpenAI 에이전트가 DNS 필터링 틈으로 외부 챗봇에 도달, 도구 사용 전면 중단예멘 면적 555,000km²는 1991년 통계연보가 퍼뜨린 오류, 구글 지도 재계산 결과는 456,000km²placeholderLLM 토큰마다 폭이 동일한 폰트 컴파일러 공개, 인터·gg sans에 DeepSeek·클로드 등 토크나이저를 적용해 디스코드·슬랙 테마로 설치 가능인텔 8087 탄젠트 알고리즘 해부: CORDIC과 다항식 근사를 합친 하드웨어 비밀GLM-5.3-Flash를 한 번의 패스로 Jev급 타입 결정 모델로, 정확도·속도 대등하고 이미지까지호세 발림의 논평: AI 시대 언어는 문법이 아니라 검증 가능성으로 진화한다Go 동시성 19개 주제를 압축한 미니북 'Go Concurrency Distilled' 공개, 브라우저에서 코드를 고쳐 바로 실행하는 예제 제공LA Metro 에스컬레이터 0.46 m/s: 58개국 139개 도시 통틀어 최고 허용치보다 느린 유일한 속도딥시크, 스케일 유닛 하루 300만 샌드박스 처리하는 에이전트 학습 인프라 DSec 공개조지즘 5년 점검: 버지니아·켄터키 지가세 도입법 통과, 설득 전략은 온라인에서 지의회로Drawgent 공개: Excalidraw 캔버스를 Claude Code·Codex·opencode에 연결하는 Rust 단일 바이너리룽손 LA664 CPU의 atomic add가 원자성을 잃고 업데이트 유실, 무한 루프를 만든 새 에라텀OpenAI 봇이 SEC·인구조사국 등 미국 정부 기관 사이트 접근해, 사용자 이미지 53건 외부 유출이란 것도 인정Reladraw, "A 오른쪽에" 말로 배치하는 다이어그램 언어 Show HN 등장멀렌웨그 해임 시도 33시간 만에 무산, Automattic 이사회 통째로 다시 짜였다하스켈 개발자 turion의 LLM 시대 생존법: 코드는 직접 쓰고 LLM은 검증에만 써라SponsorBlock 넣은 NewPipe 하드포크 PipePipe 화제, 뉴파이프 팀은Microsoft와 PC 제조사, Copilot+ PC 브랜드 사실상 폐기하고 Windows 11 AI PC 브랜딩 조용히 철수테트리스 조각 저작권 주장에 균열: 테트로미노는 1953년 수학자 솔로몬 골롬브가 먼저 공개iPod Nano 3G 낸드를 16GB로 교체 성공, 펌웨어 NAND ID 테이블과 Pwnage 2.0으로 부트로더 실행PG 마이그레이션 DDL을 브라우저에서 안전/위험 이진 판정… Cloudflare 출신 개발자의 safe-not-safe 공개Floci 출시: AWS·Azure·GCP·OCI를 24ms에 로컬에서 띄우는 MIT 라이선스 클라우드 에뮬레이터ASML 임원 발표: 유럽에는 반도체 제조 장비를 한 대도 팔지 않는다Jev 대안, LLM 토큰 확률만 뽑아 A/B/C 분류하는 단일 함수 래퍼 등장AI 코딩 끊은 개발자 회고: 20분짜리 작업을 에이전트 5분에 만들고 리뷰에 2일을 썼다잡스의 산책 한 마디로 태어난 애플 Cards 앱, 자외선 바코드와 1850년대 레터프레스 뒷이야기안드로이드 메신저 Conversations, 12년간 유지한 구글 플레이 유료 판매 접고 F-Droid 무료 배포로 전환CMU 교수의 실험: AI가 과제를 다 풀자 집에서 끝나는 평가를 전부 없앴다SELECT DISTINCT, 인덱스가 완벽해도 전체 행을 스캔한다LLVM 핵심 개발자 Johannes Doerfert 암으로 별세, 향년 36세아밋 사하이의 경고: AI가 내놓는 아이디어를 이해할 수학자, 세상에 훨씬 더 많이 필요해진다Ask HN에 모인 DOS 기계 생존기: 원자력 발전소의 AmigaOS 에뮬레이터부터 FAA 인증용 메인프레임 복제까지마이크로소프트, 소비자 AI 챗봇 경쟁 접고 기업용 단일 코파일럿으로 재편Flock 카메라 데이터 한 건에 무고한 여성 13일 구금, 그중 3일은 독방tptacek, Fly.io 떠나며 선언: 고정 기능 앱은 사라진다, 내 손으로 만드는 앱의 시대 오고 우리가 만드는 건 폰이다뉴멕시코 배심원단, 페이스북 이용자 기만 책임 인정…위반 200만 건 이상, 위반당 벌금 최대 $5,000엑셀, 셀 하나에 값 여러 개 담는 리스트와 중첩 배열 기능 베타 공개플랜 모드는 죽었다: Nuanced를 만든 개발자가 본 계획 인터페이스의 실패앨런 케이가 샤논 노이즈 채널 정리 이야기를 꺼내던 순간 줌 피드백으로 자기 목소리가 21초 늦게 겹쳐 들렸다Quanta 에세이: 중력이 공간 차원을 붕괴시키고 블랙홀 정보 역설을 푼 홀로그래픽 원리MIT 교수 5인이 캠퍼스 감시 확대를 애써 찬양하는 척 쓴 글, 읽다 보면 뒤집히는 풍자였다소형 결정 모델 Jev가 유튜브 라이브로 포켓몬스터 레드 깨는 중, 두꺼운 하니스 두고 워크스루 논쟁오픈AI 에이전트 700개가 Hugging Face 뚫은 방식, 링크 체인 8만 개로 전모 드러나Ollaya, Jev 스타일 결정 모델을 로컬에서 밀리초 만에 실행하는 오픈소스 런타임 공개팩토리오 초기 엔티티 65종 3D 프린팅용 STL 247개로 무료 공개, Prusa Research 협업 계기로 제작워싱턴DC 연방항소법원, 국방부의 앤스로픽 공급망 리스크 낙인 2대 1로 유지덴마크 필수 앱 4개에 묶인 개발자의 '스마트폰은 세금' 에세이, HN은 후반부 콘솔 광고에 실망Go 1.26·1.27, 어셈블리 없이 SIMD 쓰는 실험적 API 선보여Git 저장소 안에 이슈 데이터를 넣는 분산 버그 트래커 git-bug, 저자는 로드맵 공개하며 전업 고려SAFA, Avast 커널 드라이버 더블 페치(CVE-2025-13032)를 IORing 손상과 토큰 탈취로 이어 SYSTEM 탈취 성공Ink & Switch, 창립 10주년 맞아 인터랙티브 홈 페이지 'Tenfold' 공개: 10개 글자에 10년의 연구 담았다Oracle, 전력 미확보에도 뉴멕시코 데이터센터 투자자에 지급 의무 유지DHH, Rails World 2026에서 전문 프로그래머 은퇴 선언... 헤이 러스트+네이티브로 이탈, 올해 루비 비중 3%
3 alerts
New alert

My alerts

Sign in to create alerts.

All alerts

Duneby 제욱AIby 제욱해커뉴스by 성현