Mercury 2.5 초당 781토큰 생성에 175개 모델 중 속도 2위, 지능 점수 12는 평균 이하
- Inception이 2026년 9월 출시한 Mercury 2.5의 출력 속도가 초당 780.8토큰으로 175개 모델 중 2위를 기록함.
- Artificial Analysis Intelligence Index 점수는 12로 중위값 13에 못 미쳐 175개 중 91위에 그침.
- 가격은 입력 1M토큰당 $0.25, 출력 1M토큰당 $0.75이고 캐시 할인은 90%로, 인덱스 1회 과제당 비용은 $0.06임.
- 인덱스 평가에서 생성한 출력 토큰이 35M으로 중위값 85M의 40% 수준이라 비교적 간결한 편이고 컨텍스트 창은 260k토큰에 텍스트 입출력만 지원함.
- 해커뉴스 댓글에선 속도에 비해 지능이 14B급이라는 사용 평가와 함께 확산형(diffusion) LLM 방식의 서빙 비용 문제가 거론됨.
Hacker News opinions
속도가 의미가 없는 게, 프론티어 AI 회사들에 비하면 지능은 거의 꼴찌권이잖아.
그게 또 좋고 빠르고 싸면 고르는 거라는 오랜 공식이 또 맞아떨어진 거지.
내 제품 하나는 TTFT p99가 700ms를 넘는 LLM을 아예 못 씀. 속도가 곧 요구사항인 용도도 있음.
모델이 약해도 초안을 점진적으로 갈아치우면서 토큰을 태우면 반복 워크플로에선 과제를 끝낼 수 있어. 속도가 거기서는 의미가 있음.
$0.25에 $0.75면 DeepSeek V4 Flash나 Qwen 3.8-Flash-Next 급 오픈웨이트 추론 제공사보다 훨씬 비싼 건데, 170GB RAM에 들어가는 모델 기준으로 굳이 쓸 이유를 모르겠음.
근데 그 모델의 포인트가 속도잖아.
속도만 보면 Cerebras의 gpt-oss-120b가 1400tk/s에 지능 랭킹도 비슷함. 나도 취미 프로젝트 몇 개에서 써봤는데 속도가 장난 아님.
Kimi 2.6도 1000tps라던데, 우리가 문의했을 땐 대기가 12개월 넘고 연간 토큰 지출 최소 7-8자리 조건이었음.
근데 Cerebras에서 gpt-oss-120b 쓰지 마. 툴 콜 망가뜨리고 thinking 블록 안 닫고 문제투성인데 캐시 가격도 아예 없어서 에이전트 하나에 분당 $5-10씩 나옴. 속도만 좋지 그 값은 절대 아님.
4개월 전이었으면 신기했겠지만 지금은 이만한 사이즈 모델이 몇백 t/s 나오는 게 별로 새롭지 않음. Inco도 DS flash를 600 근처로 냈고.
Mercury 2.5를 내 과제에 꽤 돌려봤는데 그냥 14B 모델 수준이더라. 체감으론 GPT-OSS-20B가 훨씬 낫고, 속도랑 가격 조합이 아까운데 기본 과제에도 못 씀.
Celeris-magnus-1 써봐. 속도는 비슷한데 Qwen 27B dense에 훨씬 가깝게 동작함.
며칠 전에 써봤을 땐 응답이 너무 빨라서 세팅이 잘못된 줄 알았음. 근데 '비슷한 가격의 다른 모델과 비교하면 저렴하다'는 문장은 웃기더라. 바보처럼 빠른 모델을 대체 어디다 쓰냐고.
텍스트 확산 LLM은 막다른 길이라고 봄. 구글도 가지고 놀아보고는 가장 속도·비용에 민감한 소형 모델에도 추가 투자를 안 했잖아.
구글이 확산으로 안 넘어간 진짜 이유는 배치를 크게 묶어서 서빙하면 확산이 주는 속도 이득이 사라지기 때문임. 로봇처럼 온디바이스 저지연이면 얘기가 달라질 수 있고.
DiffusionGemma는 gemma-4 시리즈랑 같이 나온 지 몇 달 안 됐어. 확산을 포기한 게 아님. K2-Horizon-7B도 확산/비확산 두 버전으로 내고 둘 다 같은 지능이라고 주장하더라.
내가 듣기론 확산 요청끼리 하드웨어를 효율적으로 나눠 쓰기 어려워서 서빙 비용이 더 든다고 함. 로컬에서 도는 모델에는 기회일 수 있는데, 그래도 빅랩이 많이 안 파는 건 빨간 불이지.
이 모델은 gpt-oss-120b랑 벤치마크는 비슷한데 실제로는 더 느릴 수도 있으면서 좋다고만 하는 느낌임.
결국 도구 호출이 병목이 되면 모델을 코드 저장소랑 문서 같은 컨텍스트와 같은 데이터센터에 두는 게 나음.
Chat Jimmy는 LLM을 칩에 구워서 17K 토큰/초라던데, 다만 컨텍스트가 SRAM에 들어가면 거기가 병목이 될 거임.
맞아. 그건 진짜 이런 작은 모델에 좋은 로컬 도구가 됐을 텐데.