Cerebras, Qwen 3.8 27B를 공개 API에 추가해 초당 약 1,500토큰 제공
- Cerebras 공개 API에 Qwen 3.8 27B를 추가했으며, 문서는 생성 속도를 초당 약 1,500토큰으로 표기함
- Qwen 3.8 27B의 컨텍스트 창은 무료 체험에서 64k, 유료 요금제에서 128k 토큰임
- 공개 엔드포인트에는 120B 파라미터 gpt-oss-120b도 있으며, 문서상 속도는 초당 약 3,000토큰이고 컨텍스트는 무료 65k, 유료 131k임
- Cerebras는 공개 API 모델에 프루닝을 적용하지 않으며, 저장 시에만 일부 가중치를 16비트, 8비트, 4비트로 선택 양자화한다고 밝힘
- 품질에 민감한 레이어는 전체 정밀도로 저장하고 요청 시 역양자화하며, 활성값·어텐션·KV 캐시는 양자화하지 않는다고 설명함
Hacker News opinions
몇 달간 Coding Plan을 썼는데 모델 따라잡기가 힘들 정도로 출력이 빠르더라. Qwen 3.8 27B는 공개 엔드포인트에 올라온 것 중 가장 센 축 같음. 다만 API 토큰 과금만 되는 듯하고, 에이전트 코딩은 프롬프트 캐시 없으면 비싸졌었음.
우리 SaaS에서는 이런 속도면 UX가 확 달라질 것 같음.
문서상 프롬프트 캐시는 지원하는 것으로 보임.
예전에는 월간 요금제가 있었던 것 같은데 없어졌나?
공개 엔드포인트 기준으로 제일 강하다는 말이지. Cerebras는 OpenAI용 GPT 5.6 Sol도 엄청 빠르게 돌리더라.
왜 2.4T 모델 대신 작은 모델만 호스팅하는지 궁금함. 웨이퍼 사이 I/O나 인터커넥트가 병목이라서 그런 건가?
대부분 경제성 문제일 듯함.
Cerebras의 본업은 거대한 추론 칩 판매고, 추론 서비스는 하드웨어를 알리는 성격도 크다고 봄. CEO가 Gradient Dissent에서 얘기한 인터뷰도 있음.
웨이퍼 SRAM이 44GB뿐임. 메모리를 밖으로 빼면 모델 전체를 한 칩에 올려 얻는 속도 이점을 잃게 됨.
GLM 4.7로 Code 제품을 써봤는데 재미는 있어도 모델이 별로면 유용한 일을 잘 못 하더라. 이런 모델도 Code에 넣어주면 좋겠음.
고객 지원을 Discord에서만 받는 건 정말 싫음. Discord가 나를 봇으로 판단해서 이메일과 전화번호를 받아주지 않더라.
방금 계정 만들려 했는데 온보딩이 리다이렉트 루프에 빠졌음. 다른 사람도 그랬나?
OpenRouter에는 Cerebras가 있지만 Qwen 3.8은 아직 없더라. Qwen 컨텍스트도 128k라서 전문 서브에이전트로는 흥미롭지만 긴 작업에는 잘 안 맞음.
OpenRouter에서 Qwen 3.8 제공자는 지금 약 80 tps가 제일 빠름. Cerebras가 다른 모델은 올려뒀으니 이것도 곧 들어가면 좋겠음.
이 속도면 에이전트 작업에는 오히려 너무 비쌀 수 있음.
PayGo에서 Gemma4가 Qwen 3.8로 바뀐 건 아쉬움. Gemma4 31B는 코딩 모델은 아니어도 에이전트 소프트웨어의 의도 파악과 작업 수행에는 좋았는데, 실제 수요가 코드 생성에 쏠렸으니 빠진 것 같음.