알리바바, 1M 토큰 컨텍스트 옴니모달 Qwen3.8-Omni-Flash 공개
- 알리바바가 텍스트, 이미지, 오디오, 비디오를 입력받는 Qwen3.8-Omni-Flash를 공개함. 1M 토큰 컨텍스트를 지원하고 같은 크기의 텍스트 전용 모델에 준하는 텍스트 성능을 유지한다고 밝힘
- 29개 평가 평균 점수가 Qwen3.5-Omni-Plus보다 25% 이상 올랐고, 오디오 입력 시간당 API 가격은 98% 이상, 오디오-비주얼 입력 가격은 93% 이상 내렸다고 함
- 에이전트 벤치마크에서 WildClawBench-MM 36.5점, AgenticVBench 22.3점 상승, UniClawBench 69.6점을 기록함. AliMeeting DER은 88.11에서 3.35로, cpWER은 89.61에서 17.18로 낮아짐
- 오디오-비주얼 성능이 Gemini 3.8 Flash에 근접하고 오디오 성능은 앞선다고 주장함. 비디오 편집, 뮤직비디오 제작, 영화 해설, 실시간 대화 같은 장기 워크플로를 겨냥함
- Qwen-MM-Plugins를 온디맨드 인지와 툴 실행까지 확장하고, 실시간 옴니모달 상호작용용 런타임 Qwen-Live Harness를 오픈소스로 공개함
Hacker News opinions
Qwen4는 언제 나오려나. Qwen은 모델 크기 종류가 많아서 아주 작은 LLM 실험해보기 좋았는데.
Qwen3.8-Omni-X는 안 나올 것 같음. 마지막이 Qwen3-Omni-30B-A3B였고, 요즘 오픈웨이트 공개 속도가 확실히 줄었음. Qwen4도 안 나오고 27B만 풀리는 거 아님?
3.8 Max가 제일 정상적임. 말이 일반적이고 갑자기 이상한 짓 안 함(제미나이 너 말이야). 근데 진짜 느림. 알리바바에서만 쓸 수 있고 토큰 플랜도 짜게 줌. 무난한 구형 LLM 하나 고르라면 난 Qwen임.
RL it to oblivion이 무슨 뜻이야? 이 맥락에서.
Qwen4 아키텍처를 Flash-Next에서 본 것 같은데 추론이 진짜 이상함. 툴 콜 사이에 '사용자가 아직 아무것도 안 물었다' 같은 소리를 함. 근데 툴 콜 자체는 계속 제대로 함.
오디오-비주얼이 Gemini 3.8 Flash에 근접하고 오디오는 앞선다? 사실이면 대단한데. 제미나이 오디오랑 다국어가 셀링포인트였는데 다른 성능도 대등하거나 낫다고 함.
새 하네스 만들었다는데 깃헙 링크가 404임. 레포 이미 지운 듯.
성능이 비슷하다면 가격 보면 Gemini가 인/아웃 $1.5 / $9.0, Qwen 3.8이 $0.15 / $0.47임. 이건 엄청난 비용 절감임.