데저트 앤트, iPhone에서 300배 실시간 전사 내세운 온디바이스 모델 18종 공개
- 유럽 AI 연구소 Desert Ant Labs가 음성·영상·텍스트 작업용 온디바이스 모델 18종을 공개했으며, 안정판 12개와 베타 6개를 Swift·Kotlin·JavaScript SDK 하나로 제공함
- 전사 모델 Voz는 iPhone에서 10분 오디오를 2초에 처리하고 단어별 시작·종료 시각을 반환한다고 밝힘. 회사는 Whisper보다 4.7배 빠르며 iPhone 16·17에서 약 300배 실시간 속도를 냈다고 주장함
- 개인정보 마스킹 모델 Redact는 12MB 크기로 27개 언어에서 이름·주소·카드 번호를 실시간 처리하며, 자체 평가에서 개인정보 탐지율 88.8%를 기록했다고 밝힘. 비교 대상 GLiNER-PII는 2.3GB에서 91.1%였음
- Desert Ant는 자사 영상 앱 Detail에서 Dolby를 Clear로, Claude Sonnet을 284MB Clips로 대체했다고 밝힘. Clips는 10분 영상을 5초에 여러 짧은 클립으로 만들며 Sonnet과 같은 품질, 에너지 사용량 470분의 1이라고 주장함
- 모든 모델은 월간 활성 기기 10만 대까지 무료이며 토큰과 로그인 없이 쓸 수 있다고 밝힘. Detail 6은 iOS 27 출시 때 기존 클라우드 API를 자체 온디바이스 모델로 전부 교체할 예정임
Hacker News opinions
Voz가 새롭고 빠른 전사 모델인 줄 알고 기대했는데, 결국 Parakeet v3에 macOS·iOS 전용 추론 코드를 얹은 것 같음.
나도 수치가 너무 좋아서 사실인가 싶었음.
Voz는 Parakeet을 ANE에 맞춰 최적화하고 자체 추론기를 붙인 버전임. iPhone 16·17에서 약 300배 실시간 속도를 냈고, 처음부터 학습한 차세대 Voz는 최소 두 배 더 빨라질 예정이며 Android 등도 지원할 계획임.
CMS에 쓸 만한 모델이 많아 보이지만 대부분 iOS 전용 같음. 벤치마크도 최신 iPhone 기준이라 20달러 VPS에서 이 속도가 나올지는 의문임.
일부만 iOS부터 내고 있으며, 몇 주 안에 모든 모델을 크로스플랫폼으로 낼 계획임.
번쩍이는 마케팅과 독점 코드로 오픈 모델을 감싼 것처럼 보임. Voz는 Parakeet 0.6B v3, Clear는 DeepFilterNet 3, Ear는 whisper-tiny 언어 예측기라는 주장임.
요즘은 최신 Mac과 iPhone, 프런티어 LLM만 있으면 기존 모델을 ANE에서 돌리도록 포팅하는 일도 꽤 쉬워졌다고 봄.
Core ML을 이유로 Apple만 지원하는 이유가 궁금함. Android에도 ML Kit 같은 선택지가 있지 않나.
대부분 모델을 Android와 웹에도 낼 예정임. Voz, Clips, Title처럼 플랫폼별 포팅이 더 어려운 모델은 시간이 조금 더 걸림.
로컬 특화 모델 접근은 좋지만 사업 모델은 잘 모르겠음. 가중치를 내려받아 내 기기에서만 돌리고 업데이트도 원치 않으면, 왜 계속 내 고객 수 기준으로 돈을 내야 하는지 납득하기 어려움.
가격과 비용을 혼동하는 얘기 같음. 10만 MAU를 넘겨 성공하면 비용을 내라는 조건은 판매자와 사용자 모두에게 꽤 공정하게 맞춰진 구조임.
오프라인 소프트웨어라도 정적이지 않음. 하드웨어와 모델이 계속 바뀌고, 구독은 공급자가 업데이트할 동기를 주며 스타트업 입장에서는 큰 선불 구매보다 월 단위 라이선스가 승인받기 쉬움.
Clear 데모의 원본과 개선본이 내 귀에는 거의 똑같이 들렸음. 수익화 방식도 여전히 궁금함.
기반 모델인 DeepFilterNet 3는 작고 빠르지만 성능이 아주 뛰어난 편은 아님. 상용으로는 MossFormer2가 더 낫다고 보지만 잔향 제거는 못 하고, NVIDIA RE-USE는 잔향도 처리하지만 비상용 라이선스임.
기기 내 혐오 발언 분류는 무엇이 잘못될 수 있나 싶음.
게임 로비나 자녀의 온라인 채팅 자동 검열에는 특화 독성 모델이 유용할 수 있음. 사람 검토를 빼면 오판 문제가 생기고, 넣으면 검토자가 최악의 콘텐츠를 계속 봐야 하는 문제가 있음.