macOS 사진·동영상 모든 프레임을 AI로 검색하는 오픈소스 SCM, HN에서 프레임 샘플링 비용 논쟁
- macOS에서 사진과 동영상의 모든 프레임을 자연어로 검색하는 오픈소스 도구 SCM이 Show HN에 올라와 GitHub 스타 143개, 포크 6개를 기록함
- 이미지 임베딩은 CLIP, 문자 인식은 Tesseract를 쓰는데, 댓글에서는 macOS라면 Apple Vision 프레임워크가 속도와 정확도 모두 Tesseract보다 낫다고 지적함
- 제작자는 100% 무료 오픈소스라고 밝혔고 첫 공개는 2026년 10월 3일, 커밋은 8개뿐임
- M1에서 CLIP으로 비슷한 도구를 만든 댓글러에 따르면 1만2천 개 동영상에 초당 1프레임 샘플링은 며칠, 키프레임만 쓰면 하룻밤이 걸림. 샘플링 간격보다 짧게 등장하는 장면은 놓칠 수 있음
- 크로스 플랫폼 대안으로 Immich가 언급됐는데, 모든 프레임까지 보장하지는 않고 검색 품질 비교도 없다는 단서가 붙음
Hacker News opinions
아이디어 자체는 좋은데 큰 동영상 폴더나 1만2천 개짜리 비디오 라이브러리를 돌리려면 컴퓨터를 얼마나 세워둬야 하는지 감이 안 와서 시도를 못 하겠음
M1에서 CLIP으로 비슷한 걸 만들어봤는데 프레임 샘플링 비율이 전부임. 1만2천 개 비디오에 1초 1프레임이면 며칠이고, 키프레임만 뽑으니 하룻밤이면 끝났음
장면 전환 감지를 써보면? 카메라 컷이 키프레임보다도 드물 텐데 그게 더 쌀 거임
최소 해상도로 줄인 버전도 필요할 듯. 샘플링 간격보다 짧게 나오는 장면은 그냥 놓침
크로스 플랫폼으로 원하면 Immich가 사진·비디오 근사 AI 검색을 이미 함. 다만 모든 프레임까지 되는지는 장담 못 하고 검색 품질 비교도 못 해봄
Immich 써봤는데 별로였음. 썸네일을 모든 해상도로 만들어놔서 수십 년치 8TB 라이브러리에는 짜증남. 그러다 이걸 보고 그냥 Gemini 시켜서 주말에 DAM을 직접 만들면 되겠다는 생각이 들었음
사람이나 얼굴, 반려동물 검색도 되나? iOS처럼 그게 되면 진짜 유용할 텐데
M1 맥 32GB에서 스톡 사진 2천 장 중에 야자수 있는 집 찾기 같은 게 잘 될까? 주방 사진이나 사막 남서부 풍경 찾기도 해보고 싶음
Apple Photos는 이미 온디바이스 AI로 자연어 사진 검색이 되는데 그게 잘 안 되나? 나는 그거 써도 충분하던데
카메라가 임베딩을 파일에 붙여주면 좋겠지만, 임베딩 모델 하나에 묶여버리는 문제가 있음. CLIP 같은 표준 모델로 합의가 안 되면 호환이 안 되고, 직접 임베딩하는 유연성도 잃음
macOS면 OCR은 Apple Vision 프레임워크를 써야 함. 속도와 정확도 둘 다 Tesseract를 압살함. 재밌는 건 Claude, DeepSeek, Qwen, Codex에 물어봐도 다 Vision을 추천했고 Tesseract를 추천한 건 gpt-4.1이 마지막이었음
그래서 바이브 코딩한 소프트웨어가 항상 구림. 생성되는 코드랑 모범 사례 추천은 완전히 다른 분포에서 나오는데, 모범 사례는 '가장 흔한 것'인 경우가 거의 없음
CLIP 대신 Qwen-VL 같은 작은 VLM은 어때? 비디오 인코더가 있어서 이런 작업에 더 잘할 텐데
그 사람이 뭘 하는지, CLIP이 뭔지도 모를 가능성이 큼. LLM 프롬프트 한 방으로 나온 걸 대충 GitHub에 던진 것 같고 코드도 안 봤을 듯
비디오에서 정확한 순간으로 점프하는 게 핵심인데, 균등 샘플링이 1~2초만 나오는 장면을 얼마나 자주 놓칠까? 그게 이 도구의 실용성을 갈라놓을 듯
FHD 90분짜리 하나 처리하는 데 얼마나 걸림? 그 시간을 알아야 쓸지 말지 정하겠음
LLM 시대에 이런 아이디어도 저작권 보호가 되나? 빅테크가 비슷한 걸 만들고 셔록해버리는 건 저작권법이랑 상관없는 얘기라서 그냥 당하는 수밖에 없어 보임