Разработчик Allan Lee (allenv0) опубликовал в Show HN открытый проект SCM (Screen Memories) под лицензией MIT — локальный AI-поиск по всем фото и каждому кадру видео в любой папке на macOS, без аккаунтов, облака и загрузок. Весь инференс выполняется на самом Mac, а приложение ставится на Apple Silicon за три команды Homebrew. Поиск охватывает пять режимов: от смыслового поиска по кадрам на сменных CLIP и SigLIP-моделях до перехода к точному таймкоду, текста на картинках и произнесённых реплик.
Что произошло
В разделе Show HN на Hacker News разработчик Allan Lee (allenv0) представил SCM (Screen Memories) версии 0.2.4 — утилиту локального AI-поиска по медиафайлам в любой папке на macOS, распространяемую под лицензией MIT. Поиск работает в пяти режимах. Смысловой поиск по файлам опирается на четыре сменные модели через ONNX Runtime: по умолчанию CLIP ViT-L/14@336 с весами около 435 МБ и латентностью примерно 480–570 мс на кадр на CPU, в качестве альтернатив — SigLIP-2-B/16, SigLIP-2-L/16@256 и SigLIP-B/16@384. Поиск по сценам внутри видео использует выделение границ шотов средствами ffmpeg с пресетами от Eco с точкой каждые 60 секунд до Ultra Pro с шагом 2,5 секунды и переходом к точному таймкоду. OCR реализован через Tesseract с английским плюс 35 переключаемыми языками, поиск произнесённых реплик — через Whisper с моделями tiny.en около 150 МБ или base.en около 300 МБ. Опциональный режим Ask открывает локальный чат через llama.cpp-sidecar, доступный только на loopback, с Qwen3 1.7B размером около 1,1 ГБ по умолчанию или Llama 3.2 3B. Установка на Apple Silicon с macOS 12+ описана в три команды Homebrew, ключевые шаги — brew tap allenv0/scm и brew install --cask allenv0/scm/scm.
Контекст
Инженерной основой служат давно известные открытые компоненты: CLIP и SigLIP дают эмбеддинги кадров, ffmpeg сегментирует видео на шоты, Whisper расшифровывает речь, Tesseract распознаёт текст на изображениях, llama.cpp обслуживает локальный чат. Новизна здесь не модельная, а системно-инженерная: автор собрал эти части в один пайплайн медиапоиска и опубликовал полный код вместе с честными измерениями — латентностью на кадр, размером весов и бюджетами сегментации. По возможностям это открытый аналог встроенного поиска Apple Photos и проприетарных утилит, но с уровнем детализации «конкретный кадр или реплика», которого в стандартных решениях обычно нет. Показательно и устройство режима Ask: он работает как RAG поверх уже извлечённых текстовых метаданных — реплик, OCR-текста и имён файлов — с нумерованными цитатами и стримингом tok/s, а не как мультимодальное понимание кадров.
Почему это важно для индустрии
Для индустрии это сигнал коммодитизации: слой семантического поиска по личным фото и видео уже собирается целиком из открытых компонентов на потребительском Mac, без облачных API и подписок. Продавать сам такой поиск на macOS стало труднее, а собрать его как фичу в свой продукт — быстрее и дешевле. Для билдеров SCM полезен прежде всего как проверенный шаблон под MIT: мультимодальный индекс из эмбеддингов, шотов, Whisper-транскриптов и OCR плюс локальный LLM-sidecar — код и паттерны можно переносить в свои продукты. Защищаться в этой категории теперь приходится вертикальными workflow, скоростью индексации и интеграциями, а не самими эмбеддингами. Прямого сдвига рынка сегодня нет — проект на версии 0.2.4 без заметного трекшена, — но ориентир для категории уже сместился.
Почему это важно для пользователей
Читателю с Mac на Apple Silicon проект доступен уже сегодня: веса моделей скачиваются один раз, дальше всё работает офлайн, а медиа никуда не уходят. Поиск ведётся по описанию кадра на естественном языке в пяти режимах: можно найти сцену в видео и перейти точно к нужному таймкоду или реплике, отыскать текст на картинках через OCR и задавать вопросы к своей библиотеке в режиме Ask с цитатами. В репозитории есть готовые команды установки и демо-GIF, поэтому проверить проект можно сразу после прочтения.
Что пока неизвестно / ограничения
Публичных метрик качества поиска пока нет: ни recall, ни сравнения с Apple Photos, а на момент публикации у проекта нулевой трекшен на Hacker News. Первичная индексация большого архива — нетривиальная задача: при арифметике из опубликованной латентности примерно 0,5 секунды на кадр индексация 10 000 фото займёт порядка полутора часов чистого CPU, а для видео время вырастет ещё заметнее — это оценка, а не измеренный бенчмарк. Поиск реплик работает только по-английски, поскольку модели Whisper в комплекте — tiny.en и base.en, а мультиязычность семантического режима упирается в возможности самих CLIP и SigLIP и для русского языка требует проверки. Прогнозы о появлении волны аналогичных сборок и о превращении локальных мультимодальных индексов в стандартный слой файловых менеджеров и ОС — это интерпретации, а не факты.
Источники
- GitHub-репозиторий allenv0/SCM (проект Screen Memories)
- Show HN: AI search for every photo and every frame of video on macOS — обсуждение на Hacker News
Автор
Look at AI, редакция
