Un Mac peut désormais rechercher chaque image de vos vidéos sans le cloud
SCM indexe localement sur macOS les photos, les scènes vidéo, le texte à l'écran et la parole. L'application montre à quel point la recherche par IA, privée et exécutée sur l'appareil, a progressé.
Un développeur a publié SCM (Screen Memories), une application macOS open source qui permet de décrire un souvenir en langage courant et de se retrouver sur le plan exact d'une vidéo, et pas seulement sur le fichier. D'après la page du projet, l'inférence s'exécute sur votre Mac, sans compte, sans envoi de données et sans télémétrie. Les poids des modèles se téléchargent une seule fois ; ensuite, l'application fonctionne hors ligne.
Le signal : la recherche migre vers la périphérie
Ce qui est intéressant n'est pas l'application elle-même, mais la pile technologique qui la sous-tend. Les modèles d'embedding, la reconnaissance vocale et un petit modèle de conversation tournent désormais de façon acceptable sur un ordinateur portable grand public, à l'aide de composants gratuits et standard : les modèles de vision CLIP et SigLIP via ONNX Runtime, Whisper pour la parole, Tesseract pour le texte, ffmpeg pour la vidéo et llama.cpp pour la conversation. Un seul développeur peut assembler ce qui exigeait autrefois un fournisseur de cloud. La source indique aussi un modèle de conversation par défaut d'environ 1,1 Go, censé tenir sur les Mac équipés de 8 Go. Si cela se confirme en pratique, l'argument de la confidentialité en faveur de la recherche locale ne coûte plus grand-chose aux utilisateurs en termes de capacités.
Comment ça marche
L'idée centrale est l'embedding : un modèle de vision convertit une image en une longue liste de nombres, et convertit votre requête textuelle en une liste du même type. Les images dont les nombres sont les plus proches de ceux de votre requête (mesurés par la similarité cosinus) arrivent en tête. C'est pourquoi vous pouvez chercher « parapluie rouge dans une rue sous la pluie » sans que personne n'ait étiqueté la photo.
La vidéo est plus difficile, car un fichier contient des milliers d'images. SCM utilise ffmpeg pour détecter les changements de plan, découpe chaque vidéo en segments, calcule l'embedding d'une image médiane par segment et conserve une image d'affiche. Les utilisateurs choisissent un préréglage de densité, d'un échantillon toutes les 60 secondes (Eco) à un échantillon toutes les 2,5 secondes (Ultra Pro, qui demande une confirmation). Le projet indique que chaque préréglage affiche son coût mesuré en temps et en espace disque avant que vous vous engagiez, ce qui est la vraie contrainte : une recherche plus fine exige plus de calcul et de stockage.
Le texte est traité séparément. L'OCR (reconnaissance optique de caractères) lit les mots visibles dans les images et les plans, avec une correspondance littérale. La recherche dans les dialogues utilise les transcriptions de Whisper et procède aussi par correspondance littérale, selon trois niveaux, de la réplique exacte jusqu'à l'apparition de tous les mots quelque part dans la même vidéo. Aucune de ces deux recherches ne dépend du modèle de vision, elles fonctionnent donc même pendant qu'il se charge.
Il existe aussi un mode de conversation optionnel qui répond uniquement à partir des éléments déjà extraits par l'application, avec des citations numérotées, et qui s'interrompt avant l'exécution du modèle s'il n'y a aucun élément. Ce choix de conception limite, sans l'éliminer, le risque de réponses inventées.
Les compromis intégrés
Plusieurs détails montrent où la recherche locale reste pénalisante. Quatre modèles de vision échangent vitesse contre précision : la source indique environ 50 à 100 millisecondes par image pour le plus rapide, et environ 480 à 570 millisecondes pour le CLIP par défaut. Changer de modèle recalcule les embeddings de toute la bibliothèque en arrière-plan, la recherche se rabattant entre-temps sur les mots-clés des noms de fichiers. Changer de modèle Whisper retranscrit toutes les vidéos. Vos médias sont en outre copiés dans une bibliothèque gérée par l'application : vous dupliquez donc vos fichiers pour les rendre consultables. Les affirmations du projet en matière de confidentialité, y compris son moteur de rendu isolé (sandbox) et l'absence de télémétrie, sont celles du développeur et n'ont pas fait l'objet d'un audit indépendant ici.
Les questions à vous poser
- Si l'index de vos photos, de vos captures d'écran et de vos dialogues parlés se trouve dans un seul dossier sur le disque, comment ce dossier est-il protégé, et qui peut le lire si le Mac est perdu ou partagé ?
- L'application applique l'OCR à tout, y compris aux adresses e-mail, et comporte un onglet conçu pour les faire ressortir. Que se passe-t-il lorsqu'une bibliothèque contient des documents, des pièces d'identité ou des informations sur d'autres personnes que vous ne souhaitiez pas rendre consultables ?
- Le projet affirme que les scores de recherche sont « honnêtes » grâce à un étalonnage par modèle. Où est la preuve qu'un résultat « aucune correspondance » est fiable, et comment le vérifieriez-vous sur vos propres séquences ?
- Copier tous les médias dans une bibliothèque gérée double l'espace de stockage nécessaire. Ce coût est-il acceptable pour vos archives, et quelle est la porte de sortie si le projet est abandonné ?
- Les poids proviennent d'hébergeurs tiers au moment de l'installation. Qui les vérifie, et quelle est votre politique à l'égard des outils open source qui téléchargent des modèles au premier lancement ?
À surveiller ensuite
Le signal à guetter est de savoir si les systèmes d'exploitation et les applications photo grand public intégreront nativement cette fonction, avec une recherche vidéo par scène et une recherche vocale exécutées par défaut sur l'appareil. Si c'est le cas, des outils autonomes comme celui-ci deviendront des architectures de référence ; s'ils restent centrés sur le cloud, des projets comme SCM incarneront l'alternative soucieuse de la vie privée. Surveillez les benchmarks indépendants de précision et de vitesse sur de grandes bibliothèques, ainsi que la question de savoir si le modèle d'installation par Homebrew, qui supprime automatiquement les indicateurs de quarantaine de macOS, attirera l'attention.
- 1Installez SCM sur votre Mac pour rechercher le contenu de vos vidéos à partir d'une description en langage courant, sans envoyer de données vers des serveurs cloud.
- 2Utilisez des modèles d'IA locaux comme CLIP, Whisper et llama.cpp pour traiter en privé des fichiers vidéo sensibles sur votre propre appareil.
- 3Tirez parti d'outils open source (ONNX Runtime, ffmpeg, Tesseract) pour construire votre propre recherche vidéo en périphérie, sans dépendance à un fournisseur.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
