Один Python-скрипт превращает веб-камеру в анализатор сцен на базе LLM
A single function Jev-like wrapper for LLMs, including vision models

Вдохновившись Jev и OpenJev, автор добавил в формат запроса поле attachments для изображений и написал скрипт, который каждую секунду отправляет кадры с веб-камеры в LLM и получает ответы на вопросы: виден ли человек, где находится камера, насколько яркая сцена. На RTX 3090 с Gemma 4 12B через llama.cpp выходит около 1 кадра в секунду с тремя вопросами на кадр, через OpenAI gpt-6-luna — 0,2 FPS. Главная ценность — гибкость: условия задаются обычным текстом, а не специализированной CV-моделью.
Специализированные компьютерные vision-модели, безусловно, гораздо эффективнее, но мне здесь нравится гибкость: меняешь условие, просто описывая его текстом.