Ein einziges Python-Skript lässt Vision-LLMs Webcam-Bilder in Echtzeit bewerten

A single function Jev-like wrapper for LLMs, including vision models

Ein einziges Python-Skript lässt Vision-LLMs Webcam-Bilder in Echtzeit bewerten

Ein Entwickler erweitert das Jev-Format um Bild-Anhänge und fragt per Logprobs mehrere Entscheidungen in einem einzigen Token ab. Auf einer RTX 3090 mit Gemma 4 12B erreicht das Skript etwa 1 Bild pro Sekunde bei drei Fragen pro Frame, mit OpenAI gpt-6-luna rund 0,2 FPS. Statt spezialisierter CV-Modelle genügt es, Bedingungen einfach in Text zu ändern.

Der spaßige Teil: Das funktioniert auch mit Vision-Modellen.

Mehr von diesem Tag

2026-09-26