Webカメラ映像をLLMで毎秒1フレーム解析、Jev風ラッパーを自作

A single function Jev-like wrapper for LLMs, including vision models

Webカメラ映像をLLMで毎秒1フレーム解析、Jev風ラッパーを自作

Jev風のリクエスト形式に画像添付フィールドを追加し、Webカメラのフレームをbase64 JPEGで送信して「人物がいるか」「屋内か屋外か」「明るさは」を表形式で出力するPythonスクリプトを公開。RTX 3090上のGemma 4 12Bでは毎秒約1フレーム、OpenAI gpt-6-lunaでは約0.2 FPSで動作。条件をテキストで記述できる柔軟さが魅力。

特殊なコンピュータビジョンモデルの方がずっと効率的なのは間違いないが、ここで私が気に入っているのは柔軟性だ。条件を変えたいときは、プレーンテキストで記述するだけでいい。
  1. TeMPOraL

    こうやって我々は、今日に至るまで実現していない最も魔法のようなStar Trekのテクノロジーのいくつかを手に入れるわけだ。たとえば自動ドア。なぜなら、お気づきのように、それらは現実のものよりずっとずっと上手く機能する。というのも、こんなことをやっているように見えるからだ:

    if(within 10 meters of door then) {

    if(Jev(

    [A] Intends to go through, expects doors to open

    [B] Approaches with no intent to pass

    [C] Passing by, loiters, or otherwise

    [D] Other

    ) == most definitely A) {

    // open doors, +/- identity/security/interlocks check

    } else {

    // ignore

    }

    }

    キーワード:環境認識、意図の理解。

    Star Trekのほとんどのインタラクティブ技術はこうだ。フェイザーからコンソール、通信機、船のコンピュータとの音声対話まで。コンピュータはユーザーと周囲を認識し、文脈から意図を積極的に推論して、DWIM(「私の意図することをやれ」)を、彼らが意図するときに実行し、単純なトリガーで愚かなこと[1]をしない。

    --

    [0] - 方向性であって最終実装ではない。LLMの最終段階をラップするより効率的な方法をきっと我々は見つけられる。だが要点は、マルチモーダルだ。

    [1] - 明らかにフィクションの番組だが、これにおいては、ワトソン的説明とドイル的説明がほぼ完璧に一致する。これは高度なテクノロジーであり、ただ機能し、愚かなことをしない。同じ意図認識アルゴリズムがそこにある。フィクションではコンピュータに、現実では撮影現場の技術者たちの頭の中に。

  2. prathje

    いいね!画像にも使いたいな。

    とはいえ、JSONレスポンスでGrammar-Based Decodingを使うのと同じではないか?Jevはそれに素敵なキャッシュを付けただけ?

    だとしたら、もう使ってるんだけど…

  3. frabcus

    おそらくこれはJevよりずっと劣るだろう。なぜなら通常のLLMモデルはRLHFで訓練され、エージェントになるように訓練されているからだ。特に大規模モデルでは、もっと早い層で決定するだろうと予想する。

    JevのReinforcement Learning for Calibrated Decisions (RLCD)が何をするにせよ、重みの中で正確な確率を出すようにモデルを訓練する点でより優れていることを願う。

この日のほかの記事

2026-09-26