画面をOCRして分類するだけで、Mac操作を1ステップ0.02円で実現
Typesafe-computer-use drives a Mac toward a goal for 1/50th of a cent per step
typesafe-computer-useは、画面のOCRとTypeSafeによる行動分類を組み合わせ、スクリーンショットを大規模モデルに送らずにMacを操作する。1ステップあたり約0.0002ドルで、Claude Opus 5と比べて155倍安く、14〜40倍高速。アクセシビリティツリーやオフスクリーン操作も活用し、決定論的な処理で低コストと高速性を両立している。
Frontier-model computer use is capable and expensive: every step ships a screenshot and waits several seconds for a plan. Most steps do not need a plan. They need one choice from a short list, made quickly and cheaply, with a confidence number you can gate on.
HNでの議論
52- jdkoeck
READMEを数行読んだところで、僕は目を疑った。これ、人間が一切編集してないじゃないか。「LLM検出、プロジェクト却下」。
- croemer
デモ動画があると便利だね。自分で実行しなくても何をするのか分かるから。
- mmastrac
DiffusionGemma-as-Jevを使うと助かるかどうか興味がある。画像を直接モデルに食わせて、画像埋め込みに基づいて判断させられるからね。
- jimmySixDOF
これのどこが革新的なのかよく分からない。System-1モデルがDoomをプレイできることは発表の中でも見せてるじゃないか[1]:
>Doom
>このdoomoがリアルタイム知能と、コード+AIで何がdooneできるかを示してくれてるのが最高に気に入ってる。これを開発したエンジニアは毎秒10クエリ(結局1時間あたり約$7かかる)を心配していたけど、他のみんなは予想より安いと同意したよ!これは本当に楽しいから、詳細なウォークスルーを公開するだけでなく、これでハックするイベントもいくつか開催するつもりだ。
[1] https://typesafe.ai/blog/introducing-system-one-models-and-j...
- john_minsk
超クール。ウェイトリストが早く動くといいな。自分にもユースケースがある。
あなたが作者ですか?もしそうなら、このシナリオでJevを使う際のメモはありますか?