AI エラのためのマウスポインタ再考:Gemini で実現する直感的な操作
Reimagining the mouse pointer for the AI era
私たちは、半世紀以上変わらなかったマウスポインタを、AI エラにふさわしいものへと再設計しています。Gemini を活用したこの新しいポインタは、ユーザーが文脈を説明する必要なく、指差すだけで意図を理解し、あらゆるアプリ間でシームレスに動作します。これにより、複雑なプロンプト入力やウィンドウの切り替えが不要になり、人間の自然な行動に技術が適応する未来を実現します。
技術が人間の行動に適応するのではなく、ユーザーを技術に合わせさせるのではなく、AI との協働が真に直感的で滑らかになる未来を可能にします。
HNでの議論
213- why_at
この動画を見ての第一印象は懐疑心です。
日常使いで音声コントロールを採用するのは、かなりハードルが高いでしょう。完全に一人ではない状況でこれを使うと、周囲の人々にとって非常に迷惑になるはずです。
彼らの例の多くは、右クリックのドロップダウンメニューで十分できるようなものに見えます。つまり、「マウスポインタを再発明」する必要は本当にないのです。
このツールは、AI 統合のために常に Google のサーバーと通信しているのでしょうか?つまり、インターネットに接続されていないと使えないのでしょうか?プライバシーへの懸念は明白です。今や Google は、あなたがコンピューターで行うあらゆることを AI が監視することを望んでいるのでしょうか?
ユーザーは LLM の利用に何か費用を払うのでしょうか?無料で提供されている場合、それは永遠に無料なのでしょうか?彼らの例の一つのように、たった一語を変更する用途に使われることを期待しているなら、それはあまりにも多くのものを無料で提供しすぎです。おそらく、彼らはあなたがコンピューターで行うあらゆることに関するデータを収集することで、そのコストを回収しようとしているのでしょう。
パーソナルコンピューターとの AI 統合におけるキラーアプリは、まだ発明されていないかもしれません。しかし、これはそれには見えません。
- arjie
おもしろいですね、これはとてもクールです。最初はただの「フォーカスがマウスを追従する」機能かと思ったのですが、もっと興味深い仕組みのようです。特定のキーワードで「プロンプトに追加」をトリガーする機能があるんですね。音声機能については一旦置いておきます(現状では他の入力手段がフォーカスを奪うため、これは確かに重要ですが)。私は以前から、LLM と「指差してクリックする」(あるいはタブ移動して選択する)操作をしながら、継続的な会話を行いたいと思っていました。テキスト入力のフォーカスが、私がテキストを入力している場所に常に LLM 側に向き続けるような仕組みがあれば、結構便利かもしれません。
時には別のページに行ってスクリーンショットを撮ったり、ファイルを閲覧したり、ログの行をハイライトしたりすることがあります。Cursor はこれをうまくやってくれました。ターミナルでテキストを選択すると、自動的に Cursor エージェントのテキストボックスにフォーカスが移り、エージェントと会話を始められます。その後、別のテキストを選択しても、元のエージェントのテキストボックスを再度選択する必要がありません。そのシステムでは、エージェントは単に「切り替える必要がある別のアプリ」ではなく、コンテキストを持ち運べるトップレベルの機能として扱われています。
私は少しバイアスを持っているかもしれません。私は常にコンピューターでの入力が制限されていると感じてきたからです。場所を移動するために手を動かさなければならないのは、非常にイライラします。私はヘッドトラッキングを試したり、一時期 Vim ペダルを使ったり、タイル型ウィンドウマネージャー(tiling WMs)を使ったりして、これらを補助してきました。私の Vim 技術はそれなりに高く、それらの中で機能するのは非常に上手ですが、アプリケーション間のインターフェースについてはそうではありません。
結局のところ、私たちが皆、Apple Vision Pro を備えた自宅オフィスを持ち、これとこうして会話してより速く操作できるようになるのかもしれません。