Jevに感銘を受けたが、なぜそう感じるべきでないのか説明してほしい
I was impressed by Jev, please explain why I shouldn't be
私はコンピュータサイエンスの専門家ではありませんが、Jevを試してみて感銘を受けました。非技術系の研究者が、参加者から得た任意の入力を、事前のトレーニングや分類なしに、ほぼ瞬時に、ごくわずかなコストで分類できるようにしてくれました。しかしHacker Newsでは、もっと資格のある人たちがJevは詐欺だ、後退だ、感銘を受けるのはおかしいと言っています。Jev以前にこれをやっていたソフトウェアは何だったのか、専門家の意見を聞きたいです。
私の理解では、基盤技術はかなり古く、確立されています。ですから、そうした古いモデルを理解している人にとっては、これは旧聞です。多くの否定的な意見は、基本的に「ああ、これは古いものだ」というものです。しかし、Jevが実際に新しく興味深いのは、モデルをトレーニングすることなく、実行時に自然言語で新しい意味判断を定義し、高速で安価で範囲が限定され、確率を伴う結果をソフトウェアが直接消費できる形で得られるようにしたことです。言い換えれば、モデルを微調整する必要はありません。超高品質が本当に重要なら微調整すべきですが、それは他のLLMの用途でも同じです。しかし、私たちのほとんどにとって、十分な品質が十分であれば、モデルのトレーニングや微調整に興味がないなら、Jevは多くのことを既製で可能にします。感銘を受けるべきです。これは批判者が示唆するよりも新しいことをしています。
多くの批判は、Dropboxを「FTPサーバーを立てれば同じことができる」と否定した悪名高いHacker Newsのコメントと同じ精神です[1]。この場合、何年もBERT分類器を構築してきた人々が、モデルを微調整すれば分類できると指摘しています。もちろんそれは真実で、依然として価値がありますが、必ずしもすぐに使えるわけではありません。そしてJevは、その目的のために作られたものとしては驚くほど高品質です。
私はよく「そんなのにお金を払うの?!でもxyzはすでにあるじゃないか」と言ってきましたが、時間が経つにつれて、(1)マーケティングは重要であり、(2)何かが摩擦を十分に減らして、達成しようとしていることの歯車を動かし始めるなら、たとえ自己構築したソリューションや、多くの調整を要する本当に良いソリューションよりも測定可能なほど劣っていても、それにお金を払う人は常にいる(実際たくさんいる)と学びました。
「Jev以前にこれをやっていたソフトウェアは何か」という問いに対して:テキスト分類にはBeRT、BART、FLAN-T5があります。これらのモデルはすべて約5年前のもので、transformerモデルに基づいており、ローカルで実行できるほど小さいです。完璧なSOTAではありませんが、組み込みアプリケーションではかなりうまく機能します。低リスクの用途には十分だと思います。画像分類器は非常に競争の激しい分野です。BeiT、DeiT、MobileOne、ConvNext、FastViTなど、画像分類パイプラインをサポートするモデルがいくつかあります。
William Gibsonが言ったように、未来はすでにここにありますが、均等に分布しているわけではありません。ですから人々は、自分にとって新しい既存技術に興奮するのです。既存技術を新しいパッケージで包むことは、それを新しい人々に紹介する一般的な方法です…ffmpeg、html2pdfなどのラッパーが製品としてマーケティングされています。そしてそれらは魔法のように見えます…私は1973年にカセットプレーヤーを持っていましたが、カセットテープは今でも魔法のように感じられます。多くの場合、最良のツールは手にあるもの、または知っているものです。そうすれば、やろうとしている仕事にすぐ取りかかれます。まず動くようにし、それから良くしましょう。幸運を祈ります。