AIが毎秒100万トークンを書けたら?本当に速くなるのは「書くこと」だけ
What if AI worked at 1.000.000 tokens per seconds?

「毎秒100万トークン」という数字は、コンテキスト容量、入力処理、集約スループット、単一エージェントの出力速度という4つの意味に分けられる。仮に1エージェントが毎秒100万トークンを書けても、書いた後のテストや検証など固定のチェックが1分あれば、エンドツーエンドの高速化は10,000倍ではなく約132倍に留まる。生成が安くなると、何を選ぶかという判断が希少になる。
Whatever you do not speed up becomes nearly all the remaining time, the logic of Amdahl’s law.
HNでの議論
11- gchamonlive
記事を叩くつもりはないけれど、100万TPSで動くLLMについてのもっと面白い見方は、それで作れる無数のリアルタイムアプリケーションのほうだろう。
俺はエレクトロニックミュージックが好きで、よく踊る。もし十分なスループットと低レイテンシを持つLLMがあって、逆に俺のダンスから音楽を生成してくれたらどうだろう。
俺たちはまだ、生の人工認知知能をぼんやり眺めてばかりいる。でも本当の進歩は、これらを外部の知能としてではなく、自分自身の拡張として捉えられるようになったときに訪れるんだ。
- sixtyj
「もし」は一時的なものだ。より多くのTPSは時間の問題にすぎない。そういうユースケースでは、人間がループに入ることは排除されるだろう。どんなに認識が速い人でも、最も遅い部分になってしまうのだから。
どれだけの産業がそうなる?どれだけのユースケースが可能になる?
もしすべてを解決してしまったら、人は何をするんだ?ビーチに座って飲み物をすすっているのか?
使われないデバイスが誤作動を始めることで、人間の脳は大規模に劣化し、神経変性疾患が増えるのか?
100万TPSは一部のユースケースには良いが、誰でも使えるものではない……
- ed
100万TPSなら、LLMはリアルタイムでUIを生成できる(5kのウェブページなら5msで済む)。そうなったとき、アプリケーションは今日のスタックとはほとんど共通点がなくなるだろう。(まず第一に、レンダリング、イベント処理、データ保存がコンテキスト側に移る可能性がある。)