Если ИИ будет писать миллион токенов в секунду, узким местом станет ваше суждение
What if AI worked at 1.000.000 tokens per seconds?

Автор разбирает, что на самом деле означает «миллион токенов в секунду»: ёмкость контекста, скорость чтения промпта, совокупная пропускная способность или скорость генерации одного агента. На четырёх мысленных экспериментах — от тысячи концовок рассказа до десяти тысяч репетиций разговора с арендодателем — он показывает, что даже при мгновенной генерации время упирается в проверки, тесты и физические эксперименты. Закон Амдала в действии: ускорение написания в 10 000 раз даёт лишь 132-кратное ускорение всего процесса, а суждение, вкус и ясные критерии остаются дефицитом.
Когда генерация становится дешёвой, суждение становится драгоценным.
- gchamonlive
Не хочу ругать статью, но куда более интересный взгляд с LLM, работающей на 1kk TPS, — это бесчисленное множество приложений реального времени, которые можно было бы с ней построить.
Мне нравится электронная музыка, я много под неё танцую. А что, если бы у меня была LLM с достаточной пропускной способностью и низкой задержкой, чтобы делать обратное — брать мой танец и генерировать музыку.
Мы всё ещё застряли, любуясь на сырой искусственный когнитивный интеллект, но настоящий прогресс наступит, когда мы перестанем воспринимать эти системы как внешний интеллект и увидим в них просто продолжение самих себя.
- sixtyj
«Если» — это временно. Вопрос лишь во времени, когда TPS станет больше. В таком сценарии использования человек в цикле будет устранён, поскольку никто, даже обладатель самого быстрого распознавания, не будет самым медленным звеном.
Сколько таких отраслей? Сколько вариантов применения возможно?
Если решить всё, что будут делать люди? Сидеть на пляже, потягивая напитки?
Массивная деградация человеческого мозга и рост нейродегенеративных заболеваний, поскольку неиспользуемое устройство начинает давать сбои?
1 000 000 TPS — это хорошо для некоторых сценариев использования, но не общедоступно…
- ed
При 1m tps LLM могли бы генерировать UI в реальном времени (веб-страница на 5k заняла бы 5 мс). Приложения будут иметь очень мало общего с сегодняшними стеками, когда это произойдёт. (Для начала рендеринг, обработка событий и хранение данных могли бы перейти в контекст.)