AI가 초당 100만 토큰을 쓴다면? 속도가 아니라 판단이 병목이다
What if AI worked at 1.000.000 tokens per seconds?

AI가 초당 100만 토큰을 생성한다는 상상을 네 가지 의미로 풀어낸다. 컨텍스트 용량, 입력 처리, 전체 처리량, 단일 에이전트 출력은 전혀 다른 이야기다. 초당 100만 토큰으로 1000개의 결말을 1초에 쓸 수 있지만, 60초짜리 테스트 하나만 추가해도 전체 속도 향상은 132배로 줄어든다. 생성이 싸질수록 취향, 명세, 테스트, 실제 증거 같은 판단이 희소해진다.
생성이 저렴해질수록 판단은 귀해진다.
HN 토론
12- gchamonlive
글을 깎아내리려는 건 아니지만, 1kk TPS로 작동하는 LLM으로 훨씬 더 흥미로운 접근은 그걸로 만들 수 있는 수많은 실시간 애플리케이션일 거다.
나는 전자 음악을 좋아하고, 많이 추면서 춤춘다. 만약 충분한 처리량과 낮은 지연 시간을 가진 LLM이 있어서 반대로 내 춤을 보고 음악을 생성할 수 있다면 어떨까.
우리는 여전히 원시적인 인공 인지 지능을 올려다보며 별을 헤매고 있지만, 진정한 진전은 이것들을 외부 지능으로 인식하는 걸 멈추고 우리 자신의 확장으로 볼 때 올 것이다.
- sixtyj
"만약"은 일시적이다. 더 많은 TPS는 시간 문제다. 그런 사용 사례에서는 인간이 루프 안에 있으면 제거될 것이다. 가장 빠른 인식 능력을 가진 사람조차도 가장 느린 부분이 될 테니까.
얼마나 많은 산업이 그럴까? 얼마나 많은 사용 사례가 가능할까?
모든 것을 해결한다면 사람들은 무엇을 할까? 해변에 앉아 음료를 홀짝이며?
사용되지 않는 기기가 오류를 일으키기 시작하면서 인간 두뇌의 대규모 퇴화와 신경퇴행성 질환의 증가?
1,000,000 TPS는 일부 사용 사례에는 좋지만 공개적으로 사용 가능하지는 않다…
- ed
1m tps에서 LLM은 실시간으로 UI를 생성할 수 있다(5k 웹페이지는 5ms가 걸릴 것이다). 그렇게 되면 애플리케이션은 오늘날의 스택과 거의 공통점이 없을 것이다. (우선 렌더링, 이벤트 처리, 데이터 저장이 컨텍스트로 이동할 수 있다.)