분류하지 말고, 환각을 유도하라!
Don't classify, hallucinate!

LLM으로 제품이나 검색어를 분류하는 것은 이제 흔한 일이지만, 시스템이 허용하는 브랜드, 색상, 카테고리 등의 공식 어휘로 출력을 제한하는 것은 여전히 어렵습니다. Wayfair WANDS 데이터셋의 'wood coffee table' 같은 검색어를 수백 개의 카테고리 중 하나로 분류해야 하는 경우, 기존에는 Pydantic의 Literal로 거대한 목록을 만들어 구조화된 출력을 강제했습니다. 하지만 이 방식은 비용이 많이 들고 토큰 상한도 있습니다. 저자는 더 저렴한 방법을 제안합니다. 작고 저렴한 LLM에게 실제로 존재하지 않는 가상의 분류를 생성하도록 시키고, 이를 실제 분류의 임베딩과 비교해 가장 유사한 것을 찾는 것입니다. 이렇게 하면 스키마를 매번 보낼 필요 없이 저비용으로 분류를 수행할 수 있습니다.
이제 우리는 합법적인 분류 목록을 보내는 대신, LLM에게 무언가를 지어내도록 요청하고 있습니다.