37万語のソート、ハッシュ、スケッチ:HyperLogLogが誤差2.71%で語彙数を推定
Sorting, hashing, and sketches on 370,103 words

Pythonのコアコンテナを実データで試す。dwyl/english-wordsリポジトリから取得した370,103語のユニークな英単語を、6種類のソート、4種類のハッシュ構造、4種類の確率的スケッチで処理し、時間とメモリを計測。結果、HyperLogLogは4,096レジスタで語彙数を誤差2.71%で推定した。データの特性(長い裾、高いOOV率)がアルゴリズム選択に与える影響も考察。
HyperLogLogは、わずか4,096個のレジスタで、語彙数を誤差2.71%で推定します。