1911 年 Roget's Thesaurus 数字版上线

1911 年版 Roget's Thesaurus 的数字版本现已公开,这一珍贵资源最初由 MICRA Inc. 于 1988 年通过人工转录完成。MICRA Inc. 是一家由 Patrick J. Cassidy 领导的新泽西公司,除了 Roget's Thesaurus,他们还制作了 Webster's 1913 Dictionary 的电子版本。这些项目不仅是语言学的里程碑,更是 MICRA 在自然语言理解和语义互操作性研究领域的重大贡献。如今,这一经典辞书以数字化形式重现,为研究者和语言爱好者提供了便捷的访问途径,让百年前的智慧在数字时代焕发新生。

这项工作是 MICRA 在自然语言理解和语义互操作性研究领域的更广泛贡献的一部分。
  1. bradrn

    最近我一直在用 https://the-saurus.org/ 来访问词库的层级结构,因为几周前读了 https://blog.plover.com/2026/08/02/ 上关于它的用法介绍。

  2. somat

    作为一个有趣的旁支话题,不妨考虑一下同义词词典背后的数据结构和数据本身。我之前在一个项目里用过 Wordnet 数据:https://wordnet.princeton.edu。我的第一反应是走现代路线,直接把全部数据载入内存,这完全没问题。但当我注意到他们那套古怪的数据格式是设计用来从磁盘动态访问时,我就没忍住,把整个东西重写了一遍,专门实现这种访问方式。这大概算是浪费时间吧,但写起来真的很有趣。

    顺便提一句,每个参考词都关联着一个字节偏移量,所以查找操作只需简单的 seek 就能搞定。要是放在今天,我们大概直接把它塞进 sqlite 数据库就完事了(致敬 sqlite,让这一切变得如此简单)。不过我觉得这种设计真的很巧妙。

  3. GJim

    在英伦三岛,我们更倾向于使用 Rogers Profanisarus。

    https://en.wikipedia.org/wiki/Roger%27s_Profanisaurus

    我们在办公室里备了一份,专门用来给项目起名。

同日更多故事

2026-09-01