解析臭名昭著的日本邮政 CSV 数据
Parsing the Infamous Japanese Postal CSV

去年我发布了 posuto 项目,旨在将日本邮政提供的难以解析的 CSV 数据转化为易用格式。这份数据因包含针对人类阅读的括号注释、在字段过长时随机换行并重复其他字段等奇葩设计而闻名。例如,长地名会被强行截断,导致一行数据变成多行重复记录;而罗马音转换文件更是质量堪忧,将'JAビル'错误转写为'JIEIEIBIRU'。这些设计让解析工作变得异常痛苦,甚至有人调侃解析这份文件是地狱般的惩罚。
一个有趣的推文描述道:那些指望电脑顺从人类意志的人,将在地狱中受到惩罚,被迫永远解析 ken_all.csv。