方法论
这一页说明本站的数据从哪里来、哪些经过核实、哪些没有。凡是推断值都会在页面上标出来,不会混在核实过的数据里。
数据来源
- 四大作协奖(茅盾、鲁迅、全国优秀儿童文学、骏马): 中国作家网「历届获奖作品一览」,属主办方公示,一手来源。
- 诺贝尔文学奖:诺奖官方 API 提供年份、姓名与英文授奖辞; 中文译名与中文授奖辞取自中文维基百科。两边按年份与该年内顺序配对, 不按姓名配对——中外人名无法可靠匹配。
- 雨果奖 / 银河奖:维基百科条目表格。
- 书目元数据(ISBN、出版社、页数、封面):豆瓣读书。
颁奖年:核实值与推断值
作协系的源页多数只给评选时段不给颁奖年(如「第十一届茅盾文学奖获奖篇目(2019—2022)」)。这种情况下本站用评选时段终点作代理, 并在记录旁标注「年份为推断值」。
经人工逐届查证报道后填入的颁奖年,才算核实值。目前2,665 / 3,595 条记录的颁奖年是核实过的。
★ 不用「时段终点 +1」这类公式外推。该规律对骏马奖近三届成立, 但对儿童文学奖两处证伪——第四届评选时段 1995—1997,实际拖到 2000 年才颁奖。 按公式补出来的年份看起来都通顺,正因为通顺才没法被后续检查发现。
内容简介
不转载他站简介原文。本站简介是依据素材压缩改写的, 且每条都必须满足两个条件才会上线:经编辑审阅、注明依据来源。 两者缺一,页面上宁可显示「简介待补」。
目前 532 条简介已上线, 另有 547 部作品素材已入库但尚未撰写。
授奖辞是另一回事——那是评委会原文,属适当引用,照引不改写并给出处, 不经过上述审阅闸门。目前收录 179 条。
已知缺口
缺口在这里列出来,而不是藏起来:
- 930 条记录的颁奖年为推断值。
- 2,141 部作品无封面。 其中相当一部分是源站确实没有封面图,不是没匹配上—— 骏马奖实测 58 部缺口里 34 部属此类。缺封面的条目以文字卡片呈现,不是加载失败。
- 骏马奖 338 位作者的民族未标注。 源页第 1–5 届没有民族列,这批多是 1980 年代的地方作者,网络资料稀缺。不按姓氏或籍贯推测民族——那既不可验证,又恰是本奖最不该出错的字段。
- 银河奖 123 条只有英译名或拼音, 中文原名待补;该奖仅覆盖第 27–34 届。
- 3 个奖项尚无数据, 需各自找主办方公示页。
校验
构建链带四道闸:数据缺失、中文路由编码、页面内容空壳、部署文件数上限, 任一不过即中断,不会把坏的产物发出去。 另有 40 条带实测出处的校验规则,每条都对应一次真实失效—— 包括数次「所有检查都通过但产物是错的」的具体形态。
数据集可在数据下载页取得, 自行核对比听我们说更可靠。