检查结论
怎样验证纠错没有带来新的错误?
检查检索召回、错误归并、分类层级和修改日志四项。纠错后的字更规范,只能说明标签处理有改进;资料发布者、证据和原始数据还需要单独核对。
直接回答
检查检索召回、错误归并、分类层级和修改日志四项。纠错后的字更规范,只能说明标签处理有改进;资料发布者、证据和原始数据还需要单独核对。
先建立人工判定的对照集
选取已读过完整语境的样本,并人工标注“应归入、应排除、待核对”。不要用自动纠错产生的结果反过来证明自己正确。将一字相近但不同的地点、专名、英文别名和上下级地区各保留一例,防止只测容易通过的样本。
用本练习计算一次精确率与召回率
在 R1—R6 的给定语境下,查询“亚洲及其子地区”的确定相关集为 R1—R4。仅按原写法精确找“亚洲”返回 R1:精确率 1/1,召回率 1/4。按核对后的地区映射与层级查找返回 R1—R4:两项均为 4/4。R6 仍待核对,不把它包装成已证实的误匹配;这个样本的满分不代表实际目录也能满分。
单独检查三类会被总数掩盖的问题
其一,原记录数是否仍为六,是否误删了资料;其二,父级与子级汇总是否按记录编号去重;其三,未知记录是否保留并展示原因。准确率提高但把待核对记录全部隐藏,仍可能让读者误解目录覆盖范围。
修改日志要能解释每次归并
一条可用日志应包含:记录 R2、字段 raw_region → preferred_name、原写法亚州、规范名亚洲、依据为练习给定描述、规则版本 exercise-v1。原始字段不覆写。如果后续证据推翻归并,只撤销对应规范映射并重算分类,不必猜原文是什么。
来源分别能支持什么
M49 支持本站采用的地区名称、代码及层级口径;其统计分组不意味着政治归属判断。SKOS 支持把显示名称、替代标签和隐藏检索标签区分开。UNESCO 提供评估信息的素养背景。六条数据、表格设计和评价流程均由本站编写,不是这些机构发布的案例或认证。
把“地名核对”与“信息核验”拆成两栏
地名核对栏写是否对应某一地区、依据和置信限制;信息核验栏另查原始发布者、文献或数据出处、发布日期及具体主张。一个来历不明的页面可以地名完全正确,一个可信资料也可能有排字错误。不要用其中一栏代替另一栏。
把方法变成行动
- 手工确定对照样本中的相关、不相关与待核对项。
- 用相同查询比较修改前后结果,保留记录编号。
- 计算返回的相关条数 / 返回总数与返回的相关条数 / 已知相关总数。
- 检查层级去重、未知数量及修改日志。
- 补查资料本身的发布者与证据,写出仍不能判断的事项。
对照表与参考结果
| 检查项 | 本练习参考值 | 含义与限制 |
|---|---|---|
| 原记录总数 | 6 → 6 | 标签整理不能误删资料 |
| 已知相关集 | R1—R4,共 4 条 | 查询口径包含亚洲下级地区 |
| 原文精确查询 | 精确率 1/1;召回率 1/4 | 只返回 R1 |
| 映射与层级查询 | 精确率 4/4;召回率 4/4 | 仅代表六条教学数据 |
| 保留未知 | R5、R6,共 2 条 | 待核对不是自动判错 |
| 发布者可信度 | 没有由地名纠错得出结论 | 另行核对原始来源 |
延伸阅读与支持范围
以下链接提供相关领域资料。本站的问题拆解、解释和练习为编辑设计,不表示外部机构认可本站全部内容。
数据透明度
参考资料
关于这个问题的问答
对应学习卡片
检索与统计:避免漏查和重复计数
练习中直接标注亚洲为三条,东亚一条,未知两条。查询亚洲及其子地区返回四条,不能再把东亚那一条加一次。
- 使用方式
- 阅读与实践
- 内容性质
- 教学材料
纠错日志:规范地名不能证明页面可靠
给地名映射写依据和规则版本;给信息主张另查发布者与原始证据。不能用拼写规范、排名靠前或标题熟悉代替内容核验。
- 使用方式
- 阅读与实践
- 内容性质
- 教学材料
继续阅读
地名错字会造成哪些分类问题?
地名错字可能把同一地区拆成多个分类,漏掉检索结果,或在自动纠错时把不同地点误合并;地区与子地区混用还会导致重复统计。处理时应保留原文,核对地区层级和来源,再记录规范名称、稳定标识与处理理由。
包含 5 个可复现步骤
阅读指南六条地理目录记录:纠错、分层与参考答案
用六条虚构记录练习保留原写法、设置实体标识、区分层级与留待核对。参考结果是:亚洲三条、东亚一条、主题地区未知两条;原记录总数始终为六。
包含 5 个可复现步骤
阅读指南