队名规范化
同名队伍如何借助赛事与地区字段区分
使用赛事和地区上下文,不凭名称强行合并。 本文给出可复核步骤、状态边界、脱敏记录方法与复核路径。
同名队伍可能来自不同地区、赛事、级别、性别或年龄组,名称本身不足以共享entity_id。消歧工作要先保留多个候选,再用赛事上下文、地区、活跃赛季、来源内部编号和对手集合逐项排除。上下文不全时,UNKNOWN比强行合并更安全,因为错误合并会污染历史成绩和统计。
本页没有现实队伍的消歧证据。虚构的两个“联合队”分别出现在甲地区成年联赛和乙地区青年杯赛,只用于说明字段关系。它们暂时使用E1、E2两个候选标识;任何页面相似、徽标颜色或译名接近都不进入身份判断。消歧过程应建立负证据,而不仅收集相同点。例如两个候选在同一时刻参加不同地区赛事,是强烈的分离线索;一个候选年龄组明确、另一候选UNKNOWN,则不能直接视为相同或不同。对手集合的重叠只有在赛季和比赛标识可核时才有意义,来源抓取重复可能制造假重叠。场地也可能被多队共用,不是唯一身份字段。候选评分需要列每个字段贡献和缺口,阈值只决定是否进入人工复核,不自动合并。人工复核查看来源原名、赛事规则、内部编号和时间线,并尝试找反例。若合并会让同一天出现两场物理不可能的比赛,系统生成关系冲突;但时间时区未知时不能据此下结论。拆分后历史统计按版本重算,旧文章引用哪个entity_version也要记录。读者页面在待消歧期间用来源原名展示,禁止把其中一个候选的徽标或地区借给另一条记录。
先创建多个候选实体容器
遇到同名原文时,不复用现有entity_id,而创建candidate_set。每个候选保存赛事、地区、级别、年龄组、活跃赛季、来源编号和证据。没有值的字段为UNKNOWN,不从名称后缀推断。候选集带创建原因与到期复核条件,新增资料只更新相关证据栏;任何自动合并都必须先通过并发赛程与年龄级别反例。
候选容器不参与正式队史汇总,避免待核资料进入统计。来源后续补充上下文时,更新候选证据而非改原名。若发现其实是同一实体,合并也通过修订事件完成,保留候选曾经分开的历史。
- 同名先建立候选集合
- 候选不进入正式汇总
- 合并通过修订事件
按赛事和地区构建上下文
competition_id比赛事显示名可靠,地区使用有来源的国家、城市或联盟范围。一个队可能参加跨地区赛事,因此地区只是证据之一。赛事信息缺失时不能用页面域名或语言推测所在地。
赛季边界帮助排除同名实体在不同年代的重叠,但改名或迁移会造成例外。上下文表保存值、来源和时间。冲突地区并列记录,resolved_region为UNKNOWN,不能挑更常见地点。
- 赛事使用稳定标识
- 地区只作证据之一
- 冲突地区不自动裁决
利用级别与组别避免误并
成年、青年、预备、女子等组别必须独立字段,不埋在名称字符串。来源省略后缀时group_type为UNKNOWN,不能默认成年。相同俱乐部体系下的不同队仍拥有独立比赛实体。
级别字段来自赛事规则或来源说明,网页图标不构成证据。年龄界限可能随赛季变化,规则版本随值保存。组别后来确认时,通过映射修订更新候选,旧UNKNOWN继续可查。
- 组别使用独立字段
- 缺后缀不默认成年
- 年龄界限绑定规则版本
把来源编号和对手集合当佐证
来源内部队伍号可稳定区分同名,但只在该来源范围内有效,不直接成为跨来源实体号。对手集合、场地和赛历可提供关联线索,需要多项一致并有时间重叠。
单个相同对手不能证明实体同一,尤其在杯赛中。算法给候选分数时公开各项贡献,分数不自动确认。缺少来源编号时保留UNKNOWN,不从URL尾号或图片文件名猜测。
- 来源编号限定来源范围
- 对手集合只作辅助
- 评分不自动确认实体
处理拆分与合并提议
合并提议列候选、共同证据、反例、影响记录和复核状态;拆分提议指出哪些历史记录应迁移。执行前生成预览,禁止一键覆盖。证据不足时提议保持开放。
执行后每条受影响赛程产生映射修订,统计按新版本重算。原entity_id不物理删除,而是标合并或拆分关系。若后续发现错误,可以反向修订,不丢失此前页面为何展示某队史。影响清单还包括文章内链、图片说明、面包屑和结构化实体。执行前后分别保存引用数量,差异无法与提议范围对应就停止发布。
- 合并拆分先生成影响预览
- 执行产生逐记录修订
- 旧实体标关系不物理删除
用同名反例测试自动流程
测试样例覆盖同名异地、同俱乐部不同组别、跨语言译名、赛季迁移和来源编号冲突。预期多数保持候选,而非追求自动命中率。系统若在缺赛事字段时仍合并,测试应失败。
盲审人员分别阅读证据并写判断理由。意见不同继续UNKNOWN,不采用票数。测试版本、样例指纹和结果保存,模型或规则更新后对比误并风险,而不是只看处理速度。验收同时计算错误合并、错误拆分、候选遗漏和未决比例,并按年龄级别、地区与语言分层。对曾经错误合并的样例建立永久反例,确认新算法不会再次借用徽标、排名或对手统计。规则改变只更新候选,不静默改正式实体关系。
- 反例优先检验误并风险
- 缺赛事字段禁止自动合并
- 审阅分歧保持UNKNOWN
向读者展示用于区分的字段
页面同名卡并列赛事、地区、级别、赛季、来源状态和候选标识。无法区分时明确“待消歧”,不随便选择一个规范名。公开资料不包含内部账号或个人信息。
同名消歧先列出候选全集,再为每个候选分别记录支持、反对与无法判断的证据,不能只展示最终对象。赛事标识、年龄级别、地区、语言原名、来源编号、有效区间和去重后的对手网络可以参与判断,徽标、页面颜色与营销文案不能。时间比较采用区间;缺时区或只有日期时扩大不确定范围,区间重叠也不自动证明冲突。决定前做双向反事实:假设候选不同,资料能否同时成立;假设它们相同,是否出现年龄、地区或并发赛程矛盾。两种解释都无法排除时保持候选态,不加载任一方的图片、排名或别名。拆分后旧聚合标识作为历史引用保留,搜索同时列出候选和区分字段,不按热度隐藏其中之一。状态改变通过消歧事件追加,旧统计版本仍能解释当时为何未合并或曾错误聚合。回归集至少包含完全同名但确定不同、名称略异但确定相同、证据后来反转和始终无法判断四类。词典、实体算法或赛事结构每次变化都重跑,并分别计算错误合并与错误拆分。测试还复制同一比赛报道,确认对手网络先按上游指纹去重;移除一个关键区分字段后,结论必须自动退回候选。反事实评审必须保存被排除候选及其反对证据,后续资料反转时才能恢复候选,而不从零猜测。
- 同名卡公开区分字段
- 待消歧不选默认实体
- 待定状态在前端、搜索、统计和结构化输出中均不选择热门实体,旧链接仍能访问拆分前聚合版本


