lyric_reuse_review_v1_GUIDE.md 2.89 KB

歌词复用测试集 v1 审核说明

文件

  • lyric_reuse_review_v1.csv:320 对盲审样本,实际审核使用这个文件。
  • lyric_reuse_review_v1_manifest.csv:抽样分层和旧系统弱标签。完成盲审前不要打开,避免旧结论影响判断。
  • lyric_reuse_review_v1_stats.json:构建参数、候选池规模和分层数量。

盲审表已经随机打散,不包含抽样分层、旧去重结论或旧置信度。

歌词字段

query_lyrics_url_or_textcandidate_lyrics_url_or_text 根据对应的 *_lyrics_source_type 解释:

  • inline:字段内容本身就是歌词原文。
  • url:字段是歌词地址,需要访问地址查看原文。

审核顺序

先判断内容关系,再看标题、歌手和词曲作者判断作品关系,最后给出业务政策标签。不要因为标题或作者相同就改变内容关系标签。

1. review_content_relation

只判断歌词内容事实,填写以下一个值:

  • near_identical:主体歌词基本一致,差异主要是格式、重复次数或极少改动。
  • substantial_local_reuse:存在较长或多段实质复用,但整首并非基本一致。
  • limited_fragment:存在可确认的小段复用,覆盖范围有限。
  • weak_common_or_translation_only:只有常见短句、副歌套话或翻译层面的弱重合。
  • no_meaningful_reuse:没有值得关注的歌词复用。
  • cannot_judge:歌词缺失、语言或文本质量导致无法判断。

2. review_metadata_relation

结合标题、歌手和词曲作者填写:

  • same_work_same_version
  • same_work_different_version
  • different_work
  • unknown

这里判断的是作品/版本关系,不代表已经确认授权。

3. review_policy_label

填写建议的业务队列:

  • suspected_wash_reuse:内容存在实质复用,且元数据不支持合理的同作品/版本关系。
  • duplicate_or_same_record:同一作品且歌词基本重复,适合按重复记录处理。
  • version_or_rights_review:可能是翻唱、Remix、同词不同曲、公共文本或其他版本/权利问题。
  • no_reuse_action:不需要因歌词复用采取动作。
  • insufficient_evidence:证据不足,暂时无法分流。

政策标签不是侵权裁定;授权状态仍需版权信息确认。

4. review_confidence

  • high
  • medium
  • low

5. review_notes

自由填写关键依据,例如:

  • 复用发生在哪一段
  • 仅制作名单相同
  • 仅译文相同
  • 同标题但词作者不同
  • 疑似古诗词或公共文本
  • URL 无法访问

建议审核方式

  • 第一轮先审核全部样本,不查看 manifest。
  • cannot_judgeunknown 和低置信度记录进行第二轮复核。
  • 完成后保留原始 sample_id,不要重新排序或删除行。
  • 将填好的盲审 CSV 返回后,再结合 manifest 计算各分层召回率、误报率和政策分流结果。