lyric_reuse_review_v1_GUIDE.md
2.89 KB
歌词复用测试集 v1 审核说明
文件
-
lyric_reuse_review_v1.csv:320 对盲审样本,实际审核使用这个文件。 -
lyric_reuse_review_v1_manifest.csv:抽样分层和旧系统弱标签。完成盲审前不要打开,避免旧结论影响判断。 -
lyric_reuse_review_v1_stats.json:构建参数、候选池规模和分层数量。
盲审表已经随机打散,不包含抽样分层、旧去重结论或旧置信度。
歌词字段
query_lyrics_url_or_text 和 candidate_lyrics_url_or_text 根据对应的 *_lyrics_source_type 解释:
-
inline:字段内容本身就是歌词原文。 -
url:字段是歌词地址,需要访问地址查看原文。
审核顺序
先判断内容关系,再看标题、歌手和词曲作者判断作品关系,最后给出业务政策标签。不要因为标题或作者相同就改变内容关系标签。
1. review_content_relation
只判断歌词内容事实,填写以下一个值:
-
near_identical:主体歌词基本一致,差异主要是格式、重复次数或极少改动。 -
substantial_local_reuse:存在较长或多段实质复用,但整首并非基本一致。 -
limited_fragment:存在可确认的小段复用,覆盖范围有限。 -
weak_common_or_translation_only:只有常见短句、副歌套话或翻译层面的弱重合。 -
no_meaningful_reuse:没有值得关注的歌词复用。 -
cannot_judge:歌词缺失、语言或文本质量导致无法判断。
2. review_metadata_relation
结合标题、歌手和词曲作者填写:
same_work_same_versionsame_work_different_versiondifferent_workunknown
这里判断的是作品/版本关系,不代表已经确认授权。
3. review_policy_label
填写建议的业务队列:
-
suspected_wash_reuse:内容存在实质复用,且元数据不支持合理的同作品/版本关系。 -
duplicate_or_same_record:同一作品且歌词基本重复,适合按重复记录处理。 -
version_or_rights_review:可能是翻唱、Remix、同词不同曲、公共文本或其他版本/权利问题。 -
no_reuse_action:不需要因歌词复用采取动作。 -
insufficient_evidence:证据不足,暂时无法分流。
政策标签不是侵权裁定;授权状态仍需版权信息确认。
4. review_confidence
highmediumlow
5. review_notes
自由填写关键依据,例如:
- 复用发生在哪一段
- 仅制作名单相同
- 仅译文相同
- 同标题但词作者不同
- 疑似古诗词或公共文本
- URL 无法访问
建议审核方式
- 第一轮先审核全部样本,不查看 manifest。
- 对
cannot_judge、unknown和低置信度记录进行第二轮复核。 - 完成后保留原始
sample_id,不要重新排序或删除行。 - 将填好的盲审 CSV 返回后,再结合 manifest 计算各分层召回率、误报率和政策分流结果。