feat(env): 更新目标库配置及添加 PostgreSQL 环境变量
- 目标库名称由 hk_songs 修改为 hk_songs_test,新增中间表 hk_songs_import_staging - 添加测试环境 crawler_dev PostgreSQL 连接配置变量 - 添加正式环境 archive_crawler PostgreSQL 连接配置变量 refactor(check_record_titles): 调整平台原始标题核对逻辑 - 变更核对数据库源为 archive_crawler 与 hikoon-data-spider - 按平台分表批量查询 spider 原始标题替代原录音名查询 - 合并结果中使用 spider_title 与 crawler_title 精确比对 - 输出 Excel 标题及字段相应更新,匹配时整行高亮 - 修改脚本参数说明和默认批处理数量描述 - 日志及信息输出文本调整以反映新数据源 feat(fix_record_titles): 新增基于 spider 标题的归一化批量修复工具 - 支持从 archive_crawler 读取待修复记录的推送关系 - 结合 spider 标题,计算归一化标题和版本号 - 支持对不同平台数据批量生成更新 SQL 预览或应用 - 支持备份更新前数据,支持安全回退操作 - 导出更新报告 Excel,突出显示变化字段 - 支持长文本分批过滤,避免数据库字段长度异常 - 增加命令行参数控制应用范围、批量大小及排除标题列表 - 使用严格的 SQL 语句构造与变更检测优化更新效率 - 实现基于 run_id 的多表回滚机制,保证数据一致性
Showing
14 changed files
with
2653 additions
and
113 deletions
fix_record_titles.py
0 → 100644
gen_gap_xlsx.py
0 → 100644
python/title-norm/tests/test_title_norm.py
0 → 100644
python/title-norm/title_norm/__init__.py
0 → 100644
sync_singer_hot_songs.py
0 → 100644
test_fix_record_titles.py
0 → 100644
-
Please register or sign in to post a comment