1. 05 Aug, 2026 2 commits
    • Data Governance Dev's avatar
      feat(data-dict): Phase 1 - 单文件脚本完成 smart-build 数据字典与首轮分析 · 31911f51
      Data Governance Dev authored
      第一阶段,针对 smart-build 数据库做一次性手工治理:
      - fetch_data_dictionary.py:拉取 information_schema,输出 data_dictionary.json
      - check_empty_fields.py:逐表扫 NULL/空字符串比例,输出高空字段报告
      - verify_merge_redundancy.py + .sql:连库验证合并候选的实际行数
      - validate_standard_fields.py:对身份证/手机/统一社会信用代码等抽样校验
      - check_field_length.py:识别 VARCHAR 超出固定长度的字段(基于国标)
      - check_uncommented_fields.py:扫描无注释字段,按字段名启发式推测
      - generate_report.py:把以上 JSON 汇总成 Word 报告
      
      Why:先把\"用什么工具看什么数据\"跑通,再抽象成可复用工作流。
      How:每个脚本独立运行,输出落 JSON 到 data_dictionary/,最终由
           generate_report.py 汇总成 数据治理报告_smart-build.docx。
      31911f51
    • Data Governance Dev's avatar
      chore: 初始化项目,记录数据治理目标 · 20dc9503
      Data Governance Dev authored
      定义项目的核心目标与约束:
      - 只读分析 smart-build 数据库(MySQL),不修改任何数据
      - 五个治理方向:可合并表/冗余字段、空字段、缺注释、固定长度字段、规范字段
      - 已识别的国标:身份证、统一社会信用代码、手机号、地区编码
      - 工作流分阶段沉淀:脚本 -> 工作流 -> Web 端
      
      Why:后续所有治理脚本、工作流、Web 端都以本目标为准绳。
      How:CLAUDE.md 描述目标;.gitignore 屏蔽运行产物(outputs/、JSON
           输出、__pycache__、work-logs 等),保留源代码本身。
      20dc9503