Commit 20dc9503 authored by Data Governance Dev's avatar Data Governance Dev

chore: 初始化项目,记录数据治理目标

定义项目的核心目标与约束:
- 只读分析 smart-build 数据库(MySQL),不修改任何数据
- 五个治理方向:可合并表/冗余字段、空字段、缺注释、固定长度字段、规范字段
- 已识别的国标:身份证、统一社会信用代码、手机号、地区编码
- 工作流分阶段沉淀:脚本 -> 工作流 -> Web 端

Why:后续所有治理脚本、工作流、Web 端都以本目标为准绳。
How:CLAUDE.md 描述目标;.gitignore 屏蔽运行产物(outputs/、JSON
     输出、__pycache__、work-logs 等),保留源代码本身。
parents
# ── 编辑器临时文件 ──
cli.txt
tags
work-logs
# ── 数据库相关 ──
national_standards
# ── 运行产出(不纳入版本控制) ──
outputs/
data_dictionary/*.json
web/outputs/
# ── Python 字节码缓存 ──
**/__pycache__/
*.pyc
*.pyo
# ── Node / 前端 (留作扩展) ──
node_modules/
dist/
# ── 系统文件 ──
.DS_Store
Thumbs.db
# ── 工作流运行时产物 ──
work-logs/
*.log
!web/logs/.gitkeep
\ No newline at end of file
# 说明
这是一个数据治理的项目,我需要对一个数据库里面表单以及数据进行分析,然后提出改进意见
注意我不会对数据库做任何修改,只是发现问题
最终成果是一个报告文件,以word文档形式
项目数据库:smart-build
数据库软件:mysql
以下是我的目标:
1. 检查可以合并的表,针对冗余字段提示冗余
2. 检查大范围空的字段
3. 检查没有注释的字段(如果类比可以推测的话把推测内容写上)
4. 检查字段控件大于字段值(比如身份证号,手机号等固定长字段)
5. 检查不符合规范的字段
针对上面的4,5两点,已知有如下字段对象:
- 身份证号码
- 手机号码
- 统一社会信用代码
- 地区编码
在治理过程中如果发现有哪些字段有相关的国家标准或者可能有国家标准提示我去查找
大致流程如下:
1. 通过python脚本获取数据字典
2. 编写脚本去数据库中的数据(样本)
3. 通过数据验证哪些表的数据有冗余,并做记录
4. 查找哪些字段需要规范
- 期间记录好操作记录,后须最好能抽出成一个固定工作流程
# 下一阶段
- 目前已经把过去工作整理成工作流并且实现Web端调用,参考: `./web/README.md`
# 总体要求
- 每做一个任务就在工作记录中记录一次
Markdown is supported
0%
or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment