Commit 8627b77b authored by Data Governance Dev's avatar Data Governance Dev

docs: 简化 CLAUDE.md 移除已迁移到 README 的项目说明

清理内容:
- 移除项目目标 / 字段对象 / 大致流程等已过时的工作流描述
- 移除 LLM 依赖矩阵(已分散到 web/README 等具体文件)
- 移除「下一阶段」段落
- 新增 web2 与 web 的关系说明(web/ 是参考实现,web2/ 是新开发)
- 保留 4 条总体要求(记录工作 / 不自动提交 / 写清内容 / 记踩坑)
parent 26704c67
# 说明
这是一个数据治理工具,现在主要开发web端
项目数据库:smart-build
数据库软件:mysql
以下是我的目标:
1. 检查可以合并的表,针对冗余字段提示冗余
2. 检查大范围空的字段
3. 检查没有注释的字段(仅检查,2026-08-11 起不再做 LLM 推测;语义推断交给人工或其他工具)
4. 检查字段控件大于字段值(比如身份证号,手机号等固定长字段)
5. 检查不符合规范的字段
针对上面的4,5两点,已知有如下字段对象:
- 身份证号码
- 手机号码
- 统一社会信用代码
- 地区编码
在治理过程中如果发现有哪些字段有相关的国家标准或者可能有国家标准提示我去查找
大致流程如下:
1. 通过python脚本获取数据字典
2. 编写脚本去数据库中的数据(样本)
3. 通过数据验证哪些表的数据有冗余,并做记录
4. 查找哪些字段需要规范
- 期间记录好操作记录,后须最好能抽出成一个固定工作流程
# LLM 依赖(必须 vs 可选)
LLM 不是「增强」,对部分步骤是核心依赖:
| 步骤 | LLM 模式 | 含义 |
|------|---------|------|
| Step 2 表合并与冗余字段分析 | **required** | 合并 verdict 与高频字段分类必须由 LLM 判断;缺 LLM = 任务失败(2026-08-11 起 UI 隐藏,但代码保留) |
| Step 5 缺失注释字段 | **none** | 纯规则扫描无注释字段;不做语义推测(2026-08-11 起从 required 降为 none) |
| Step 4 空字段成因分类 | optional | 有 LLM 更准;缺了也能跑(走规则推理) |
| Step 6 自定义字段长度建议 | optional | 同上 |
任务提交前需要确保 `web/configs/llm.yaml` 中 `api_key` 已配置,
否则勾选 Step 2 的任务会被预检拦截、整体失败。
# 下一阶段
- 目前已经把过去工作整理成工作流并且实现Web端调用,参考: `./web/README.md`
- 这是一个数据治理工具,现在主要开发web端
- `./web/`是之前开发的工具,里面的数据链接等内容可以参考
- 现在要在`./web2`里面新开发
# 总体要求
- 每做一个任务就在工作记录中记录一次
- 不要自动提交,我说提交再提交
- 每次提交要写清除修改内容
- 每次踩坑记录一下
Markdown is supported
0%
or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment