Commit 5d3c7883 authored by Data Governance Dev's avatar Data Governance Dev

feat(web): 报告内容完整化(Markdown + docx 全量明细)

原 step8_report.py 两个问题:

1. Markdown 每个章节都截前 10-20 条样本,详细信息缺失
2. docx 后半部分只是 stub:标题 + f"{summary}" 把整个 dict 塞进段落,
   浏览器/Word 里看到的就是一坨 JSON 风格的字符串,没有表格

重写方案:两个版本共用 SECTION_ORDER + 同名渲染函数(_md_xxx / _docx_xxx),
保证两边结构对齐。

新增/补齐的章节内容:

- 表合并候选:完整候选明细(ID/优先级/相似度/公共列数/差异列/建议/风险)
  + 各候选组的公共列清单 + 强/弱废弃候选分开列表
- 冗余字段:全部高频字段(不再截 20)+ LLM 失败标「⚠️ 待人工核对」
- 大范围空字段:阈值说明 + 按表汇总(高空数倒序) + 字段明细按表分组
  (每张表高空/中空字段单独子表,含空值率) + 跳过表清单
- 缺失注释字段:summary(涉及表/LLM 调用次数)+ 按表分布 + 推测注释明细
  (全列) + 未推测样本
- 字段长度异常:6 个汇总指标 + 全部异常字段(按 wasted_bytes desc 排,
  10 列含国标/规则/依据)
- 国标违规:按标准统计 + 每标准下的违规字段明细 + 违规样本(最多 500 条)

辅助细节:
- Markdown 表格换行用 <br>、管道符转义 \|、空值显示 -、浮点格式 xx.xx%
- docx 用原生 add_table + style 'Light Grid Accent 1',Heading 1/2/3 分层
- 顶层 docstring 说明新结构;SECTION_ORDER 单一来源驱动两版渲染

smoke test:拿真实 outputs/smart-build/20260804_085733/findings/_all_findings.json
跑过,Markdown 11425 字符 / 255 行,docx 24 段 + 7 张表格,数据正确。
parent 3687f62d
This diff is collapsed.
Markdown is supported
0%
or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment