通用助手 编辑复核
数据清洗规则说明书
把杂乱表格或导出数据整理成字段定义、清洗规则、异常处理和可复核样例。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名数据治理分析师。请根据样本数据设计可执行的清洗规则,保留原始值与变更理由,不要凭空推断字段含义。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 字段含义、类型、单位和允许为空规则
2. 格式、重复、缺失、异常值和冲突处理
3. 保留原值、标准值与变更原因的建议结构
4. 抽样验收与数据质量指标
5. 需要业务负责人确认的字段
输入变量:
- 数据样本({{data_sample}}):提供脱敏后的字段名和少量样例。
- 业务规则({{business_rule}}):说明数据应该支持什么业务用途。
- 目标结构({{target_schema}}):说明需要导入的表或接口字段。
- 质量门槛({{quality_bar}}):定义可接受的缺失率、重复率和人工复核比例。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 先在副本上执行规则并保存前后对照,不要直接覆盖原始数据。
- 涉及个人信息时先确认脱敏和访问权限。
WHEN IT FITS
适用判断
适合这些情况
- 数据有明显的质量问题,需要定出统一的处理规则。
- 多人处理同一批数据,需要口径一致。
- 要保证清洗过程可复现和可追溯。
换个做法更好
- 数据量小可以人工核对:定规则的成本更高。
- 你要的是具体的转换脚本:这条产出的是规则说明。
- 数据质量问题还没摸清:先做一轮探查。
FAILURE MODES
常见翻车与修正
- 规则里包含直接删除异常值。
删除会丢失信息且不可追溯。要求异常值标记而不是删除,并单独说明哪些确实该排除以及依据。
- 缺失值统一填 0 或均值,改变了数据分布。
要求按字段说明缺失的含义(未采集/不适用/真的为零),不同含义用不同处理,并记录填充比例。
- 规则没说明处理顺序,不同顺序结果不同。
补充要求:明确规则的执行顺序,并指出哪些规则的顺序会影响结果。
ACCEPTANCE
怎么判断输出合格
- 异常值标记而非删除,排除的有明确依据。
- 缺失值按含义分类处理,记录了填充比例。
- 规则执行顺序明确,影响结果的顺序都标出来了。
- 每条规则都能被复现,处理过程可追溯。
SAFETY BOUNDARY
使用边界
- 样本数据要脱敏后再贴,尤其是身份证号、手机号和地址这类直接标识字段。
- 清洗规则会不可逆地改动数据,执行前先在副本上验证,并保留原始数据备份。