跳转到内容
API 入口

AI 科研

用 AI 制定可审计的数据清洗计划

本指南帮助研究与分析人员在修改数据前建立数据字典、质量概况、清洗规则、异常处理、验证与回滚方案,让 AI 协助生成检查逻辑但不擅自删除或填补数据。

预计阅读
3 分钟
首次发布
最近更新

AI 可以帮助检查字段、解释错误模式和起草清洗代码,但清洗规则必须在修改数据前 由负责人确认。可靠流程保留不可变原始数据,为每条规则写依据、影响范围与验证 方法,对缺失和异常先标记再决定,不能把“不常见”直接等同于“错误”。

快速摘要 内容
必备输入 数据字典、收集方式、分析用途、原始只读副本、权限与质量要求
核心产出 数据概况、规则表、异常清单、处理脚本、验证报告和变更日志
AI 合适任务 生成探查代码、解释格式模式、起草单元测试、比较处理前后差异
禁止自动化 无依据删行、推断敏感属性、默默填补缺失、覆盖原始文件

适合问卷导出、业务表格、实验记录和公开数据的清洗规划。不适合在不了解数据 产生过程时一键“修复全部”,也不适合处理未经授权的个人或机密数据。正式统计 分析、监管报告与生产数据库变更应遵循团队审查和备份制度。

  1. 冻结原始数据:保存只读副本、来源、获取日期、校验标识和访问权限。
  2. 建立数据字典:说明字段含义、类型、单位、允许值、缺失编码和关联关系。
  3. 生成质量概况:检查行列数、唯一性、缺失、范围、格式和跨字段一致性,不先修改。
  4. 制定规则表:每条规则写问题、证据、动作、例外、负责人和验证方式。
  5. 在副本执行并留痕:代码化处理,保存异常清单和每步影响的记录数。
  6. 验证与回滚:比较处理前后分布和关键指标,抽查原行,失败时能恢复。
字段 submitted_at 应为提交日期。探查发现三种字符串:2026-07-01、07/02/2026、
03/04/2026;数据没有地区字段。请制定清洗规则,不要猜第三种是 3 月 4 日还是
4 月 3 日,不删除记录。
规则 D01:符合 YYYY-MM-DD 的值按明确格式解析,保留原值列。
规则 D02:仅当 MM/DD/YYYY 中日字段大于 12、含义唯一时,按月/日/年解析并记录依据。
规则 D03:如 03/04/2026 这类歧义值不自动解析;标记 date_ambiguous=true,进入核对表。
验证:比较原值与标准化值;统计成功、歧义和无效数量;抽查各模式样本。
输出:submitted_at_raw、submitted_at_clean、date_parse_status、rule_id。

规则保留原值并拒绝猜测,使后续人员能够重新判断歧义日期。

检查项 合格标准 风险信号
依据 来自字典、收集流程或确认记录 因为数值“看起来奇怪”
可逆 保留原始值和规则 ID 直接覆盖原列
缺失 区分未填、不适用和无效 统一填 0 或平均数
异常 先标记并查来源 超范围就删除整行
验证 有处理前后比较与抽查 脚本无报错就算成功
日志 记录版本、时间和影响范围 只保存清洗后文件
  • 数据字典尚未建立就让 AI 推断每一列的业务含义。
  • 把空字符串、0、“不知道”和跳题造成的缺失合并处理。
  • 依据整体分布删除真实但少见的案例,损害重要群体信息。
  • 自动填补缺失后不保留标记,分析者误以为所有值都被观察到。
  • 只检查代码能运行,没有验证行数、关联键和关键指标是否异常变化。

不应默认删除。异常可能是录入错误、真实极端情况或单位不同。先查数据来源和分析 目的,记录决定,并比较保留、修正或排除对结果的影响。

不能脱离缺失机制和分析方法决定。填补会引入假设,应由具备方法能力的人选择并 记录;无论采用何种方式,都保留缺失标记和原始数据。

清洗脚本运行成功就表示数据正确吗?

Section titled “清洗脚本运行成功就表示数据正确吗?”

不表示。还要检查记录数、唯一键、范围、分布、跨字段关系和抽样原行。技术成功 不能证明业务规则或研究判断正确。

版本化保存脚本、环境、规则表和输入标识,避免手工覆盖;输出每条规则的影响 数量和异常清单,让另一位人员能够从同一原始数据重新运行。

数据清洗是有依据的变更管理,不是把数据变得整齐。冻结原始层、先探查后定规则, 保留异常与缺失的处理痕迹,并用处理前后验证和抽查保证每一步可解释、可回滚。