跳转到内容
API 入口

AI 科研

用 AI 辅助访谈编码并保留原始证据

本指南帮助用户研究与定性研究人员从脱敏访谈建立代码本,先用小样本校准定义、证据边界和分歧处理,再扩展编码,同时避免把模型推断写成受访者原话。

预计阅读
3 分钟
首次发布
最近更新

AI 可以协助定位访谈片段、应用初步代码和整理编码分歧,但编码决定必须能回到 受访者原话与明确代码定义。开始前先确认同意与数据处理规则,去除不必要身份 信息,并用少量材料校准;不能把模型对情绪或动机的猜测当作数据。

快速摘要 内容
输入 获授权且必要脱敏的逐字稿、研究问题、来源编号与初始代码本
输出 片段—代码表、代码定义、纳入排除例、备忘录和分歧清单
关键原则 语义与语境并重,原话和解释分层,保留未编码与反例片段
高风险 身份泄露、过度心理推断、切碎上下文、自动报告虚假一致率

适合研究者已有问题和材料时做初轮整理、代码本校准与团队对照。不适合把未经 同意的录音或逐字稿上传,也不适合完全自动决定主题、敏感标签或参与者风险。 医疗、人事和脆弱群体访谈应遵循更严格的伦理与访问控制。

  1. 治理材料:确认同意范围、访问权限、脱敏方式和保留期限,为每段建立来源 ID。
  2. 熟悉文本:研究者先阅读并写整体备忘录,记录语境、疑问和潜在反例。
  3. 建立代码本初稿:每个代码写定义、纳入、排除、正例和易混代码。
  4. 小样本双重编码:研究者与 AI 或两名研究者独立编码同一小批片段。
  5. 处理分歧并修订:回原文讨论边界,记录为何合并、拆分或改名。
  6. 扩展与抽检:分批应用修订代码本,抽检低信心与高风险片段,保留版本日志。
研究问题:新生首次预约时遇到什么障碍?
[P03-L12] “我看到‘资源类型’,不知道宿舍自习室算哪一种,就先退出去问同学。”
代码候选:术语不清、导航困难、寻求同伴帮助。
请按代码定义草案输出:可用代码、直接证据、不能推断的内容和待澄清点。
术语不清:纳入。证据是参与者明确表示不知道“资源类型”如何对应自习室。
寻求同伴帮助:纳入。证据是“退出去问同学”。
导航困难:暂不纳入。片段没有说明找不到页面或路径,只说明分类术语不清。
不能推断:参与者缺乏数字能力、系统导致预约失败、所有新生都有相同问题。
待澄清:询问同学后是否返回并完成预约,需要结合后续片段。

编码结果明确区分原话证据和研究者可能产生的解释。

维度 合格标准 风险信号
定义 写清概念边界 只用一个模糊名词
纳入/排除 能区分相邻代码 同一片段随意套多个近义代码
证据 保留来源 ID 和必要语境 只剩摘要,没有原话位置
推断 与直接描述分开 从停顿推断人格或情绪
分歧 有记录和处理理由 为追求整齐强行统一
版本 代码变更可追踪 批量编码中途改定义却不重检
  • 先让 AI 自动找主题,再用它生成的主题证明自己正确。
  • 为保护篇幅切掉前后语境,导致同一句话被误读。
  • 把“没有提到”编码为“不存在”或“不同意”。
  • 只保留高频代码,删除少数但可能重要的反例。
  • 代码本变化后不回查早期材料,造成批次间标准不一致。

访谈脱敏后一定可以交给 AI 吗?

Section titled “访谈脱敏后一定可以交给 AI 吗?”

不一定。还要满足知情同意、伦理审批、合同和机构数据政策。组合信息仍可能重新 识别个人;不确定时只用合成片段校准方法。

可以整理两套编码的重合与差异,但指标计算需要明确单位、代码规则和方法。数字 不能替代对分歧原因的讨论,也不能虚构独立编码过程。

可以,只要每个代码都有明确证据且符合代码本。不要为了减少数量强行单选,也 不要把语义相近的代码全部叠加。

当多次出现无法归类片段、相邻代码持续混淆或定义不能回答研究问题时应修订。 每次改动记录原因、日期和受影响材料,并回查早期编码。

AI 辅助编码必须从数据治理和清晰代码本开始。以小样本独立编码校准边界,所有 决定保留原话位置和分歧日志;模型推断永远不能伪装成参与者亲口陈述。