AI 科研
用 AI 辅助访谈编码并保留原始证据
本指南帮助用户研究与定性研究人员从脱敏访谈建立代码本,先用小样本校准定义、证据边界和分歧处理,再扩展编码,同时避免把模型推断写成受访者原话。
AI 可以协助定位访谈片段、应用初步代码和整理编码分歧,但编码决定必须能回到 受访者原话与明确代码定义。开始前先确认同意与数据处理规则,去除不必要身份 信息,并用少量材料校准;不能把模型对情绪或动机的猜测当作数据。
| 快速摘要 | 内容 |
|---|---|
| 输入 | 获授权且必要脱敏的逐字稿、研究问题、来源编号与初始代码本 |
| 输出 | 片段—代码表、代码定义、纳入排除例、备忘录和分歧清单 |
| 关键原则 | 语义与语境并重,原话和解释分层,保留未编码与反例片段 |
| 高风险 | 身份泄露、过度心理推断、切碎上下文、自动报告虚假一致率 |
适用与不适用
Section titled “适用与不适用”适合研究者已有问题和材料时做初轮整理、代码本校准与团队对照。不适合把未经 同意的录音或逐字稿上传,也不适合完全自动决定主题、敏感标签或参与者风险。 医疗、人事和脆弱群体访谈应遵循更严格的伦理与访问控制。
6 步编码流程
Section titled “6 步编码流程”- 治理材料:确认同意范围、访问权限、脱敏方式和保留期限,为每段建立来源 ID。
- 熟悉文本:研究者先阅读并写整体备忘录,记录语境、疑问和潜在反例。
- 建立代码本初稿:每个代码写定义、纳入、排除、正例和易混代码。
- 小样本双重编码:研究者与 AI 或两名研究者独立编码同一小批片段。
- 处理分歧并修订:回原文讨论边界,记录为何合并、拆分或改名。
- 扩展与抽检:分批应用修订代码本,抽检低信心与高风险片段,保留版本日志。
示例:编码预约系统访谈片段
Section titled “示例:编码预约系统访谈片段”研究问题:新生首次预约时遇到什么障碍?[P03-L12] “我看到‘资源类型’,不知道宿舍自习室算哪一种,就先退出去问同学。”代码候选:术语不清、导航困难、寻求同伴帮助。请按代码定义草案输出:可用代码、直接证据、不能推断的内容和待澄清点。术语不清:纳入。证据是参与者明确表示不知道“资源类型”如何对应自习室。寻求同伴帮助:纳入。证据是“退出去问同学”。导航困难:暂不纳入。片段没有说明找不到页面或路径,只说明分类术语不清。不能推断:参与者缺乏数字能力、系统导致预约失败、所有新生都有相同问题。待澄清:询问同学后是否返回并完成预约,需要结合后续片段。编码结果明确区分原话证据和研究者可能产生的解释。
代码本复核表
Section titled “代码本复核表”| 维度 | 合格标准 | 风险信号 |
|---|---|---|
| 定义 | 写清概念边界 | 只用一个模糊名词 |
| 纳入/排除 | 能区分相邻代码 | 同一片段随意套多个近义代码 |
| 证据 | 保留来源 ID 和必要语境 | 只剩摘要,没有原话位置 |
| 推断 | 与直接描述分开 | 从停顿推断人格或情绪 |
| 分歧 | 有记录和处理理由 | 为追求整齐强行统一 |
| 版本 | 代码变更可追踪 | 批量编码中途改定义却不重检 |
- 先让 AI 自动找主题,再用它生成的主题证明自己正确。
- 为保护篇幅切掉前后语境,导致同一句话被误读。
- 把“没有提到”编码为“不存在”或“不同意”。
- 只保留高频代码,删除少数但可能重要的反例。
- 代码本变化后不回查早期材料,造成批次间标准不一致。
访谈脱敏后一定可以交给 AI 吗?
Section titled “访谈脱敏后一定可以交给 AI 吗?”不一定。还要满足知情同意、伦理审批、合同和机构数据政策。组合信息仍可能重新 识别个人;不确定时只用合成片段校准方法。
AI 能计算编码一致性吗?
Section titled “AI 能计算编码一致性吗?”可以整理两套编码的重合与差异,但指标计算需要明确单位、代码规则和方法。数字 不能替代对分歧原因的讨论,也不能虚构独立编码过程。
一段话可以有多个代码吗?
Section titled “一段话可以有多个代码吗?”可以,只要每个代码都有明确证据且符合代码本。不要为了减少数量强行单选,也 不要把语义相近的代码全部叠加。
什么时候需要修改代码本?
Section titled “什么时候需要修改代码本?”当多次出现无法归类片段、相邻代码持续混淆或定义不能回答研究问题时应修订。 每次改动记录原因、日期和受影响材料,并回查早期编码。
- 用 AI 辅助定性分析:从代码发展主题和解释。
- 用 AI 明确研究问题:让编码回应真实问题。
- 用 AI 写研究摘要:呈现证据和限制。
- 用 AI 生成会议纪要:区分讨论、结论和证据。
- 研究工作中心:查看完整研究流程。
AI 辅助编码必须从数据治理和清晰代码本开始。以小样本独立编码校准边界,所有 决定保留原话位置和分歧日志;模型推断永远不能伪装成参与者亲口陈述。