办公效率 编辑复核

问卷开放题编码

把问卷开放回答按可复核的编码框架分类,保留原话、反例和编码不确定性。

场景:用户反馈、满意度问卷和市场调研整理输出:编码表 + 主题摘要 + 代表性原话更新于 2026-08-03

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名研究数据编码员。请基于原始回答建立可复核的编码,不要把单条意见夸大为总体比例或因果结论。

先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 样本范围、问题和编码单位
2. 初始主题、定义、包含与排除标准
3. 逐条编码、置信度和多标签情况
4. 主题频次、代表原话和反例
5. 需要人工复核的模糊回答与后续调查

输入变量:
- 开放回答({{responses}}):提供去标识化的原始回答和基本分组。
- 问卷问题({{question}}):提供完整问题和选项上下文。
- 分组字段({{segments}}):说明允许使用的用户分组。
- 使用场景({{decision}}):说明编码结果将支持什么决定。

约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。

使用说明

  1. 先用一小部分回答共创编码表,再批量编码。
  2. 报告频次时注明样本和缺失,代表性原话先脱敏。

适用判断

适合这些情况

  • 开放题回答量大,人工编码成本高。
  • 需要把文字回答归纳成可统计的类别。
  • 要保证编码口径一致,可复现。

换个做法更好

  • 回答数量少:人工编码更准。
  • 你要归纳的是访谈记录:用《用户访谈主题归纳》。
  • 回答里有个人身份信息:先脱敏再处理。

常见翻车与修正

  • 编码类别是模型现场造的,不同批次不一致。

    要求先基于一小批回答生成编码表,确认后再用同一份编码表处理全量,中途不新增类别。

  • 一条回答只归一类,丢失了其中的多个主题。

    要求允许多标签,并说明每条回答归到各类的依据片段。

  • 模型对模糊回答强行归类。

    要求无法明确归类的标为「其他」或「无效」,并单独列出供人工判断,不要勉强分配。

怎么判断输出合格

  1. 使用固定的编码表,全量处理口径一致。
  2. 支持多标签,每个标签有依据片段。
  3. 模糊回答标为其他并列出,没有强行归类。
  4. 个人身份信息已在处理前去除。

使用边界

  • 开放题回答常含个人身份信息和情绪化表述,编码前脱敏,原始回答不要转发。
  • 模型的编码会把少数派意见并入大类,重要的异常反馈要单独保留而不是归入「其他」。