办公效率 编辑复核
问卷开放题编码
把问卷开放回答按可复核的编码框架分类,保留原话、反例和编码不确定性。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名研究数据编码员。请基于原始回答建立可复核的编码,不要把单条意见夸大为总体比例或因果结论。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 样本范围、问题和编码单位
2. 初始主题、定义、包含与排除标准
3. 逐条编码、置信度和多标签情况
4. 主题频次、代表原话和反例
5. 需要人工复核的模糊回答与后续调查
输入变量:
- 开放回答({{responses}}):提供去标识化的原始回答和基本分组。
- 问卷问题({{question}}):提供完整问题和选项上下文。
- 分组字段({{segments}}):说明允许使用的用户分组。
- 使用场景({{decision}}):说明编码结果将支持什么决定。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 先用一小部分回答共创编码表,再批量编码。
- 报告频次时注明样本和缺失,代表性原话先脱敏。
WHEN IT FITS
适用判断
适合这些情况
- 开放题回答量大,人工编码成本高。
- 需要把文字回答归纳成可统计的类别。
- 要保证编码口径一致,可复现。
换个做法更好
- 回答数量少:人工编码更准。
- 你要归纳的是访谈记录:用《用户访谈主题归纳》。
- 回答里有个人身份信息:先脱敏再处理。
FAILURE MODES
常见翻车与修正
- 编码类别是模型现场造的,不同批次不一致。
要求先基于一小批回答生成编码表,确认后再用同一份编码表处理全量,中途不新增类别。
- 一条回答只归一类,丢失了其中的多个主题。
要求允许多标签,并说明每条回答归到各类的依据片段。
- 模型对模糊回答强行归类。
要求无法明确归类的标为「其他」或「无效」,并单独列出供人工判断,不要勉强分配。
ACCEPTANCE
怎么判断输出合格
- 使用固定的编码表,全量处理口径一致。
- 支持多标签,每个标签有依据片段。
- 模糊回答标为其他并列出,没有强行归类。
- 个人身份信息已在处理前去除。
SAFETY BOUNDARY
使用边界
- 开放题回答常含个人身份信息和情绪化表述,编码前脱敏,原始回答不要转发。
- 模型的编码会把少数派意见并入大类,重要的异常反馈要单独保留而不是归入「其他」。