扫码与数据项目顾问沟通
我们会围绕项目场景、数据规模与交付节奏提供建议
数据采集 / 数据标注 / 算法支撑 / 项目协同 / 行业交流
行业洞察
构建知识库问答数据的第一步,并非直接提问,而是对原始文档进行深度清洗与结构化解析。
构建高质量的企业知识库问答数据,关键在于建立“源文档语义切分 -> 智能问题生成与难度分层 -> 证据精准锚定 -> 专家双盲审校”的全流程规范。实操中,首先需要将企业的 SOP、技术手册、合同及规章制度进行结构化解析与 Chunking 切片;随后围绕核心知识点设计涵盖单跳事实、多跳逻辑与超纲拒答的多难度问题;最后精准绑定文档 ID、Chunk 切片与原文证据,并由领域专家对标准答案进行审校,形成具备高可追溯性的可评测 QA 数据集。
随着 RAG(检索增强生成)与企业私有化大模型在智能客服、内部知识助手等场景的深入应用,高质量的知识库问答数据已成为检验知识检索准确率、评估模型回答忠实度以及驱动模型微调(SFT)的核心生产要素。
企业知识库往往包含 PDF、Word、Excel 及 HTML 等多种非结构化或半结构化文档。构建知识库问答数据的第一步,并非直接提问,而是对原始文档进行深度清洗与结构化解析。
在文档切分(Chunking)阶段,需要根据文档类型选择适配的切分策略:
标题层级切分(Markdown/Header-aware Chunking): 适用于结构清晰的规章制度与技术文档,保留章节上下文关系。
重叠滑动窗口切分(Sliding Window Chunking): 适用于长篇叙述性文本,设定固定 Token 长度并保留 10%~20% 的重叠区,防止跨句知识点被切断。
表格与结构化数据提取: 针对财务报表或产品参数表,将 HTML/Markdown 表格整体作为一个 Chunk 处理,避免按行切断导致上下文丢失。
切分完成后,每个文档块都必须分配全局唯一的 doc_id(文档ID)与 chunk_id,并记录其在原文档中的章节位置信息,为后续的证据定位奠定基础。
如果问答数据仅包含简单的“一问一答”事实查找,将无法全面检验 RAG 系统在面对复杂业务场景时的检索与理解能力。因此,在生成问题(Question Generation)时,必须建立严密的难度分层机制。
| 难度等级 | 问题类型 | 场景特征 | 检索与推理要求 |
| L1:基础事实(Single-hop) | 单切片事实检索 | “某产品的保修期是多久?” | 答案完全位于单一 Chunk 内,考察基础召回能力 |
| L2:跨段逻辑(Multi-hop) | 多切片对比与合成 | “A 方案与 B 方案在退款政策上有何区别?” | 需要检索并整合 2 个或以上 Chunk 的信息方能回答 |
| L3:上下文约束(Conditional) | 带有特定身份/时效条件 | “针对入职未满一年的员工,年假如何计算?” | 包含逻辑限定,考察对复杂前置条件的精准提取 |
| L4:边界拒答(Unanswerable) | 知识库未覆盖或越界问题 | “公司是否提供免费健身房补贴?”(文档未提及) | 考察系统识别知识边界的能力,防止强行产生幻觉 |
在实际构建过程中,可以通过大模型基于 Chunk 初筛生成候选问题,随后由标注人员进行同义词替换、口语化变体改写以及错别字注入,使提问方式贴近真实用户的表达习惯。
评测级知识库问答数据与普通问答数据的最大区别,在于其标准答案(Ground Truth)的可追溯性与严谨性。
每个问题生成的标准答案,都必须附带明确的原文证据(Evidence)。标注人员需要在对应的 Chunk 中高亮标出直接支持该答案的句子或段落(Evidence Span),确保“每一句话都有出处”。
针对专业性强的领域(如金融合规、医疗诊疗、工程设计),大模型生成的初始答案往往存在“似是而非”的事实性偏差。必须引入行业专家审校机制:
初审: 检查答案是否完全符合原文,剔除模型自行挥发的推论。
复审(双盲): 独立审核人员在不看原答案的情况下重新提炼答案并比对,确保一致性(Kappa 值 > 0.85)。
一套结构完整的知识库问答数据集,不仅需要包含问答对本身,还应完整映射文档元数据、切片索引、原文证据与难度标签。
{ "qa_id": "qa_ent_2026_0142", "doc_id": "doc_hr_policy_v3", "doc_title": "企业人力资源管理制度汇编_2026版.pdf", "chunk_id": "chunk_hr_policy_c028", "difficulty": "L2_Multi_hop", "question": "试用期员工如果申请带薪病假,需要提供哪些材料?扣薪标准是什么?", "answer": "试用期员工申请带薪病假需提供三级医院开具的诊断证明与请假单。扣薪标准为:病假期间按基本工资的 80% 发放,不影响试用期绩效考核评估。", "evidence": [
{ "chunk_id": "chunk_hr_policy_c028", "text_segment": "员工申请病假须提交三级医院诊断证明及书面请假单。"
},
{ "chunk_id": "chunk_hr_policy_c029", "text_segment": "试用期内病假工资按约定基本工资的 80% 支付。"
}
], "metadata": { "domain": "HR_Policy", "is_answerable": true, "created_at": "2026-07-28"
}
}
切分策略决定数据上限: 必须针对 PDF 表格、段落层级与结构化文档采取差异化的 Chunking 方案,确保知识点完整性。
全量数据绑定元数据: 标注数据时,必须保留 doc_id 与 chunk_id,实现从答案到源文档段落的毫秒级逆向追溯。
按比例阶梯式分层: 建立 L1 到 L4 的难度梯度,其中复杂逻辑与无答案陷阱问题应占总量的 30% 以上。
口语化与近义词改写: 避免提问直接照搬文档原词,通过人工改写引入真实场景中的模糊表达与同义替换。
人工专家严格仲裁: 建立行业专家双盲审校流程,确保标准答案做到零幻觉、零事实偏离。
自动化 Schema 校验: 交付前通过脚本对字段格式、证据区间匹配度及 JSON 规范进行 100% 自动化质检。
针对扫描件或版面复杂的 PDF,需要先行使用具备版面分析(Layout Analysis)能力的表格与 OCR 引擎,将文本、标题、页眉页脚及表格进行区域分割与结构化重构。剔除无效水印与页码后,再将清洗后的 Markdown 文本导入 QA 构建流程,否则会大幅增加后续切片与问题生成的噪音。
这取决于应用场景。如果是用于 RAG 系统效果评测(Benchmark),建议按每个核心业务模块 100~200 条问答构建,整体储备 500~1000 条高质量评测集即可;如果是用于大模型领域微调(SFT),通常需要积累 5,000 到 20,000 条涵盖多类文档的高精度 QA 数据对。
建议建立“文档-切片-QA”的连带更新机制。通过在数据集中记录 doc_id 与文档版本号,当某份企业 SOP 更新时,受影响的 Chunk ID 会被系统标记,只需重新对增量或变动的 Chunk 发起问答校验与局部更新,无需全量重做数据集。
LLM 自动生成的问答存在较严重的“原词依赖”与“倾向性成功”问题,即提问方式与文档原文高度重合,且无法模拟真实用户提问时的语序颠倒、信息缺失或越界提问。纯 LLM 生成的数据无法真实检验 RAG 系统的鲁棒性,必须引入人工改写与专家审查进行质量兜底。
在真实生产环境中,用户有近 15%~20% 的提问超出知识库当前覆盖范围。如果不训练或评测模型的拒答能力,RAG 系统在强行匹配不相关 Chunk 后会产生严重的事实幻觉。加入无答案问题并标注标准拒答语,是提升系统可信度的关键手段。
如果您正在规划企业知识库助手、智能客服或面向特定行业的 RAG 问答系统,并需要构建高标准、可复用的问答数据集,我们提供从文档解析、Chunking 优化到高精度 QA 数据标注的全流程工程化服务。
您可以:
提交您的知识库样例文档,获取定制化的 QA 数据切分与生成方案评估;
申请免费的标准 QA 数据 Schema 模板与评测样例包;
预约技术专家,探讨特定行业知识库的专家审校与质量管控策略。
欢迎联系我们的数据专家团队,获取专业的数据集建设支持与项目评估。


我们会围绕项目场景、数据规模与交付节奏提供建议
数据采集 / 数据标注 / 算法支撑 / 项目协同 / 行业交流
提交样本与需求,专业顾问为您评估周期、成本与交付方式。