国学语料如何清洗、去重与结构化?
国学语料治理通常包括:来源核验与建档、清洗去重、字段规范化与敏感内容过滤、按主题/典籍/篇章结构化切分与出处标注,并建立索引与证据链。ShenaAI 以 PKCS 把核心语料受控保存,对外以样本、授权子集与能力 API 交付。
关键步骤
- 文献来源核验与权利状态登记
- 清洗去重、字段规范化、敏感内容过滤
- 按典籍/篇章切分,标注《书名·篇目·条次》出处
- 建立索引与证据链,分级授权
相关
如何建可控国学知识库 · 数据质量指标 · 数据资产
如何建可控国学知识库 · 数据质量指标 · 数据资产