线序大模型数据集标准
线序大模型(LineSeq Model)数据集构建与治理标准,涵盖数据采集、清洗、标注、质量评估、安全合规及版本管理等全流程规范。
线序大模型数据集标准
一、总则
1.1 目的
本标准旨在规范线序大模型(LineSeq Model)训练与微调所需数据集的构建、治理与评估流程,确保数据质量、安全性与合规性,为模型能力持续提升提供可靠的数据底座。
1.2 适用范围
本标准适用于线序大模型全生命周期涉及的数据集,包括但不限于:
- 预训练数据集
- 监督微调(SFT)数据集
- 人类反馈强化学习(RLHF)数据集
- 评测基准数据集
- 领域适配数据集
1.3 基本原则
- 质量优先:数据质量优于数据规模,宁缺毋滥。
- 安全合规:严格遵守法律法规,保障数据来源合法、内容安全。
- 可追溯:数据集全流程可审计、可复现。
- 持续迭代:数据集随模型版本迭代持续更新与优化。
二、数据采集标准
2.1 来源要求
数据来源须满足以下条件:
- 来源合法,具备明确的授权或许可。
- 优先使用自有数据、开源许可数据及已获授权的第三方数据。
- 禁止采集涉密、侵权或违反个人信息保护法规的数据。
2.2 数据多样性
- 语言覆盖:以中文为主,英文为辅,兼顾多语种场景。
- 领域覆盖:涵盖通用对话、知识问答、代码生成、文档理解、行业专业领域等。
- 格式覆盖:支持纯文本、结构化数据(JSON/CSV)、Markdown、代码块、表格等多格式。
2.3 采集规范
- 单条数据长度建议 128–8192 token,超长文本需合理切分并保留上下文。
- 采集时记录数据来源、采集时间、采集方式等元信息。
三、数据清洗标准
3.1 去重
- 基于 MinHash 或 SimHash 进行近似去重。
- 完全重复数据直接剔除,高度相似数据保留一条最优版本。
3.2 质量过滤
- 剔除乱码、无意义字符、格式严重损坏的数据。
- 剔除内容过短(< 50 字符)或信息密度过低的数据。
- 剔除包含明显错误、矛盾或虚假信息的数据。
3.3 敏感信息脱敏
- 自动识别并脱敏身份证号、手机号、银行卡号、邮箱等个人信息。
- 涉及商业机密、国家秘密的内容一律剔除。
3.4 内容安全过滤
- 过滤涉黄、涉暴、涉恐、涉政敏感等违规内容。
- 过滤歧视性、攻击性、误导性内容。
四、数据标注标准
4.1 标注规范
- 标注人员须经过培训并通过考核。
- 标注任务须提供明确的任务说明与示例(Few-shot 范例)。
- 多轮对话标注须保持角色一致性与上下文连贯性。
4.2 标注质量
- 采用多标注交叉验证,关键任务至少双人标注。
- 标注一致性(Inter-Annotator Agreement, IAA)不低于 85%。
- 定期抽检,抽检比例不低于 10%。
4.3 标注格式
- 统一使用 JSONL 格式,每行一条完整记录。
- 对话数据采用标准 messages 格式(role: system/user/assistant)。
- 每条数据须包含唯一 ID、版本号及标注时间戳。
五、质量评估标准
5.1 评估维度
| 维度 | 说明 | 合格标准 |
|------|------|----------|
| 准确性 | 内容事实正确、逻辑自洽 | ≥ 95% |
| 完整性 | 信息充分、无关键缺失 | ≥ 90% |
| 一致性 | 同类问题回答风格与结论一致 | ≥ 90% |
| 安全性 | 无违规、无偏见、无有害输出 | 100% |
| 流畅性 | 语言通顺、表达自然 | ≥ 95% |
5.2 评估方法
- 自动化评估:基于规则与模型打分。
- 人工评估:定期抽样人工评审。
- 对抗测试:针对安全与鲁棒性的专项测试。
六、安全与合规标准
6.1 数据合规
- 遵守《中华人民共和国网络安全法》《数据安全法》《个人信息保护法》。
- 涉及个人信息的数据须取得明确授权或完成匿名化处理。
- 跨境数据传输须符合相关法律法规要求。
6.2 数据安全
- 数据集存储须加密,传输须使用安全通道。
- 访问权限分级管理,按需授权。
- 定期安全审计,发现风险及时处置。
七、版本管理标准
7.1 版本规范
- 数据集版本号采用
v主版本.次版本.修订号格式(如 v1.0.0)。 - 每次变更须记录变更日志,包括变更内容、变更人、变更时间。
7.2 数据集卡片(Dataset Card)
每个数据集须附带数据集卡片,包含:
- 数据集名称与版本
- 数据来源与采集方式
- 数据规模与分布统计
- 标注方法与质量指标
- 已知局限与使用注意事项
- 许可证与使用条款
八、附则
本标准由北京线序科技有限公司制定并维护,随线序大模型迭代持续更新。如有疑问或建议,请联系线序科技技术团队。
AIGC:
Label: "1"
ContentProducer: 001191440300708461136T1XGW3
ProduceID: a3bb69775e07ce91bc0bb23bd0119c8c_8d3370c78ab011f19d23525400e6dd8f
ReservedCode1: myDDjU5RK6YJ59+5fyJLs9bVdZNBtOwb0QdTUYiSElI7rRBXurN1TdvpXVhWZBrKIXUHUbioNiCHUkRwCtGirSooKDpfk47qUe17fc7t3KSWdi/BaK2KhHDe6wdazvNjh5dzK9l13twZznWy3Ss200gTbbjHOS7vlQHk/ijHc3+U7Ll7mcCueZ8WhMY=
ContentPropagator: 001191440300708461136T1XGW3
PropagateID: a3bb69775e07ce91bc0bb23bd0119c8c_8d3370c78ab011f19d23525400e6dd8f
ReservedCode2: myDDjU5RK6YJ59+5fyJLs9bVdZNBtOwb0QdTUYiSElI7rRBXurN1TdvpXVhWZBrKIXUHUbioNiCHUkRwCtGirSooKDpfk47qUe17fc7t3KSWdi/BaK2KhHDe6wdazvNjh5dzK9l13twZznWy3Ss200gTbbjHOS7vlQHk/ijHc3+U7Ll7mcCueZ8WhMY=
线序大模型数据集标准
> 基于六化理论企业管理模型训练数据集制作经验整理,格式为 Alpaca(LLaMA Factory 兼容)。
1. 数据格式
1.1 文件格式
- 文件名:
liuhua_theory.json - 编码:UTF-8
- 格式:JSON 数组,每条数据一个对象
1.2 字段定义
| 字段 | 类型 | 必填 | 说明 |
| ------------- | ------ | ---- | ----------------------------------------------------------- |
| instruction | string | 是 | 用户问题/指令,描述企业管理场景或六化理论知识点提问 |
| input | string | 是 | 附加输入上下文。六化理论数据集均填空串 "",不可省略该字段 |
| output | string | 是 | 模型的标准化回答,严格按第 2 节的 7 段式结构输出 |
基础骨架:
``json``
[
{
"instruction": "你的问题或指令",
"input": "",
"output": "标准化回答..."
}
]
2. output 标准结构(7 段式)
每条 output 必须严格按以下顺序组织,缺一不可:
```
【六化理论框架分析】
一、依据六化理论框架逐层拆解(以「XX化」为核心视角)
...
二、1-6化各层分析
【第1化 · 合规化】从免疫系统角度审视:...
【第2化 · 标准化】从神经系统角度审视:...
【第3化 · 流程化】从循环系统角度审视:...
【第4化 · 系统化】从骨骼系统角度审视:...
【第5化 · 数字化】从感知系统角度审视:...
【第6化 · 智能化】从大脑系统角度审视:...
三、核心矛盾识别
...
四、短期落地措施(1-3个月内可执行)
...
五、长期优化方案(6-12个月规划)
...
六、风险预警
...
【总结】六化理论的核心智慧在于:顺序不能乱、基础不能跳、持续迭代不能停。
```
2.1 各段落要求
| 段落 | 内容要求 | 字数建议 |
| ------------ | ------------------------------------------------------------ | -------------- |
| 框架分析标题 | 【六化理论框架分析】 固定不变 | — |
| 逐层拆解 | 以某一化(合规/标准/流程/系统/数字/智能/全局)为核心视角展开 | 100-200 字 |
| 6化各层分析 | 6 段固定出现,每段以"从XX系统角度审视"开头,使用生命体比喻 | 每段 80-150 字 |
| 核心矛盾识别 | 明确指出 1 个核心矛盾 | 50-100 字 |
| 短期落地措施 | 列出 2 条具体可执行措施 | 每条 50-80 字 |
| 长期优化方案 | 1 条系统性方案 | 80-120 字 |
| 风险预警 | 1 条具体风险及应对 | 50-80 字 |
| 总结 | 固定模板,不可改动 | — |
3. 数据质量标准
3.1 做
- instruction 需覆盖六化理论的不同侧面(各化独立提问、交叉场景、理论概念解释)
- output 内容必须基于真实的六化理论框架,不可凭空编造概念
- 每条 output 总字数建议 800-1500 字
- 生命体比喻必须一一对应:合规化→免疫系统、标准化→神经系统、流程化→循环系统、系统化→骨骼系统、数字化→感知系统、智能化→大脑系统
- 数据量建议 300-800 条,实测 500 条可正常训练
3.2 不做
- 不可省略
"input": ""字段(即使为空也必须有) - 不可打乱 7 段顺序
- 不可缺失任一化(6 个化的分析必须全部出现)
- 不可改动总结段的固定文本
- 不可用通用 AI 生成的内容不经审核直接使用(需确保六化理论术语准确)
- 不可出现与六化理论框架矛盾的观点
4. 数据集注册(必须步骤)
编辑 LLaMA-Factory/data/dataset_info.json,在末尾添加:
``json``
"liuhua_theory": {
"file_name": "liuhua_theory.json",
"format": "alpaca"
}
5. 完整样例
``json``
{
"instruction": "企业部门墙严重,跨部门协作效率低下,请使用六化理论进行诊断并给出实施方案",
"input": "",
"output": "【六化理论框架分析】\n\n一、依据六化理论框架逐层拆解(以「流程化」为核心视角)\n\n部门墙的本质是流程断裂——各部门各自为政,信息在部门边界处丢失,协同变成互相推诿。流程化就是要像循环系统一样,打通信息与决策的血管,让企业作为一个整体运转。\n\n二、1-6化各层分析\n\n【第1化 · 合规化】从免疫系统角度审视:部门墙往往伴随着灰色地带,职责不清导致合规漏洞。免疫系统需要识别这些"非我"行为——跨部门推诿、责任甩锅——并建立明确的问责机制。\n\n【第2化 · 标准化】从神经系统角度审视:缺乏统一的跨部门协作标准,每个部门有自己的"方言"和节奏。神经系统需要建立统一的信号传导标准——即跨部门接口规范。\n\n【第3化 · 流程化】从循环系统角度审视:这是核心病灶。当前跨部门流程存在大量断点,信息传递依赖人工中转,像血管中的血栓阻碍血流。需要重塑端到端流程。\n\n【第4化 · 系统化】从骨骼系统角度审视:组织架构以职能划分而非以价值流划分,骨骼结构本身就在制造壁垒。需要引入矩阵式或流程型组织补充。\n\n【第5化 · 数字化】从感知系统角度审视:缺乏统一的协作平台和数据看板,各部门看不到全局。感知系统需要安装"企业神经系统传感器"——协同数字化工具。\n\n【第6化 · 智能化】从大脑系统角度审视:当前决策分散在各部分大脑中,没有形成中枢智能。智能化阶段才能实现跨部门资源的自动调度与优化。\n\n三、核心矛盾识别\n\n核心矛盾:职能型组织架构与端到端价值交付需求之间的结构性冲突。各部门的KPI与全局目标未对齐,局部最优导致全局次优。\n\n四、短期落地措施(1-3个月内可执行)\n\n1. 建立跨部门协作SLA(服务等级协议),明确各部门的响应时效和交付标准,纳入月度考核。\n2. 设立跨部门流程owner岗位,每个核心业务流程指定一名负责人,拥有跨部门协调权限。\n\n五、长期优化方案(6-12个月规划)\n\n推进组织架构从纯职能制向矩阵制过渡,在保留职能部门专业深度的同时,按产品线/客户群设立横向协调单元,并以数字化协同平台(如飞书/Lark多维表格+自动化流程)固化端到端流程。\n\n六、风险预警\n\n推行跨部门协作可能触发中层管理者的领地意识,导致消极抵抗。应对方案:先试点一个协同基础较好的业务线,用业绩提升数据说服其他部门。\n\n【总结】六化理论的核心智慧在于:顺序不能乱、基础不能跳、持续迭代不能停。"
}
6. 错误对照
| 常见错误 | 正确做法 |
| ------------------- | ------------------------------------------------------------ |
| 缺少 "input" 字段 | 必须写 "input": "",即使为空 |
| output 只有 5 段 | 必须是 7 段(含标题和总结) |
| 6化分析不完整 | 6 个化全部列出,不可跳过 |
| 生命体比喻张冠李戴 | 严格按对应表:合规→免疫、标准→神经、流程→循环、系统→骨骼、数字→感知、智能→大脑 |
| 总结段文字随意改写 | 固定文本不可改 |
| 内容空洞套话 | 每条 output 需包含具体诊断和可执行方案 |
7. 修订记录
| 版本 | 日期 | 说明 |
| ---------------------------- | ---------- | ------------------------------------------------------------ |
| v1.0 | 2026-07-29 | 初版,基于 liuhua_theory 500条数据集制作经验整理,修正原部署文档模板中缺失 input 字段的问题 |
| (仅供参考) | | |
发布日期:2026年7月
版本:v1.0.0
发布方:北京线序科技有限公司(Beijing LineSeq Technology Co., Ltd.)