Public materials

线序大模型数据集标准

线序大模型(LineSeq Model)数据集构建与治理标准,涵盖数据采集、清洗、标注、质量评估、安全合规及版本管理等全流程规范。

线序大模型数据集标准

一、总则

1.1 目的

本标准旨在规范线序大模型(LineSeq Model)训练与微调所需数据集的构建、治理与评估流程,确保数据质量、安全性与合规性,为模型能力持续提升提供可靠的数据底座。

1.2 适用范围

本标准适用于线序大模型全生命周期涉及的数据集,包括但不限于:

  • 预训练数据集
  • 监督微调(SFT)数据集
  • 人类反馈强化学习(RLHF)数据集
  • 评测基准数据集
  • 领域适配数据集

1.3 基本原则

  • 质量优先:数据质量优于数据规模,宁缺毋滥。
  • 安全合规:严格遵守法律法规,保障数据来源合法、内容安全。
  • 可追溯:数据集全流程可审计、可复现。
  • 持续迭代:数据集随模型版本迭代持续更新与优化。

二、数据采集标准

2.1 来源要求

数据来源须满足以下条件:

  • 来源合法,具备明确的授权或许可。
  • 优先使用自有数据、开源许可数据及已获授权的第三方数据。
  • 禁止采集涉密、侵权或违反个人信息保护法规的数据。

2.2 数据多样性

  • 语言覆盖:以中文为主,英文为辅,兼顾多语种场景。
  • 领域覆盖:涵盖通用对话、知识问答、代码生成、文档理解、行业专业领域等。
  • 格式覆盖:支持纯文本、结构化数据(JSON/CSV)、Markdown、代码块、表格等多格式。

2.3 采集规范

  • 单条数据长度建议 128–8192 token,超长文本需合理切分并保留上下文。
  • 采集时记录数据来源、采集时间、采集方式等元信息。

三、数据清洗标准

3.1 去重

  • 基于 MinHash 或 SimHash 进行近似去重。
  • 完全重复数据直接剔除,高度相似数据保留一条最优版本。

3.2 质量过滤

  • 剔除乱码、无意义字符、格式严重损坏的数据。
  • 剔除内容过短(< 50 字符)或信息密度过低的数据。
  • 剔除包含明显错误、矛盾或虚假信息的数据。

3.3 敏感信息脱敏

  • 自动识别并脱敏身份证号、手机号、银行卡号、邮箱等个人信息。
  • 涉及商业机密、国家秘密的内容一律剔除。

3.4 内容安全过滤

  • 过滤涉黄、涉暴、涉恐、涉政敏感等违规内容。
  • 过滤歧视性、攻击性、误导性内容。

四、数据标注标准

4.1 标注规范

  • 标注人员须经过培训并通过考核。
  • 标注任务须提供明确的任务说明与示例(Few-shot 范例)。
  • 多轮对话标注须保持角色一致性与上下文连贯性。

4.2 标注质量

  • 采用多标注交叉验证,关键任务至少双人标注。
  • 标注一致性(Inter-Annotator Agreement, IAA)不低于 85%。
  • 定期抽检,抽检比例不低于 10%。

4.3 标注格式

  • 统一使用 JSONL 格式,每行一条完整记录。
  • 对话数据采用标准 messages 格式(role: system/user/assistant)。
  • 每条数据须包含唯一 ID、版本号及标注时间戳。

五、质量评估标准

5.1 评估维度

| 维度 | 说明 | 合格标准 |
|------|------|----------|
| 准确性 | 内容事实正确、逻辑自洽 | ≥ 95% |
| 完整性 | 信息充分、无关键缺失 | ≥ 90% |
| 一致性 | 同类问题回答风格与结论一致 | ≥ 90% |
| 安全性 | 无违规、无偏见、无有害输出 | 100% |
| 流畅性 | 语言通顺、表达自然 | ≥ 95% |

5.2 评估方法

  • 自动化评估:基于规则与模型打分。
  • 人工评估:定期抽样人工评审。
  • 对抗测试:针对安全与鲁棒性的专项测试。

六、安全与合规标准

6.1 数据合规

  • 遵守《中华人民共和国网络安全法》《数据安全法》《个人信息保护法》。
  • 涉及个人信息的数据须取得明确授权或完成匿名化处理。
  • 跨境数据传输须符合相关法律法规要求。

6.2 数据安全

  • 数据集存储须加密,传输须使用安全通道。
  • 访问权限分级管理,按需授权。
  • 定期安全审计,发现风险及时处置。

七、版本管理标准

7.1 版本规范

  • 数据集版本号采用 v主版本.次版本.修订号 格式(如 v1.0.0)。
  • 每次变更须记录变更日志,包括变更内容、变更人、变更时间。

7.2 数据集卡片(Dataset Card)

每个数据集须附带数据集卡片,包含:

  • 数据集名称与版本
  • 数据来源与采集方式
  • 数据规模与分布统计
  • 标注方法与质量指标
  • 已知局限与使用注意事项
  • 许可证与使用条款

八、附则

本标准由北京线序科技有限公司制定并维护,随线序大模型迭代持续更新。如有疑问或建议,请联系线序科技技术团队。


AIGC:
Label: "1"
ContentProducer: 001191440300708461136T1XGW3
ProduceID: a3bb69775e07ce91bc0bb23bd0119c8c_8d3370c78ab011f19d23525400e6dd8f
ReservedCode1: myDDjU5RK6YJ59+5fyJLs9bVdZNBtOwb0QdTUYiSElI7rRBXurN1TdvpXVhWZBrKIXUHUbioNiCHUkRwCtGirSooKDpfk47qUe17fc7t3KSWdi/BaK2KhHDe6wdazvNjh5dzK9l13twZznWy3Ss200gTbbjHOS7vlQHk/ijHc3+U7Ll7mcCueZ8WhMY=
ContentPropagator: 001191440300708461136T1XGW3
PropagateID: a3bb69775e07ce91bc0bb23bd0119c8c_8d3370c78ab011f19d23525400e6dd8f
ReservedCode2: myDDjU5RK6YJ59+5fyJLs9bVdZNBtOwb0QdTUYiSElI7rRBXurN1TdvpXVhWZBrKIXUHUbioNiCHUkRwCtGirSooKDpfk47qUe17fc7t3KSWdi/BaK2KhHDe6wdazvNjh5dzK9l13twZznWy3Ss200gTbbjHOS7vlQHk/ijHc3+U7Ll7mcCueZ8WhMY=


线序大模型数据集标准

> 基于六化理论企业管理模型训练数据集制作经验整理,格式为 Alpaca(LLaMA Factory 兼容)。


1. 数据格式

1.1 文件格式

  • 文件名liuhua_theory.json
  • 编码:UTF-8
  • 格式:JSON 数组,每条数据一个对象

1.2 字段定义

| 字段 | 类型 | 必填 | 说明 |
| ------------- | ------ | ---- | ----------------------------------------------------------- |
| instruction | string | 是 | 用户问题/指令,描述企业管理场景或六化理论知识点提问 |
| input | string | 是 | 附加输入上下文。六化理论数据集均填空串 "",不可省略该字段 |
| output | string | 是 | 模型的标准化回答,严格按第 2 节的 7 段式结构输出 |

基础骨架

``json
[
{
"instruction": "你的问题或指令",
"input": "",
"output": "标准化回答..."
}
]
``


2. output 标准结构(7 段式)

每条 output 必须严格按以下顺序组织,缺一不可:

```
【六化理论框架分析】

一、依据六化理论框架逐层拆解(以「XX化」为核心视角)
...
二、1-6化各层分析
【第1化 · 合规化】从免疫系统角度审视:...
【第2化 · 标准化】从神经系统角度审视:...
【第3化 · 流程化】从循环系统角度审视:...
【第4化 · 系统化】从骨骼系统角度审视:...
【第5化 · 数字化】从感知系统角度审视:...
【第6化 · 智能化】从大脑系统角度审视:...
三、核心矛盾识别
...
四、短期落地措施(1-3个月内可执行)
...
五、长期优化方案(6-12个月规划)
...
六、风险预警
...

【总结】六化理论的核心智慧在于:顺序不能乱、基础不能跳、持续迭代不能停。
```

2.1 各段落要求

| 段落 | 内容要求 | 字数建议 |
| ------------ | ------------------------------------------------------------ | -------------- |
| 框架分析标题 | 【六化理论框架分析】 固定不变 | — |
| 逐层拆解 | 以某一化(合规/标准/流程/系统/数字/智能/全局)为核心视角展开 | 100-200 字 |
| 6化各层分析 | 6 段固定出现,每段以"从XX系统角度审视"开头,使用生命体比喻 | 每段 80-150 字 |
| 核心矛盾识别 | 明确指出 1 个核心矛盾 | 50-100 字 |
| 短期落地措施 | 列出 2 条具体可执行措施 | 每条 50-80 字 |
| 长期优化方案 | 1 条系统性方案 | 80-120 字 |
| 风险预警 | 1 条具体风险及应对 | 50-80 字 |
| 总结 | 固定模板,不可改动 | — |


3. 数据质量标准

3.1 做

  • instruction 需覆盖六化理论的不同侧面(各化独立提问、交叉场景、理论概念解释)
  • output 内容必须基于真实的六化理论框架,不可凭空编造概念
  • 每条 output 总字数建议 800-1500 字
  • 生命体比喻必须一一对应:合规化→免疫系统、标准化→神经系统、流程化→循环系统、系统化→骨骼系统、数字化→感知系统、智能化→大脑系统
  • 数据量建议 300-800 条,实测 500 条可正常训练

3.2 不做

  • 不可省略 "input": "" 字段(即使为空也必须有)
  • 不可打乱 7 段顺序
  • 不可缺失任一化(6 个化的分析必须全部出现)
  • 不可改动总结段的固定文本
  • 不可用通用 AI 生成的内容不经审核直接使用(需确保六化理论术语准确)
  • 不可出现与六化理论框架矛盾的观点

4. 数据集注册(必须步骤)

编辑 LLaMA-Factory/data/dataset_info.json,在末尾添加:

``json
"liuhua_theory": {
"file_name": "liuhua_theory.json",
"format": "alpaca"
}
``


5. 完整样例

``json
{
"instruction": "企业部门墙严重,跨部门协作效率低下,请使用六化理论进行诊断并给出实施方案",
"input": "",
"output": "【六化理论框架分析】\n\n一、依据六化理论框架逐层拆解(以「流程化」为核心视角)\n\n部门墙的本质是流程断裂——各部门各自为政,信息在部门边界处丢失,协同变成互相推诿。流程化就是要像循环系统一样,打通信息与决策的血管,让企业作为一个整体运转。\n\n二、1-6化各层分析\n\n【第1化 · 合规化】从免疫系统角度审视:部门墙往往伴随着灰色地带,职责不清导致合规漏洞。免疫系统需要识别这些"非我"行为——跨部门推诿、责任甩锅——并建立明确的问责机制。\n\n【第2化 · 标准化】从神经系统角度审视:缺乏统一的跨部门协作标准,每个部门有自己的"方言"和节奏。神经系统需要建立统一的信号传导标准——即跨部门接口规范。\n\n【第3化 · 流程化】从循环系统角度审视:这是核心病灶。当前跨部门流程存在大量断点,信息传递依赖人工中转,像血管中的血栓阻碍血流。需要重塑端到端流程。\n\n【第4化 · 系统化】从骨骼系统角度审视:组织架构以职能划分而非以价值流划分,骨骼结构本身就在制造壁垒。需要引入矩阵式或流程型组织补充。\n\n【第5化 · 数字化】从感知系统角度审视:缺乏统一的协作平台和数据看板,各部门看不到全局。感知系统需要安装"企业神经系统传感器"——协同数字化工具。\n\n【第6化 · 智能化】从大脑系统角度审视:当前决策分散在各部分大脑中,没有形成中枢智能。智能化阶段才能实现跨部门资源的自动调度与优化。\n\n三、核心矛盾识别\n\n核心矛盾:职能型组织架构与端到端价值交付需求之间的结构性冲突。各部门的KPI与全局目标未对齐,局部最优导致全局次优。\n\n四、短期落地措施(1-3个月内可执行)\n\n1. 建立跨部门协作SLA(服务等级协议),明确各部门的响应时效和交付标准,纳入月度考核。\n2. 设立跨部门流程owner岗位,每个核心业务流程指定一名负责人,拥有跨部门协调权限。\n\n五、长期优化方案(6-12个月规划)\n\n推进组织架构从纯职能制向矩阵制过渡,在保留职能部门专业深度的同时,按产品线/客户群设立横向协调单元,并以数字化协同平台(如飞书/Lark多维表格+自动化流程)固化端到端流程。\n\n六、风险预警\n\n推行跨部门协作可能触发中层管理者的领地意识,导致消极抵抗。应对方案:先试点一个协同基础较好的业务线,用业绩提升数据说服其他部门。\n\n【总结】六化理论的核心智慧在于:顺序不能乱、基础不能跳、持续迭代不能停。"
}
``


6. 错误对照

| 常见错误 | 正确做法 |
| ------------------- | ------------------------------------------------------------ |
| 缺少 "input" 字段 | 必须写 "input": "",即使为空 |
| output 只有 5 段 | 必须是 7 段(含标题和总结) |
| 6化分析不完整 | 6 个化全部列出,不可跳过 |
| 生命体比喻张冠李戴 | 严格按对应表:合规→免疫、标准→神经、流程→循环、系统→骨骼、数字→感知、智能→大脑 |
| 总结段文字随意改写 | 固定文本不可改 |
| 内容空洞套话 | 每条 output 需包含具体诊断和可执行方案 |


7. 修订记录

| 版本 | 日期 | 说明 |
| ---------------------------- | ---------- | ------------------------------------------------------------ |
| v1.0 | 2026-07-29 | 初版,基于 liuhua_theory 500条数据集制作经验整理,修正原部署文档模板中缺失 input 字段的问题 |
| (仅供参考) | | |

发布日期:2026年7月
版本:v1.0.0
发布方:北京线序科技有限公司(Beijing LineSeq Technology Co., Ltd.)