SparkDeep-v1-lite发布
由星火工作室 (Spark Studio) 从零开发并训练
SparkDeep-v1-lite 是 Spark 模型系列的首个基座模型。它不基于任何已有开源模型微调,从模型架构、分词器到权重全部从零实现与训练。
该模型专注于中文情感对话场景,旨在感知用户情绪变化,给出温暖、贴心、有同理心的回应。作为轻量级模型,它可在普通 CPU 上完成流畅推理,真正让 AI 触手可及。
📊 模型信息
| 项目 | 参数详情 |
|---|---|
| 参数量 | 200,052,608 (约 0.2B) |
| 架构 | GPT 风格 Decoder-Only Transformer |
| 词表大小 | 8,192 (Byte-Level BPE,含 5 个特殊 token) |
| 隐藏层维度 | 896 (14 注意力头 × 64 头维度) |
| 层数 | 20 Layers |
| FFN 维度 | 3,584 |
| 位置编码 | RoPE (theta=10,000) |
| 最大序列长度 | 512 tokens |
| 激活函数 | GELU (tanh 近似) |
训练细节
我们坚持极简、高效、透明的训练哲学:
优化器:Lion Optimizer
- 初始学习率:
1e-4 - 调度策略:余弦退火 (Cosine Schedule) + 40 步 Warmup
- 权重衰减:
0.1
- 初始学习率:
- 批量设置:
batch_size=8,序列长度256 训练数据:
- SoulChatCorpus:中文情感/心理对话语料(约 25.8 万条多轮对话)
- 身份认知注入:84 条身份问答对 × 8 次重复强化
- 合计 Token 数:约 1.22 亿
训练成果:
- 最佳验证 Loss:1.5762
- 困惑度 (PPL):≈ 4.84
- 注:模型仍在持续迭代改进中
能力边界
✅ 擅长
- 中文情感对话:具备优秀的倾听、共情与安慰能力,能敏锐捕捉用户情绪。
- 明确的身份认知:清晰知道自己是“由星火工作室从零训练的 Spark 系列首个基座模型”,不易产生身份幻觉。
- 流畅的短句生成:在日常闲聊和情感交互中表现自然。
⚠️ 局限
- 规模限制:作为 0.2B 小模型,不具备复杂逻辑推理、代码编写或长文写作能力。
- 知识储备有限:由于训练数据聚焦于情感对话,可能在事实性问答中出现错误。
- 非专业建议:生成内容仅供情感陪伴参考,不应作为专业心理咨询或医疗建议。
快速开始
1. 环境准备
确保已安装 torch 和 tokenizers。
2. 代码示例
from tokenizers import Tokenizer
import torch
# 加载分词器
tokenizer = Tokenizer.from_file("path/to/tokenizer.json")
# 权重加载方式请参考项目开源代码仓库中的 generate.py
# model = load_model("path/to/sparkdeep-v1-lite.pt")
# 推理参数建议
generation_config = {
"temperature": 0.8,
"top_k": 50,
"top_p": 0.95,
"max_new_tokens": 120
}💡 提示:完整的推理脚本、量化指南及微调示例请查阅 GitHub 仓库中的generate.py和README.md。
📜 开源协议
Apache License 2.0
我们承诺完全开放:
- ✅ 模型权重
- ✅ 训练代码
- ✅ 数据处理脚本
欢迎社区自由使用、修改及分发,共同探索轻量级 AI 的可能性。
🙏 致谢
- 感谢 SoulChatCorpus 数据集作者提供的优质中文情感对话语料,为模型注入了温暖的灵魂。
- 感谢所有在预览版阶段提供反馈的社区开发者。
星火工作室 · Spark Studio · Boli AI
📧 deepxing@hotmail.com
🔗 ModelScope: SparkDeep-v1-lite | GitHub Repository
AI 拥抱世界,世界信任 AI
📧 deepxing@hotmail.com
🔗 ModelScope: SparkDeep-v1-lite | GitHub Repository
AI 拥抱世界,世界信任 AI