星火工作室 Logo
由星火工作室 (Spark Studio) 从零开发并训练

SparkDeep-v1-lite 是 Spark 模型系列的首个基座模型。它不基于任何已有开源模型微调,从模型架构、分词器到权重全部从零实现与训练。

该模型专注于中文情感对话场景,旨在感知用户情绪变化,给出温暖、贴心、有同理心的回应。作为轻量级模型,它可在普通 CPU 上完成流畅推理,真正让 AI 触手可及。


📊 模型信息

项目参数详情
参数量200,052,608 (约 0.2B)
架构GPT 风格 Decoder-Only Transformer
词表大小8,192 (Byte-Level BPE,含 5 个特殊 token)
隐藏层维度896 (14 注意力头 × 64 头维度)
层数20 Layers
FFN 维度3,584
位置编码RoPE (theta=10,000)
最大序列长度512 tokens
激活函数GELU (tanh 近似)

训练细节

我们坚持极简、高效、透明的训练哲学:

  • 优化器:Lion Optimizer

    • 初始学习率:1e-4
    • 调度策略:余弦退火 (Cosine Schedule) + 40 步 Warmup
    • 权重衰减:0.1
  • 批量设置:batch_size=8,序列长度 256
  • 训练数据:

    1. SoulChatCorpus:中文情感/心理对话语料(约 25.8 万条多轮对话)
    2. 身份认知注入:84 条身份问答对 × 8 次重复强化
    3. 合计 Token 数:约 1.22 亿
  • 训练成果:

    • 最佳验证 Loss:1.5762
    • 困惑度 (PPL):≈ 4.84
    • 注:模型仍在持续迭代改进中

能力边界

✅ 擅长

  • 中文情感对话:具备优秀的倾听、共情与安慰能力,能敏锐捕捉用户情绪。
  • 明确的身份认知:清晰知道自己是“由星火工作室从零训练的 Spark 系列首个基座模型”,不易产生身份幻觉。
  • 流畅的短句生成:在日常闲聊和情感交互中表现自然。

⚠️ 局限

  • 规模限制:作为 0.2B 小模型,不具备复杂逻辑推理、代码编写或长文写作能力。
  • 知识储备有限:由于训练数据聚焦于情感对话,可能在事实性问答中出现错误。
  • 非专业建议:生成内容仅供情感陪伴参考,不应作为专业心理咨询或医疗建议。

快速开始

1. 环境准备

确保已安装 torch 和 tokenizers。

2. 代码示例

from tokenizers import Tokenizer
import torch

# 加载分词器
tokenizer = Tokenizer.from_file("path/to/tokenizer.json")

# 权重加载方式请参考项目开源代码仓库中的 generate.py
# model = load_model("path/to/sparkdeep-v1-lite.pt")

# 推理参数建议
generation_config = {
    "temperature": 0.8,
    "top_k": 50,
    "top_p": 0.95,
    "max_new_tokens": 120
}
💡 提示:完整的推理脚本、量化指南及微调示例请查阅 GitHub 仓库中的 generate.py 和 README.md。

📜 开源协议

Apache License 2.0

我们承诺完全开放:

  • ✅ 模型权重
  • ✅ 训练代码
  • ✅ 数据处理脚本

欢迎社区自由使用、修改及分发,共同探索轻量级 AI 的可能性。


🙏 致谢

  • 感谢 SoulChatCorpus 数据集作者提供的优质中文情感对话语料,为模型注入了温暖的灵魂。
  • 感谢所有在预览版阶段提供反馈的社区开发者。

星火工作室 · Spark Studio · Boli AI
📧 deepxing@hotmail.com
🔗 ModelScope: SparkDeep-v1-lite | GitHub Repository
AI 拥抱世界,世界信任 AI

标签: none

添加新评论