MiniMind 768 Full SFT and Pet-domain LoRA

这是一次 MiniMind 学习实践的个人训练产物,包含一个约 64M 参数的 Dense MiniMind SFT checkpoint,以及在该 checkpoint 上训练的宠物问答 LoRA 增量权重。

文件

文件 说明 SHA-256
full_sft_768.pth 完整 SFT 权重,约 137.7 MB b7739a8b533c6ac1648ba0cc69016d42a1a51770aa32870036778bcaa37f81a0
lora_pet_large_768.pth 宠物问答 LoRA 权重,约 797.7 KB 7090a947899eda466997e3af65622433a17117020dfb9558c609b592e3bb8732
tokenizer.json MiniMind tokenizer -
tokenizer_config.json Tokenizer 配置 -

训练环境

  • GPU: NVIDIA A100-SXM4-80GB x 1
  • CUDA: 12.8
  • Python: 3.12
  • PyTorch: 2.x
  • dtype: bfloat16 mixed precision
  • max sequence length: 512

模型配置

  • Architecture: decoder-only Transformer
  • hidden_size: 768
  • num_hidden_layers: 8
  • num_attention_heads: 8
  • num_key_value_heads: 4
  • vocab_size: 6400
  • Parameters: about 63.9M

SFT checkpoint

full_sft_768.pth 基于个人训练的 Pre-training checkpoint,使用对话数据 完成一轮 SFT。训练时只在 assistant 回复区域计算监督损失。

  • Steps: 14152
  • Batch size: 64
  • Max sequence length: 512
  • Initial learning rate: 1e-5
  • Final logged loss: 1.8913

完整日志见 sft-log.txt

Pet-domain LoRA

lora_pet_large_768.pth 基于 full_sft_768.pth,使用 中文农林牧渔问答数据集 筛选和去重得到的 16,688 条宠物相关问答进行训练。

  • Trainable parameters: about 0.393M
  • Epochs: 5
  • Total steps: 2610
  • Batch size: 32
  • Max sequence length: 340
  • Learning rate: 1e-4
  • Final logged loss: about 2.4389

使用方式

权重为 MiniMind 原生 PyTorch checkpoint。请先克隆代码仓库:

https://github.com/biscuit0613/minimind

然后将文件放入该仓库的 out/ 目录,并按照仓库中的推理脚本加载:

python eval_llm.py --weight full_sft
python eval_llm.py --weight full_sft --lora_weight lora_pet_large

结果与局限

LoRA 微调后,模型在部分宠物关键词上更敏感,平均输出也明显变短;但样例中 出现了幻觉、重复和通用能力退化。这说明训练 loss 下降不能直接等同于回答 质量提升。详细前后对比见 LoRA 实践笔记

当前结果没有经过独立测试集、多随机种子或系统化 benchmark 评估,不适合 生产使用,也不应视为优于基座模型的证据。本仓库目前只公开 SFT 和 LoRA 权重,不包含 Pre-training 或 DPO checkpoint。

相关材料

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support