Instructions to use biscuitzzz/minimind-full-sft-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use biscuitzzz/minimind-full-sft-lora with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
MiniMind 768 Full SFT and Pet-domain LoRA
这是一次 MiniMind 学习实践的个人训练产物,包含一个约 64M 参数的 Dense MiniMind SFT checkpoint,以及在该 checkpoint 上训练的宠物问答 LoRA 增量权重。
文件
| 文件 | 说明 | SHA-256 |
|---|---|---|
full_sft_768.pth |
完整 SFT 权重,约 137.7 MB | b7739a8b533c6ac1648ba0cc69016d42a1a51770aa32870036778bcaa37f81a0 |
lora_pet_large_768.pth |
宠物问答 LoRA 权重,约 797.7 KB | 7090a947899eda466997e3af65622433a17117020dfb9558c609b592e3bb8732 |
tokenizer.json |
MiniMind tokenizer | - |
tokenizer_config.json |
Tokenizer 配置 | - |
训练环境
- GPU: NVIDIA A100-SXM4-80GB x 1
- CUDA: 12.8
- Python: 3.12
- PyTorch: 2.x
- dtype: bfloat16 mixed precision
- max sequence length: 512
模型配置
- Architecture: decoder-only Transformer
hidden_size: 768num_hidden_layers: 8num_attention_heads: 8num_key_value_heads: 4vocab_size: 6400- Parameters: about 63.9M
SFT checkpoint
full_sft_768.pth 基于个人训练的 Pre-training checkpoint,使用对话数据
完成一轮 SFT。训练时只在 assistant 回复区域计算监督损失。
- Steps: 14152
- Batch size: 64
- Max sequence length: 512
- Initial learning rate:
1e-5 - Final logged loss: 1.8913
完整日志见 sft-log.txt。
Pet-domain LoRA
lora_pet_large_768.pth 基于 full_sft_768.pth,使用
中文农林牧渔问答数据集
筛选和去重得到的 16,688 条宠物相关问答进行训练。
- Trainable parameters: about 0.393M
- Epochs: 5
- Total steps: 2610
- Batch size: 32
- Max sequence length: 340
- Learning rate:
1e-4 - Final logged loss: about 2.4389
使用方式
权重为 MiniMind 原生 PyTorch checkpoint。请先克隆代码仓库:
https://github.com/biscuit0613/minimind
然后将文件放入该仓库的 out/ 目录,并按照仓库中的推理脚本加载:
python eval_llm.py --weight full_sft
python eval_llm.py --weight full_sft --lora_weight lora_pet_large
结果与局限
LoRA 微调后,模型在部分宠物关键词上更敏感,平均输出也明显变短;但样例中 出现了幻觉、重复和通用能力退化。这说明训练 loss 下降不能直接等同于回答 质量提升。详细前后对比见 LoRA 实践笔记。
当前结果没有经过独立测试集、多随机种子或系统化 benchmark 评估,不适合 生产使用,也不应视为优于基座模型的证据。本仓库目前只公开 SFT 和 LoRA 权重,不包含 Pre-training 或 DPO checkpoint。
相关材料
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support