Unsloth 高效微调实战:用 Qwen3.5-2B 跑通 Alpaca 微调(有监督微调)
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
分类 / CATEGORY
关注可复现的 AI 工作流、工程落地与项目复盘,含原创技术梳理(如 Transformer 系列学习笔记)与实际项目(如 PET/CT 淋巴瘤分型系统);不收录纯新闻转述。
共 3 篇文章
从这里开始 / Selected
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
梳理 31 篇 Transformer 系列文章的知识地图,提炼从注意力机制、位置编码到 KV Cache 与投机解码的核心脉络。
梳理一套基于 PET/CT 双模态的淋巴瘤 9 分类深度学习系统:双流编码、跨模态注意力融合与 Mamba 时序聚合,落地显存受限的临床场景。