AI 实践
Unsloth 高效微调实战:用 Qwen3.5-2B 跑通 Alpaca 微调(有监督微调)
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
标签 / TAG
大语言模型的架构、训练与推理实践。
共 3 篇文章
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。