Unsloth 高效微调实战:用 Qwen3.5-2B 跑通 Alpaca 微调(有监督微调)
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
文章 / Articles
按发布时间浏览关于 AI、产品与独立创作的实践文章。当前共 13 篇。
显示全部文章
筛选暂时不可用,已显示全部文章。
你可以清除当前条件,或返回全部文章。
清除筛选用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
PriorRG 利用患者特定先验知识生成胸部 X 光报告,通过两阶段训练(先验引导对比预训练 + 粗到细解码)提升临床准确性与流畅度,在 MIMIC-CXR 上显著优于现有方法。
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。
提出基于 Transformer 的统一多模态表征学习模型,将影像与文本融入同一架构,在肺病识别与预后预测上分别比单模态和分离式方法高出 12% 和 9%。
MedSAM-2 沿用 SAM 2 的视频处理哲学,将 2D 切片视作视频帧,实现三维体积的单提示分割与跨时间泛化,在多模态医学影像上优于现有方法。
MMedAgent 是首个面向医疗领域的多模态 Agent,通过指令微调自主选择六大工具解决七类任务,性能优于 GPT-4o 且更新成本极低。