AI 实践
Unsloth 高效微调实战:用 Qwen3.5-2B 跑通 Alpaca 微调(有监督微调)
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
标签 / TAG
系统学习某一技术主题后的提炼与笔记。
共 9 篇文章
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
PriorRG 利用患者特定先验知识生成胸部 X 光报告,通过两阶段训练(先验引导对比预训练 + 粗到细解码)提升临床准确性与流畅度,在 MIMIC-CXR 上显著优于现有方法。
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。
提出基于 Transformer 的统一多模态表征学习模型,将影像与文本融入同一架构,在肺病识别与预后预测上分别比单模态和分离式方法高出 12% 和 9%。
MMedAgent 是首个面向医疗领域的多模态 Agent,通过指令微调自主选择六大工具解决七类任务,性能优于 GPT-4o 且更新成本极低。