本期重点 / Featured
Unsloth 高效微调实战:用 Qwen3.5-2B 跑通 Alpaca 微调(有监督微调)
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
独立内容主场 / Independent notes
把 AI、产品与创作中的判断,写在实践的页边。
记录从想法、原型到上线之间,那些真正改变结果的判断。
本期重点 / Featured
用 16-bit LoRA + TRL SFTTrainer 在 Qwen3.5-2B 上跑通 Alpaca 指令微调,并在工程上做了可复现、跨平台与量化评估的改进;4090 实测 PPL 从 6.76 降到 3.08(↓54%)。
编辑台近况 / July 2026
整理智医助手、本地知识库和 Transformer 学习笔记,把项目复盘、学术成果与学习轨迹逐步落地到这个站点;近期以 build-in-public 方式复现了 Unsloth 实战——用 Qwen3.5-2B 跑通 Alpaca 有监督微调(16-bit LoRA + TRL SFTTrainer),并做了可复现、跨平台与 PPL 评估的工程化改进。
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。
PriorRG 利用患者特定先验知识生成胸部 X 光报告,通过两阶段训练(先验引导对比预训练 + 粗到细解码)提升临床准确性与流畅度,在 MIMIC-CXR 上显著优于现有方法。
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。
提出基于 Transformer 的统一多模态表征学习模型,将影像与文本融入同一架构,在肺病识别与预后预测上分别比单模态和分离式方法高出 12% 和 9%。
主题边界 / Categories
关注可复现的 AI 工作流、工程落地与项目复盘,含原创技术梳理(如 Transformer 系列学习笔记)与实际项目(如 PET/CT 淋巴瘤分型系统);不收录纯新闻转述。
关注有约束、有证据的产品取舍;不收录缺少实践背景的观点合集。
这个分类的边界已经确定,相关文章仍在编辑中。
关注可持续创作系统与内容基础设施;不收录平台热点搬运。
这个分类的边界已经确定,相关文章仍在编辑中。
基于本地 Obsidian 知识库的真实笔记,含方法、结论与个人落地思考;不收录未读或杜撰的来源。
实践记录 / Field notes
Qwen-AgentWorld 用 CPT+SFT+RL 三阶段训练语言世界模型,模拟七类环境动态,在 Agent 基准上最高提升 12.3%,提出世界建模与代理统一/解耦两条路径。