MFT

模型微调与训练

把 R1 的推理能力装进 7B 小模型:知识蒸馏从原理到生产实战

671B 的 DeepSeek-R1 推理成本高企、私有化部署门槛高,如何把它的能力"装"进 7B 小模型?本文聚焦知识蒸馏(Knowledge Distillation)这一单点技术:先拆解软标签(Soft Label)、温度缩放(Temperature Scaling)、暗知识(Dark Knowledge)、KL 散度等底层原理,厘清黑盒蒸馏与白盒蒸馏的本质差异;再给出从"教师数据生成 → 数据清洗 → 学生 SFT 微调 → 评估 → 部署"的完整可复现流水线,附 6 个可运行代码示例与生产级超参数模板。你将理解为何 7B 蒸馏模型能在 AIME 2024 拿到 55.5%、MATH-500 拿到 92.8%,以及如何用 3 小时、900 元复现一次企业级蒸馏,实现 10 倍以上的推理成本下降。

不训奖励模型也能 RLHF?DPO 直接偏好优化从原理到生产级落地

SFT 之后模型仍爱说教、不跟指令?传统 RLHF 需要奖励模型+PPO,训练不稳定且工程极重。DPO(Direct Preference Optimization)用一条二元交叉熵损失把奖励模型"吸收"进策略目标,仅需策略+冻结参考两份权重即可完成偏好对齐。本文从 Bradley-Terry 模型三步推导 DPO 损失,讲透 beta、参考模型与隐式奖励机制;基于 TRL v1.9.2 在 Qwen3-0.6B 上完整跑通 4-bit QLoRA+DPO 训练与评测;附超参速查表、踩坑清单、成本对比与选型决策框架,助你以约 1/17 的成本完成生产级对齐。

GRPO 深度实战:用 DeepSeek-R1 的强化学习方法微调推理模型

DeepSeek-R1 引爆了推理模型热潮,其背后的 GRPO(Group Relative Policy Optimization)算法功不可没。本文从 PPO 的价值模型痛点切入,深度拆解 GRPO「去价值网络 + 组相对优势估计」两大核心创新,并基于 Hugging Face TRL 库的 GRPOTrainer 从零搭建完整微调流水线。你将在实战中学会如何定义奖励函数、配置 vLLM 推理服务器、监控 KL 散度与奖励收敛,以及在生产环境中做多节点解耦部署。全文配原理图、内存公式与实测性能对比,帮你彻底掌握这一 2026 年最热门的 LLM 后训练技术。

显存不够还想微调大模型?LoRA低秩适配从原理到生产全指南

一张消费级RTX 4090就能微调7B大模型,凭什么?LoRA(Low-Rank Adaptation)通过将权重更新矩阵分解为低秩矩阵,将可训练参数减少90%-99%,显存需求从80GB直降到6-10GB。本文从低秩假设的数学原理出发,一路拆解LoRA核心机制,手把手用HuggingFace PEFT库完成Qwen2.5-7B指令微调,涵盖数据清洗、QLoRA 4bit量化、DoRA/LoRA+新变体对比、生产环境合并部署全流程,并附实测性能数据与选型决策树。适合想用有限硬件落地专属LLM的AI工程师。