首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化的一次完整训练流程包含哪些步骤?

直接偏好优化的一次完整训练流程包含哪些步骤?

词条归属:直接偏好优化

1. 环境与超参配置

  • 指定策略模型、偏好数据集及 DPO 关键超参:β(KL 惩罚强度,TRL 默认 0.1)、学习率(通常远低于 SFT,全量微调约 5e-7、LoRA 约 5e-6)、训练轮次与批次大小

2. 加载策略与参考模型

  • 载入 SFT 后的策略模型作为待优化对象;参考模型加载同一 SFT 模型并冻结
  • 使用 LoRA 时可将 ref_model 设为 None,由基础模型隐式充当参考

3. 加载偏好数据

  • 载入 prompt / chosen / rejected 三元组,训练器内部完成配对批处理与分词
  • 通过 max_length 控制 prompt 与响应的拼接最大长度,通过截断模式决定保留首尾

4. 训练与损失计算

  • 每个批次对策略模型与参考模型做前向计算,得到 chosen 与 rejected 的对数概率
  • 按 DPO 损失计算梯度并更新策略参数;参考模型全程冻结不参与更新

5. 评测与保存

  • 在留存偏好集上评估奖励边界(reward margin)与偏好准确率(reward accuracy),确认对齐提升后保存模型或适配器
  • 对齐后的模型可直接用于推理,或作为后续训练阶段的输入
相关文章
零门槛复现ChatGPT:预训练模型数据集直接用,包含完整RLHF流程,在线可体验
明敏 发自 凹非寺 量子位 | 公众号 QbitAI 这边ChatGPT、GPT-4等AI大模型和应用打得火热; 另一边“平替”开源复现方案也加紧更新迭代。 这不,“首个开源ChatGPT低成本复现流程”就来了波大更新! 现在,仅需不到百亿参数,利用RLHF简单微调,模型即可掌握中、英双语能力,达到与ChatGPT和GPT-3.5相当的效果。 中文对话效果如下: 这就是ColossalChat。 由Colossal-AI推出。一个月前,Colossal-AI乘着ChatGPT热潮火速开源了低成本复现流程。
量子位
2023-04-06
1.3K0
AI Agent Skill 科普
这些"不可控"的行为,让很多人对 AI 不能完全放手去用,今天,我就来详细聊聊AI Agent Skill 这个让AI变"听话"的工具。
用户1278550
2026-03-10
1.6K0
大模型对齐核心技术拆解:详解RLHF强化学习、PPO优化、DPO偏好对齐的差异与实践22.3
在日常使用大模型的过程中,很多人都会遇到一类典型问题:模型本身储备的知识足够全面,但输出的回答往往生硬冗长、重点模糊,甚至频繁出现内容幻觉、答非所问等问题,无法贴合人类的对话逻辑与使用习惯。这类问题并非源于预训练阶段的知识训练不足,核心原因是模型未完成人类偏好对齐优化。
未闻花名
2026-09-12
2131
用户意图对齐,无需人工标注,Zephyr-7B 超越 Llama2-Chat-70B
该研究目标是创建一个与用户意图更符合的小型语言模型。通过应用蒸馏监督微调(distilled supervised fine-tuning, dSFT)和蒸馏直接偏好优化(distilled direct preference optimization, dDPO)以及利用AI反馈(AI Feedback, AIF)的偏好数据,研究者成功提升了模型的任务准确性和意图对齐度。ZEPHYR-7B模型以7B参数在聊天基准测试中创立了新标准,无需人工注释,且在MT-Bench测试中超过了之前的模型。此方法的优势包括较短的训练时间和无需额外采样,为开放大型语言模型(LLMs)的发展和微调提供了新方向。同时,研究未考虑模型安全性如可能产生有害输出等问题。
唐国梁Tommy
2023-11-02
1.3K0
大模型的能力究竟从何而来?训练、推理、Reasoning、Tools、Agent:一篇文章理清大模型全链路
OpenAI 的 GPT 系列、Anthropic 的 Claude、Google 的 Gemini,国内的 DeepSeek、Qwen,以及 xAI 的 Grok,都在不断推出新模型。竞争重点也从最早的语言和知识能力,快速扩展到 Reasoning、代码、长上下文、工具调用和 Agent。
数据呼吸Lex
2026-08-20
2900
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券