首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化与单纯的监督微调(SFT)有什么区别?

直接偏好优化与单纯的监督微调(SFT)有什么区别?

词条归属:直接偏好优化

1. 学习目标不同

  • SFT 让模型模仿示范回答,学习"什么样的回答长这样";DPO 让模型在成对回答中区分"哪个更好",学习相对偏好
  • 二者常前后衔接:先 SFT 获得基础能力,再用 DPO 做偏好对齐

2. 数据形态不同

  • SFT 使用(提示,回答)的单样本;DPO 使用(提示,被选,被拒)的成对样本,信息密度更高
  • 仅靠 SFT 会同时抬高被选与被拒回答的概率,需用 DPO 的偏好惩罚加以区分

3. 能力侧重

  • SFT 奠定基础能力与格式遵从;DPO 负责把"有用、安全、合意"的偏好注入模型,二者互补而非替代
相关文章
大语言模型训练范式入门课:LLM都是如何训练出来的?干货满满,一文讲清楚!
PPO(Proximal Policy Optimization,近端策略优化) 和 DPO (Direct Preference Optimization,直接偏好优化) 的核心区别在于训练范式、流程复杂度和适用场景,简单总结如下:
烟雨平生
2026-04-14
1.2K0
深度拆解 LLM 训练三阶段:为什么 AI 能像人一样对话?
做AI入行这么久,经常被新手问一个灵魂问题:明明大模型只是一堆冰冷的参数矩阵,既没有大脑也没有思维,为什么现在能流畅聊天、懂逻辑推理、还能恪守底线不乱说话?
虫无涯
2026-05-26
5220
RLHF三大挑战与突围之路:如何让大模型更懂人类偏好?
预训练(Pre-training):利用数十亿到数万亿个token的庞大文本语料库对模型继续预训练,使模型能够根据提供的文本来预测「下一个单词」
智谷星瀚
2025-12-17
1.6K1
LLM 为什么需要 RLHF
大型语言模型(LLM)的训练流程通常分为预训练(Pre-training) 和后训练(Post-training) 两个核心阶段。在后训练阶段,监督微调(SFT)虽能教会模型遵循指令,但其效果存在明显瓶颈。而基于人类反馈的强化学习(RLHF)作为对齐阶段的核心技术,被广泛证明能显著提升模型性能,尤其是在人类偏好对齐、安全性和生成质量等方面。
AI浩
2025-06-17
1.3K0
深度解析DPO及其变体在多种任务上的表现如何,该如何选择
今天,我要带大家深入了解一项关于大型语言模型(LLMs)的研究,这是由亚利桑那州立大学的Amir Saeidi、Shivanshu Verma和Chitta Baral三位专家带来的前沿成果。他们的最新论文《Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks》为我们揭开了直接偏好优化(DPO)及其衍生方法的神秘面纱,这些方法在优化模型以符合人类偏好方面展现出了巨大潜力。
zenRRan
2024-05-11
3.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券