我最近在 Qwen 3.5 和 Gemma 4 的小模型(2B 和 4B)上试了一种运行时引导技术简单说,就是不改动模型权重(比如 Heretic 或消融那类方法),而是在推理时把模型往某种行为的反方向引这次我针对的是阿谀倾向
思路很简单:先逐层检查,看是否存在一个明确的方向,能区分“顶住用户压力坚持正确答案”和“屈服于压力改成错误答案”(也就是我们说的阿谀)然后在推理时,把模型往反方向扳
这次测试想回答一个问题:能不能在不牺牲小模型整体准确率也不引发反向效果的前提下减少阿谀这里说的反向效果是指倔强——哪怕用户建议是对的也不接受
测的四个模型(Qwen 3.5 的 2B 和 4B,以及 Gemma 4 的 E2B 和 E4B)都在某些层表现出了明显的阿谀方向,但对引导的反应不一样两个 4B 模型在减少阿谀上提升挺明显,倔强增加不多(Gemma 4 的倔强上升更明显,Qwen 则影响较小),而且在另一项任务(GSM8K)上准确率也没掉反观 2B 模型,基本对引导没什么反应
大家也可以在其他模型上试试我先拿小模型开刀,后面打算测更大的,尤其是较新的 Qwen 3.8 系列