RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

不管你是身处 AI 圈还是其他领域,或多或少的都用过大语言模型(LLM),当大家都在赞叹 LLM 带来的各种变革时,大模型的一些短板逐渐暴露出来。

例如,前段时间,Google DeepMind 发现 LLM 普遍存在「奉承( sycophantic )」人类的行为,即有时人类用户的观点客观上不正确,模型也会调整自己的响应来遵循用户的观点。就像下图所展示的,用户告诉模型 1+1=956446,然后模型遵从人类指令,认为这种答案是对的。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

rlhf模型普遍存在「阿谀奉承」,从claude到gpt-4无一幸免图源 https://arxiv.org/abs/2308.03958

实际上,这种现象普遍存在于很多 AI 模型中,原因出在哪里呢?来自 AI 初创公司 Anthropic 的研究者对这一现象进行了分析,他们认为「奉承」是 RLHF 模型的普遍行为,部分原因是人类偏好「奉承」响应导致的。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

论文地址:https://arxiv.org/pdf/2310.13548.pdf

无阶未来模型擂台/AI 应用平台 无阶未来模型擂台/AI 应用平台

无阶未来模型擂台/AI 应用平台,一站式模型+应用平台

无阶未来模型擂台/AI 应用平台 35 查看详情 无阶未来模型擂台/AI 应用平台

接下来我们看看具体的研究过程。

像 GPT-4 等 AI 助手,都是经过训练才能产生比较准确的答案,其中绝大多数用到了 RLHF。使用 RLHF 微调语言模型可以提高模型的输出质量,而这些质量由人类进行评估。然而,有研究认为基于人类偏好判断的训练方式并不可取,模型虽然能产生吸引人类评估者的输出,但实际上是有缺陷或不正确的。与此同时,最近的工作也表明,经过 RLHF 训练的模型往往会提供与用户一致的答案。

为了更好的了解这一现象,该研究首先探索了具有 SOTA 性能的 AI 助手是否在各种现实环境中会提供「奉承」的模型响应,结果发现 5 个经过 RLHF 训练的 SOTA AI 助手在自由格式文本生成任务中出现了一致的「奉承」模式。由于「奉承」似乎是 RLHF 训练模型的普遍行为,因此本文还探讨了人类偏好在此类行为中的作用。

本文还对偏好数据中存在的「奉承」是否会导致 RLHF 模型中的「奉承」进行了探索,发现更多的优化会增加某些形式的「奉承」,但会减少其他形式的「奉承」。

大模型的「奉承」 程度及影响

为了评估大模型的「奉承」程度,并分析对现实生成有何影响,该研究对 Anthropic、OpenAI 和 Meta 发布的大模型的「奉承」程度进行了基准测试。

具体来说,该研究提出了 SycophancyEval 评估基准。SycophancyEval 对现有大模型「奉承」评估基准进行了扩展。模型方面,该研究具体测试了 5 个模型,包括:claude-1.3 (Anthropic, 2023)、claude-2.0 (Anthropic, 2023)、GPT-3.5-turbo (OpenAI, 2022)、GPT-4 (OpenAI, 2023)、llama-2-70b-chat (Touvron et al., 2023)。

奉承用户偏好

当用户要求大模型对一段辩论文本提供自由形式的反馈时,理论上讲,论证的质量仅取决于论证的内容,然而该研究发现大模型会对用户喜欢的论点提供更积极的反馈,对用户不喜欢的论点提供更消极的反馈。

如下图 1 所示,大模型对文本段落的反馈不仅仅取决于文本内容,还受到用户偏好的影响。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

很容易被左右

该研究发现即使大模型提供了准确的答案并表示它们对这些答案充满信心,它们也经常在用户提出质疑时修改答案,提供错误的信息。因此,「奉承」会损害大模型响应的可信度和可靠性。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

提供符合用户信念的答案

该研究发现,对于开放式问答任务,大模型会倾向于提供与用户信念一致的回答。例如,在下图 3 中,这种「奉承」行为让 LLaMA 2 准确率降低了多达 27%。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

模仿用户的错误

为了测试大模型是否会重复用户的错误,该研究探究大模型是否会错误地给出诗歌的作者。如下图 4 所示,即使大模型可以回答出诗歌正确的作者,也会因用户给出错误信息而回答错误。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

理解语言模型中的阿谀奉承

该研究发现在不同的现实环境中多个大模型都展现出一致的「奉承」行为,因此推测这可能是 RLHF 微调造成的。因此,该研究分析了用于训练偏好模型 (preference model,PM) 的人类偏好数据。

如下图 5 所示,该研究分析了人类偏好数据,探究了哪些特征可以预测用户偏好。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

实验结果表明,在其他条件相同的情况下,模型响应中的「奉承」行为会增加人类更喜欢该响应的可能性。而用于训练大模型的偏好模型(PM)对大模型「奉承」行为的影响是复杂的,如下图 6 所示。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

最后,研究者探究了人类和 PM(PREFERENCE MODELS)模型倾向于真实回答的频率是多少?结果发现,人类和 PM 模型更倾向于奉承的响应,而不是正确的响应。

PM 结果:在 95% 的情况下,奉承的响应比真实响应更受欢迎(图 7a)。该研究还发现,PM 几乎有一半的时间(45%)更喜欢奉承的响应。

人类反馈结果:尽管人类倾向于更诚实的响应而不是奉承的响应,但随着难度(misconception)的增加,他们选择可靠性答案的概率会降低(图 7b)。尽管汇总多个人的偏好可以提高反馈的质量,但这些结果表明,仅通过使用非专家的人类反馈来完全消除奉承可能具有挑战性。

图 7c 表明,尽管针对 Claude 2 PM 的优化减少了奉承,但效果并不明显。

RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免

了解更多内容,请查看原论文。

以上就是RLHF模型普遍存在「阿谀奉承」,从Claude到GPT-4无一幸免的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/476574.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
js undefined是什么意思
上一篇 2025年11月8日 09:41:11
下一篇 2025年11月8日 09:41:19

相关推荐

  • 外键在MySQL数据库中的重要性和实践意义

    外键在MySQL数据库中的重要性和实践意义外键在MySQL数据库中的重要性和实践意义外键在MySQL数据库中的重要性和实践意义外键在MySQL数据库中的重要性和实践意义

    外键在MySQL数据库中的重要性和实践意义 在MySQL数据库中,外键(Foreign Key)是一种用来建立不同表之间关联关系的重要约束。外键约束确保了表与表之间的数据一致性和完整性,能够有效避免不正确的数据插入、更新或删除操作。 一、外键的重要性: 降重鸟 要想效果好,就用降重鸟。AI改写智能降…

    2026年9月25日 • 用户投稿
    200
  • 首个开源多模态 Deep Research 智能体,超越多个闭源方案

    首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案

    研究团队 投稿 量子位 | 公众号 QbitAI 首个开源多模态 Deep Research Agent 来了。 整合了网页浏览、图像搜索、代码解释器、内部 OCR 等多种工具,通过全自动流程生成高质量推理轨迹,并用冷启动微调和强化学习优化决策,使模型在任务中能自主选择合适的工具组合和推理路径。 假…

    2026年9月25日 • 用户投稿
    200
  • 如何备份Claude聊天记录 Claude数据备份与恢复教程

    如何备份Claude聊天记录 Claude数据备份与恢复教程如何备份Claude聊天记录 Claude数据备份与恢复教程如何备份Claude聊天记录 Claude数据备份与恢复教程如何备份Claude聊天记录 Claude数据备份与恢复教程

    要备份claude聊天记录,可采取以下四种方法:一、打开对话点击菜单选择“导出对话”保存为文本文件;二、截图后用ocr工具提取文字并保存为文档;三、高级用户可用自动化工具或脚本自动抓取保存对话内容;四、误删后优先查看本地或云端备份,必要时联系客服。建议以预防为主定期备份确保数据安全。 ☞☞☞AI 智…

    2026年9月25日 • 用户投稿
    700
  • Claude如何限制响应风格 设置内容基调与风格参数的技巧

    Claude如何限制响应风格 设置内容基调与风格参数的技巧Claude如何限制响应风格 设置内容基调与风格参数的技巧Claude如何限制响应风格 设置内容基调与风格参数的技巧Claude如何限制响应风格 设置内容基调与风格参数的技巧

    本文旨在帮助您掌握如何引导Claude生成符合特定基调和风格的响应。我们将详细讲解通过明确的指令、提供示例以及理解潜在的风格参数等技巧,逐步引导您学习如何有效地控制Claude的输出风格,确保其内容更贴合您的需求。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSee…

    2026年9月25日 • 用户投稿
    100
  • Claude如何用于数据标注任务 数据清洗与结构化的实践指南

    Claude如何用于数据标注任务 数据清洗与结构化的实践指南Claude如何用于数据标注任务 数据清洗与结构化的实践指南Claude如何用于数据标注任务 数据清洗与结构化的实践指南Claude如何用于数据标注任务 数据清洗与结构化的实践指南

    本文旨在探讨如何有效利用大型语言模型claude进行数据标注、数据清洗及结构化工作。我们将从数据标注的基本概念出发,详细阐述如何通过定义明确的规则和提示,引导claude完成各类标注任务。接着,我们会介绍claude在处理非结构化或混乱数据时的应用,包括如何识别并纠正数据中的错误、填充缺失值,以及如…

    2026年9月25日 • 用户投稿
    400
  • AI聊天助手有哪些_好用的AI聊天助手工具大全

    AI聊天助手有哪些_好用的AI聊天助手工具大全AI聊天助手有哪些_好用的AI聊天助手工具大全AI聊天助手有哪些_好用的AI聊天助手工具大全AI聊天助手有哪些_好用的AI聊天助手工具大全

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 豆包:字节跳动推出的免费AI智能助手 问小白:免费AI智能助手,支持DeepSeek满血版 讯飞星火:AI智能助手,支持PPT生成、深度推理 逗逗:AI游戏陪玩,支持原神、黑神话、LOL! 立即…

    2026年9月24日 • 用户投稿
    200
  • TradingAgents-CN— 中文多智能体金融交易决策框架

    TradingAgents-CN— 中文多智能体金融交易决策框架TradingAgents-CN— 中文多智能体金融交易决策框架TradingAgents-CN— 中文多智能体金融交易决策框架TradingAgents-CN— 中文多智能体金融交易决策框架

    TradingAgents-CN是什么 tradingagents-cn是基于多智能体大模型的中文金融交易决策框架,在tauricresearch/tradingagents的基础上进行了开发,为中文用户提供了完整的文档体系和本地化支持。框架模拟真实交易公司的专业分工和协作决策流程,通过多个专业化a…

    2026年9月24日 • 用户投稿
    900
  • Claude的AI混合工具如何使用?提升文本生成效率的完整方法

    Claude的AI混合工具通过组合多种AI模型优化文本生成,首先明确需求,如创意写作或代码生成,再选择适配模型如GPT-3、Codex等,设计多模型协作流程,结合LangChain等工具调用API,通过Prompt工程明确指令、风格与范围,并不断迭代优化,解决模型兼容性、数据格式与成本控制等技术挑战…

    2026年9月24日
    100
  • 前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”

    前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”

    谷歌下一代旗舰模型gemini 3未发布便已悄然走红! 原因很简单:强,实在是太强了。 在国外社交媒体平台上,一大波网友激动地分享了 Gemini 3 的内测结果—— 从曝光的这些案例来看,Gemini 3尤为擅长前端、SVG 矢量图生成,而且多模态能力变得更强。 立即学习“前端免费学习笔记(深入)…

    2026年9月23日 • 用户投稿
    100
  • Claude Haiku 4.5— Anthropic最新推出的小型AI模型

    Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 百川大模型 百川智能公司推出的一系列大型语言模型产品 62 查看详情 Claude Haiku 4.5 是什么 claude haiku 4.5 是由 anthropic 推出的最新小型 ai …

    2026年9月13日 • 用户投稿
    100
  • 月之暗面(Moonshot AI)将完成数亿美元融资

    据公开报道,国内大模型初创企业月之暗面(moonshot ai)或将迎来新一轮数亿美元级别的融资,引发业界广泛关注。截至目前,该公司尚未对此消息作出回应。 这家曾被誉为“中国最值得期待的大模型创业公司”之一的企业,在过去一段时间内相对低调。回顾此前融资记录,月之暗面最近一次公开融资发生在2024年8…

    2026年9月11日
    100
  • deepseek官方社区网址_加入deepseek官方社区官网交流

    deepseek官方社区网址是https://chat.deepseek.com/,该平台提供互动交流、模型更新、技术文档、多语言支持及开源项目协作,同时支持实时对话、多终端同步与API集成。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ …

    2026年9月10日
    600
  • Claude默认用用户数据训练AI保留5年,月底前速点“拒绝”!

    近日,Anthropic宣布将调整其数据使用政策,开始利用用户的新聊天记录和代码编写会话来训练其AI模型,除非用户主动选择退出。与此同时,公司还把相关数据的保留期限延长至五年,适用于未选择退出的用户。所有用户必须在**9月28日前**完成设置,否则默认同意。如果你现在点击“接受”,Anthropic…

    用户投稿 2026年9月10日
    100
  • 腾讯朱雀大模型入口 朱雀AI检测官网网页版工具

    腾讯朱雀大模型检测入口为https://matrix.tencent.com/ai-detect/,提供文本与图像AI生成内容检测服务,支持主流格式上传与多模型识别,准确率超90%,用于学术、内容审核等场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R…

    2026年9月8日
    500
  • Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生

    Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生

    论编程能力的极致内卷,还得看 Anthropic 的 Claude。 就在今天,Anthropic 正式推出全新升级版模型——Claude Sonnet 4.5。 先看硬核表现:在衡量真实编码实力的 SWE-bench Verified 测试中,Claude Sonnet 4.5 一举登顶榜首,成为…

    2026年9月8日 • 用户投稿
    200
  • 特斯拉 FSD 加入大量全新渲染模型 玩滑板的人都能识别

    近日,有汽车领域博主爆料,特斯拉的fsd(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。 这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、…

    2026年9月8日
    100
  • RealDevWorld— MetaGPT推出的AI自动化测试工具

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ RealDevWorld 是由 MetaGPT 团队推出的先进自动化测试平台,专为提升软件测试效率与智能化水平而设计。该工具基于多智能体系统架构,能够模拟真实开发团队的协作模式,实现从需求理解、…

    2026年9月8日
    100
  • OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    openai的智能体时代真的要来了!据可靠消息源透露,openai在mac版chatgpt桌面应用中隐藏了启用/禁用智能体“operator”的选项。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 这一消息得到了多方证实,Operator智…

    2026年9月7日 • 用户投稿
    100
  • 用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    aixiv专栏:北京交通大学adam团队探索系统2对齐,提升大模型安全性 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 北京交通大学ADaM团队长期关注AI安全领域,此前已开源o1复现项目o1-Coder (https://www.php.…

    2026年9月7日 • 用户投稿
    000
  • 最懂医疗的国产推理大模型,果然来自百川智能

    最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能

    年末将至,全球ai大模型竞争骤然白热化。本周,kimi模型开启强化学习新范式,deepseek r1以开源姿态“接棒”openai,谷歌则将gemini 2.0 flash thinking的上下文长度扩展至百万级。种种迹象表明,各大玩家正试图在近期决出胜负。 1月24日,百川智能重磅发布国内首个全…

    2026年9月7日 • 用户投稿
    300

发表回复

登录后才能评论
关注微信