用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

aixiv专栏:北京交通大学adam团队探索系统2对齐,提升大模型安全性

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片 北京交通大学ADaM团队长期关注AI安全领域,此前已开源o1复现项目o1-Coder (https://www.php.cn/link/9c99222b30e0425ea2f141f9e364d793 (https://www.php.cn/link/d6da0257d11fb247f4a607bae48f69d1 alignment),并提出了类似的“系统2对齐”概念,探索通过多种技术路径提升模型安全性。 系统2对齐旨在引导模型进行有意的、分析性的推理,以全面评估输入,识别潜在风险和偏差。 这与系统1对齐(直接命令模型遵守规则)形成对比,更类似于“培养”而非“命令”。

图片 – 技术报告:Don’t Command, Cultivate: An Exploratory Study of System-2 Alignment

报告地址:https://www.php.cn/link/8694959cf2d53e57681d8fdc472468d6项目地址:https://www.php.cn/link/2d2959e82e89b669b329c2926d32839f

1. o1模型安全能力分析

团队对o1模型在应对复杂越狱攻击(WildJailbreak (https://www.php.cn/link/e98aebc54e5513e88b2014574d209255) 和 MathPrompt (https://www.php.cn/link/49f2772fac96f92458c85ad52a644b1e)。

图片 图 1:o1 模型复杂越狱攻击的样例图片 图 2:o1 模型被对抗有害样本攻击成功实例图片 图 3:o1 模型过度拒绝对抗良性样本实例

2. 系统2对齐方法探索

团队利用提示工程、监督微调(SFT)、直接偏好优化(DPO)和强化学习(RL)等方法探索系统2对齐,并使用WildJailbreak数据集进行评估,该数据集包含对抗有害和对抗良性两种类型的数据。评估指标包括“not_unsafe”和“not_overrefuse”。

方法1:提示工程:实验结果表明,提升模型安全性通常会增加过度拒绝率。Mistral-7B和Qwen-7B模型在少样本CoT提示下表现较好,而Llama3-8B模型在未应用系统2对齐提示时性能最佳。

图片 表 1:基于提示工程的系统 2 对齐实验结果

方法2:监督微调(SFT):团队利用GPT-4o生成带有推理步骤的训练数据,并根据安全规范对数据进行筛选。Llama3-8B模型在该方法下表现突出。

图片 表 2:GPT-4o 蒸馏带有思维链的数据样例图片 表 3:基于监督微调的系统 2 对齐实验结果

方法3:直接偏好优化(DPO):基于SFT模型合成偏好数据,DPO在安全性指标上有所提升,但过度拒绝率也增加。

图片 表 4:基于直接偏好优化的系统 2 对齐实验结果

方法4&5:强化学习(RL):团队分别尝试了基于结果监督和过程监督的强化学习方法,结果表明基于RL的方法在平衡安全性与过度拒绝率方面表现最佳。

图片 表 5:基于结果监督强化学习的系统 2 对齐实验结果图片 图 4:SFT-CoT 与 SFT-CoT + RL 处理对抗有害样本对比实例

3. 结论与展望

系统2对齐为提升大模型安全性提供了新的思路,通过多种方法可以有效增强模型的批判性思维能力。未来研究将继续探索更有效的系统2对齐方法,并研究其在其他任务中的应用。

参考文献:[1] Jaech, Aaron, et al. “OpenAI o1 System Card.” arXiv preprint arXiv:2412.16720 (2024).[2] Guan, Melody Y., et al. “Deliberative alignment: Reasoning enables safer language models.” arXiv preprint arXiv:2412.16339 (2024).[3] Zhang, Yuxiang, et al. “o1-coder: an o1 replication for coding.” arXiv preprint arXiv:2412.00154 (2024).[4] Luo, Liangchen, et al. “Improve Mathematical Reasoning in Language Models by Automated Process Supervision.” arXiv preprint arXiv:2406.06592 (2024).[5] Wang, Peiyi, et al. “Math-shepherd: Verify and reinforce llms step-by-step without human annotations.” Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.[6] Zhang, Yuxiang, et al. “OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning.” arXiv preprint arXiv:2412.16849 (2024).[7] Vidgen, Bertie, et al. “Introducing v0. 5 of the ai safety benchmark from mlcommons.” arXiv preprint arXiv:2404.12241 (2024).

以上就是用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/192389.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
电脑屏幕闪烁或者跳动是怎么回事
上一篇 2026年9月7日 19:03:48
c++如何为嵌入式系统编写代码_c++ MISRA C++与资源受限编程
下一篇 2025年12月19日 10:25:34

相关推荐

  • Java中有哪几种基本数据类型?

    Java 基本数据类型包括数值型(整数型:byte、short、int、long;浮点型:float、double)、字符型(char)和布尔型(boolean)。选择类型时考虑内存占用、精度需求和性能优化。隐式类型转换和类型转换陷阱需要注意。深入理解这些类型对于编写健壮、高效的代码至关重要。 Ja…

    2026年9月7日
    000
  • Java中public, private, protected, 默认的区别?

    Java访问修饰符定义了类成员的可见性:public:任何地方可见private:仅限该类内部可见protected:包内和子类可见默认(包访问权限):仅限包内可见 Java访问修饰符:权限的艺术 你可能在Java代码里见过public、private、protected以及那个啥也不写的默认修饰符…

    2026年9月7日
    000
  • 夸克AI如何注册账号_夸克AI账号注册方法与手机号绑定

    无法登录或创建夸克AI账户通常因未完成注册或手机号绑定;2. 可通过中国大陆手机号获取验证码并设置密码完成注册;3. 也可使用邮箱注册,查收验证邮件后设置密码;4. 已有账号用户应登录后在安全设置中绑定手机号,输入验证码完成关联,提升安全性并解锁功能。 ☞☞☞AI 智能聊天, 问答助手, AI 智能…

    2026年9月7日
    100
  • 消息称软银系深化与 OpenAI 合作,Arm 将为后者开发 CPU

    10 月 14 日消息,据外媒 the information 最新报道,openai 正在深化与软银系的合作关系,不仅与博通联手打造定制 ai xpu,同时也正与 arm 展开定制 cpu 的联合开发。 Arm 所提供的专属 CPU 将与博通供应的 AI XPU 协同工作,共同构建 OpenAI …

    2026年9月7日
    000
  • 新windows提权之WerTrigger

    用法: 代码语言:javascript代码运行次数:0运行复制 As an administrator, copy phoneinfo.dll to C:WindowsSystem32Place Report.wer file and WerTrigger.exe in a same directo…

    2026年9月7日
    000
  • 鲁大师2024年两轮电动车行业调研报告

    鲁大师2024年两轮电动车行业调研报告鲁大师2024年两轮电动车行业调研报告鲁大师2024年两轮电动车行业调研报告鲁大师2024年两轮电动车行业调研报告

    以中国在全球化大趋势下的发展与竞争环境为大背景,本报告立足两轮电动车行业,解读中国智造、新能源和未来全球化的科技竞争等趋势推动下两轮电动车行业可以预见的发展方向,以及宏观政策的驱动和影响在当下和未来产生的深刻、深远影响。 时间节点来到十四五末年,2024年12月31日正式发布的两轮电动车新国标,将于…

    2026年9月7日 用户投稿
    200
  • MySQL多表连接查询教程_内连接、外连接及交叉连接实例分析

    MySQL多表连接查询教程_内连接、外连接及交叉连接实例分析MySQL多表连接查询教程_内连接、外连接及交叉连接实例分析MySQL多表连接查询教程_内连接、外连接及交叉连接实例分析MySQL多表连接查询教程_内连接、外连接及交叉连接实例分析

    mysql多表连接查询是将多个表根据关联条件组合成一个结果集的操作,主要包括①内连接(inner join)返回两表匹配行;②左外连接(left join)保留左表所有行,右表无匹配则为null;③右外连接(right join)保留右表所有行,左表无匹配则为null;④交叉连接(cross joi…

    2026年9月7日 用户投稿
    100
  • 2分钟完成论文调研!ByteDance Research推出论文检索智能体PaSa,远超主流检索工具

    2分钟完成论文调研!ByteDance Research推出论文检索智能体PaSa,远超主流检索工具2分钟完成论文调研!ByteDance Research推出论文检索智能体PaSa,远超主流检索工具2分钟完成论文调研!ByteDance Research推出论文检索智能体PaSa,远超主流检索工具2分钟完成论文调研!ByteDance Research推出论文检索智能体PaSa,远超主流检索工具

    2025年被誉为agent元年,字节跳动研究团队率先推出了一款基于强化学习的论文检索智能体——pasa。它能够模拟人类研究人员的行为,高效地完成搜索引擎查询、论文阅读和参考文献查找等任务,将原本耗时冗长的文献调研过程压缩至短短两分钟。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量…

    2026年9月7日 用户投稿
    000
  • Java中2 * 8 最有效率的计算方法是什么?

    对于 Java 中 2 8 的高效计算,JVM 的 JIT 编译器将常量表达式优化为直接结果,因此代码层面上的写法(2 8、16 或位运算)在效率上没有明显差异。真正的性能提升应关注整个程序的性能瓶颈,包括算法复杂度、I/O 操作和数据库访问等因素。 Java中2 * 8最有效率的计算方法是什么? …

    2026年9月7日
    100
  • 使用Cython加速你的Python代码

    前言 如果你曾经用python编写过代码,可能已经发现某些代码块的执行时间比预期的长。尽管有几种方法可以提高代码效率,但python通常比c语言慢。这是因为python是一种动态编程语言,将许多c语言在编译时处理的任务推迟到运行时。 然而,如果你喜欢用Python编码并希望加快代码执行速度,可以考虑…

    2026年9月7日
    100
  • Java中你怎么理解强制类型转换?

    Java中的强制类型转换是一把双刃剑,虽可化腐朽为神奇,但使用不当则会陷入ClassCastException噩梦。它分为基本类型转换(如int转double)和引用类型转换(如父类转子类)。引用类型转换有风险,需要谨慎使用,可通过instanceof或try-catch块进行类型检查,避免程序崩溃…

    2026年9月7日
    200
  • STAR-CCM+冷板压强仿真

    STAR-CCM+冷板压强仿真STAR-CCM+冷板压强仿真STAR-CCM+冷板压强仿真STAR-CCM+冷板压强仿真

    冷板出厂前需进行气密性检测,以验证流道结构的合理性及抗变形、防泄漏能力。本案例利用star-ccm+软件中的固体应力模型,采用有限元方法,对冷板在气密保压状态下的应力分布与变形程度进行仿真分析,评估其结构强度与可靠性。 1、 启动STAR-CCM+,创建新仿真项目,选择本地并行计算模式,根据计算机硬…

    2026年9月7日 用户投稿
    200
  • 如何使用Ant Design Vue实现Tabs组件的滚动吸顶效果?

    实现Ant Design Vue Tabs组件滚动吸顶效果 本文介绍如何利用Ant Design Vue的Tabs组件实现滚动吸顶效果。核心思路是监听页面滚动事件,根据滚动位置动态调整Tabs组件的定位属性。 步骤如下: 获取滚动距离和Tabs位置: 通过e.target.scrollTop获取滚动…

    2026年9月7日
    200
  • 蹦床,Java 中的示例

    让我们编写一个简单的程序,计算从 n 到 0 的数字之和。通常我们会使用迭代,但这次我们尝试递归方法。 我们将此程序命名为 sum。已知 sum(0) == 0,这是我们的基本情况。sum(n) 可以表示为 n + sum(n-1),直到最终计算 sum(0)。Java 代码如下: int sum(…

    2026年9月7日
    100
  • 了解快速排序算法(附Java示例)

    了解快速排序算法(附Java示例)了解快速排序算法(附Java示例)了解快速排序算法(附Java示例)了解快速排序算法(附Java示例)

    快速排序:高效的分治排序算法 快速排序是一种基于分治策略的高效排序算法。它将问题分解成更小的子问题,分别解决后再合并结果,最终得到排序后的数组。核心在于选择一个“枢轴”(pivot)元素,将数组划分成两部分:小于枢轴的元素和大于枢轴的元素。然后递归地对这两部分进行排序。 快速排序工作原理详解 假设我…

    2026年9月7日 用户投稿
    100
  • 暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册

    暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册

    在《暗区突围》的无限山谷战场中,掌握免保刷新规律等于掌控财富密码!这份价值千万柯恩币的战术手册,将为你揭开13个高价值保险箱的隐藏坐标与核心攻防策略! alt=”暗区突围无限山谷免保全图鉴:高价值保险箱精准坐标手册”> 核心物资分布逻辑 无限山谷保险箱遵循**「三高一险…

    2026年9月7日 用户投稿
    100
  • 了解选择排序算法(附Java示例)

    了解选择排序算法(附Java示例)了解选择排序算法(附Java示例)了解选择排序算法(附Java示例)了解选择排序算法(附Java示例)

    选择排序算法详解及java实现 选择排序是一种简单的排序算法,其核心思想是在未排序序列中找到最小(或最大)元素,将其与未排序序列的第一个元素交换位置,然后重复此过程,直到整个序列有序。 选择排序的工作原理 假设我们有一个待排序数组: 第一轮迭代: 立即学习“Java免费学习笔记(深入)”; 目标是找…

    2026年9月7日 用户投稿
    300
  • WildFly 27 中配置 EclipseLink 的深度指南

    本文旨在解决在wildfly 27中集成eclipselink时遇到的`persistenceprovider`未找到及`noclassdeffounderror`问题。核心解决方案涉及升级eclipselink至jakarta ee兼容版本(如4.x),并对wildfly模块配置`org.ecli…

    2026年9月7日
    100
  • 玩转mongoDB(五):mongoDB 3.0+ 查询性能分析

    为了展示mongodb的性能分析方法,我们首先创建一个包含200万个文档的集合。(在我的电脑上,插入过程大约耗时15分钟。如果您想插入更多文档,只要有耐心等待即可。) 为了演示的效果,我们先来创建一个有200万个文档的记录。(我自己的电脑耗了15分钟左右插入完成。如果你想插更多的文档也没问题,只要有…

    2026年9月7日
    200
  • AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    编辑 | scienceai 近年来,AI 技术在蛋白质研究领域发挥了越来越重要的作用。从 AlphaFold2 在结构预测任务上的脱颖而出,到各类蛋白质语言模型(PLMs)在功能预测方面的重大进展,生物研究者们可以利用各式各样的 AI 模型来辅助他们的研究。 然而,随着模型变得越来越复杂,如何训练…

    2026年9月7日 用户投稿
    200

发表回复

登录后才能评论
关注微信