Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
基于均值优化的数据集子集划分:混合整数规划与启发式方法_创想鸟

基于均值优化的数据集子集划分:混合整数规划与启发式方法

基于均值优化的数据集子集划分:混合整数规划与启发式方法

本文探讨如何将一个超集(数据集)划分为N个指定大小的子集,同时确保每个子集的均值尽可能接近超集的总均值,且元素不重复使用。我们主要介绍如何将此问题建模为混合整数线性规划(MILP),并使用Python的PuLP库进行求解,以实现精确的均值优化。同时,文章也讨论了在面对大规模数据时的性能挑战及潜在的启发式优化策略。

1. 问题描述与挑战

在数据分析、实验设计或样本分配等场景中,我们经常需要将一个包含m个元素的原始数据集(超集)划分为n个互不重叠、且大小预定的子集。一个常见的优化目标是使每个子集的统计特性(例如均值)尽可能地与原始超集的特性保持一致。具体来说,给定一个超集 s 及其包含的 m 个元素,以及 n 个预期的子集大小 x0, x1, …, xn-1(其中 sum(xi) == m),目标是创建这些子集,使得每个子集的均值与超集的均值最为接近。我们通常通过最小化所有子集均值与超集均值之间绝对差异的总和来量化这一目标。

这是一个典型的组合优化问题,其挑战在于:

无放回抽样: 超集中的每个元素只能被分配到一个子集中,且仅使用一次。固定子集大小: 每个子集必须严格满足其预设的元素数量。均值优化: 这是一个全局优化目标,需要权衡不同子集之间的分配,以达到整体最优。计算复杂度: 随着超集元素数量和子集数量的增加,可能的组合呈指数级增长,导致穷举法不可行。在实际应用中,算法需要在合理的时间内(例如1秒内)完成对中等规模数据的处理。

2. 数学建模:混合整数线性规划 (MILP)

这种类型的分配问题可以被归类为“集合划分问题”(Set Partitioning Problem)的一个变种,其中加入了特定的目标函数(均值优化)和额外的约束。混合整数线性规划(MILP)提供了一种强大的框架来精确解决这类问题。

2.1 目标函数

我们的目标是使每个子集的均值 mean(subset_s) 尽可能接近超集的均值 mean(superset)。这等价于使每个子集的总和 sum(subset_s) 尽可能接近 subset_size_s * mean(superset)。因此,我们可以定义目标函数为最小化所有子集总和与目标总和之间绝对差异的总和:

$$ min sum{s=0}^{N-1} | sum{i in text{subset}_s} text{element}_i – (text{size}_s times text{mean}(text{superset})) | $$

2.2 决策变量

我们引入二元决策变量 x_s_i:x_s_i = 1 如果超集中的第 i 个元素被分配到第 s 个子集中。x_s_i = 0 否则。

2.3 约束条件

子集大小约束: 每个子集 s 必须包含预定数量的元素 size_s。$$ sum{i=0}^{M-1} x{s,i} = text{size}_s quad forall s in {0, dots, N-1} $$元素唯一性约束: 超集中的每个元素 i 只能被分配到一个且仅一个子集中。$$ sum{s=0}^{N-1} x{s,i} = 1 quad forall i in {0, dots, M-1} $$绝对值线性化: 在线性规划中,通常通过引入辅助变量和不等式来处理绝对值。对于每个子集 s,我们定义其总和误差 err_s:$$ text{err}s = sum{i=0}^{M-1} (text{element}i times x{s,i}) – (text{size}_s times text{mean}(text{superset})) $$然后引入一个非负辅助变量 abs_err_s 来表示 |err_s|,并添加以下约束:$$ text{abs_err}_s ge text{err}_s $$$$ text{abs_err}_s ge -text{err}_s $$最终,目标函数变为最小化 sum(abs_err_s)。

3. 使用 PuLP 进行求解

PuLP 是一个用 Python 编写的线性规划建模工具,它允许用户以直观的方式定义优化问题,并调用各种求解器(如CBC、GLPK、Gurobi等)来解决。

以下是一个使用 PuLP 解决上述问题的示例代码:

from statistics import meanimport pulpdef solve_subset_partitioning(superset_elements, subset_sizes):    """    使用 PuLP 解决基于均值优化的数据集子集划分问题。    Args:        superset_elements (list): 超集中的所有元素列表。        subset_sizes (list): N个子集各自的目标大小列表。    Returns:        tuple: (list of lists, list of floats) 分割后的子集元素列表和每个子集的均值。    """    N = len(subset_sizes)    M = len(superset_elements)    # 验证输入    if sum(subset_sizes) != M:        raise ValueError("所有子集大小之和必须等于超集元素总数。")    # 计算超集均值    superset_mean = mean(superset_elements)    # 创建 PuLP 问题实例    set_partitioning_model = pulp.LpProblem("Set_Partitioning_Model", pulp.LpMinimize)    # 决策变量:x_s_i = 1 如果超集中的第 i 个元素被分配到第 s 个子集中    # covering[s] 是一个列表,其中包含子集 s 的 M 个二元变量    covering = {}    for s in range(N):        vals = []        for i, v in enumerate(superset_elements):            vals.append(                pulp.LpVariable(                    f"x_set_{s}_element_idx_{i:>02}_val_{v}",                    lowBound=0,  # 0                    upBound=1,   # 1                    cat=pulp.LpBinary, # 二进制变量                )            )        covering[s] = vals    # 辅助变量:用于处理绝对误差    abs_sum_errs = []    for s_i in range(N):        abs_sum_errs.append(pulp.LpVariable(f"set_{s_i}_sum_error_abs", lowBound=0))    # 目标函数:最小化所有子集绝对误差之和    set_partitioning_model += pulp.lpSum(abs_sum_errs), "Minimize_Absolute_Sum_Errors"    # 添加约束    for s_i, st_vars in covering.items():        # 计算每个子集的实际总和        current_set_sum = pulp.lpSum([p * superset_elements[i] for i, p in enumerate(st_vars)])        # 计算每个子集的目标总和 (子集大小 * 超集均值)        target_set_sum = subset_sizes[s_i] * superset_mean        # 定义子集总和误差变量        set_sum_err = pulp.LpVariable(f"set_{s_i}_sum_error")        set_partitioning_model += set_sum_err == current_set_sum - target_set_sum, f"Set_{s_i}_Sum_Error_Definition"        # 绝对值线性化约束        set_partitioning_model += abs_sum_errs[s_i] >= set_sum_err, f"Abs_Error_Upper_Bound_Pos_{s_i}"        set_partitioning_model += abs_sum_errs[s_i] >= -set_sum_err, f"Abs_Error_Upper_Bound_Neg_{s_i}"    # 约束1: 每个子集的大小必须符合预设    for s_i, st_vars in enumerate(covering.values()):        set_partitioning_model += pulp.lpSum(st_vars) == subset_sizes[s_i], f"Set_{s_i}_Size_Constraint"    # 约束2: 超集中的每个元素只能被使用一次    # zip(*covering.values()) 将所有子集的变量列表转置,以便按元素索引迭代    for i, element_vars in enumerate(zip(*covering.values())):        set_partitioning_model += (            pulp.lpSum(element_vars) == 1,            f"Element_{i}_Used_Once_Constraint",        )    # 求解模型    set_partitioning_model.solve(pulp.PULP_CBC_CMD(msg=False)) # 使用默认的CBC求解器,静默模式    # 提取结果    if pulp.LpStatus[set_partitioning_model.status] == "Optimal":        result_subsets = []        result_means = []        for s_i, st_vars in covering.items():            current_subset_elements = [                superset_elements[i] for i, var in enumerate(st_vars) if var.value() == 1            ]            result_subsets.append(current_subset_elements)            result_means.append(mean(current_subset_elements))        return result_subsets, result_means    else:        print(f"未能找到最优解。状态: {pulp.LpStatus[set_partitioning_model.status]}")        return [], []# 示例 1:完美分配print("--- 示例 1:完美分配 ---")superset1 = [100]*5 + [101]*10 + [102]*5subset_sizes1 = [2, 4, 14]subsets1, means1 = solve_subset_partitioning(superset1, subset_sizes1)print(f"超集均值: {mean(superset1)}")for i, (subset, mean_val) in enumerate(zip(subsets1, means1)):    print(f"子集 {chr(65+i)} ({len(subset)} 元素): {subset}, 均值: {mean_val}")# 预期输出:所有子集均值均为 101# 示例 2:最佳拟合print("n--- 示例 2:最佳拟合 ---")superset2 = [100]*5 + [103]*10 + [104]*5subset_sizes2 = [2, 4, 14]subsets2, means2 = solve_subset_partitioning(superset2, subset_sizes2)print(f"超集均值: {mean(superset2)}")for i, (subset, mean_val) in enumerate(zip(subsets2, means2)):    print(f"子集 {chr(65+i)} ({len(subset)} 元素): {subset}, 均值: {mean_val}")# 预期输出:子集均值尽可能接近 102.5

代码解析:

初始化: 定义超集元素、子集大小,并计算超集均值。LpProblem: 创建一个 PuLP 问题实例,目标是最小化 (pulp.LpMinimize)。决策变量 covering: 这是一个字典,键是子集索引 s,值是一个列表,包含了 M 个 pulp.LpBinary 变量。每个变量 x_s_i 代表超集中的第 i 个元素是否属于第 s 个子集。辅助变量 abs_sum_errs: 用于存储每个子集总和与目标总和之间绝对差异的辅助变量,lowBound=0 确保其非负。目标函数: 设置为最小化 abs_sum_errs 中所有元素的和。误差定义与绝对值约束: 遍历每个子集,计算其目标总和 (subset_size * superset_mean)。然后定义 set_sum_err 为实际总和与目标总和之差。最后,通过两个不等式 abs_sum_errs[s_i] >= set_sum_err 和 abs_sum_errs[s_i] >= -set_sum_err 来实现绝对值的线性化。子集大小约束: 确保每个子集中的元素数量(即对应 x_s_i 变量之和)等于其预设的 subset_sizes[s_i]。元素唯一性约束: 确保超集中的每个元素 i(通过 zip(*covering.values()) 遍历)在所有子集中的 x_s_i 变量之和为1,即每个元素仅被分配一次。求解: 调用 set_partitioning_model.solve() 启动求解器。默认情况下,PuLP 会使用其自带的 CBC 求解器。结果提取: 检查求解状态,如果找到最优解,则遍历决策变量,提取每个子集包含的元素,并计算其均值。

4. 启发式算法:Karmarkar-Karp (Largest Differencing Method)

当精确求解(如MILP)因问题规模过大而变得不可行时,启发式算法提供了一种快速获得近似解的方法。Karmarkar-Karp 算法(也称为最大差分法)是解决数集划分问题的一种著名启发式算法,其目标是将一个数集划分为 k 个子集,使这些子集的和尽可能接近,即最小化最大子集和与最小子集和之间的差异。

优点: 速度快,易于实现。局限性:

无法指定子集大小: Karmarkar-Karp 算法的主要目的是平衡子集和,而不是严格控制子集中的元素数量。这与我们问题中“固定子集大小”的要求不符。不直接优化均值: 尽管它试图使子集和接近,但这并不直接等同于使子集均值接近超集均值,尤其是在子集大小不固定的情况下。

因此,Karmarkar-Karp 算法不适用于严格满足本教程最初提出的所有约束条件。然而,作为一种通用的数集划分启发式方法,它在某些场景下仍有其价值,例如当我们只需要大致平衡子集总和,而对子集大小没有严格要求时。

以下是一个使用 numberpartitioning 库实现 Karmarkar-Karp 算法的示例:

from statistics import meanfrom numberpartitioning import karmarkar_karp# 示例 2 的超集数据superset = [100, 100, 100, 100, 100, 103, 103, 103, 103, 103, 103, 103, 103, 103, 103, 104, 104, 104, 104, 104]print("n--- 启发式方法:Karmarkar-Karp ---")print("超集均值:", mean(superset))# 使用 Karmarkar-Karp 划分成 3 个部分# 注意:此方法不接受预设的子集大小for p in karmarkar_karp(superset, num_parts=3).partition:    print(f"子集 ({len(p)} 元素): {p}, 均值: {mean(p)}")

从输出可以看出,Karmarkar-Karp 算法生成的子集大小不固定,且其均值与超集均值的接近程度可能不如 MILP 得到的精确解。

5. 性能考量与优化策略

尽管 MILP 可以提供最优解,但其计算复杂度是 NP-hard 的。对于大规模问题,求解时间可能过长。在实际应用中,我们需要根据具体情况权衡求解精度和计算效率。

问题规模:

N (子集数量): 10-25 个子集通常是 MILP 可处理的范围,但达到 100 个子集时,问题会变得非常困难。M (超集元素数量): 100-1000 个元素是常见情况,10000 个唯一元素则非常庞大。唯一元素数量: 如果超集中有大量重复元素,可以考虑预处理,将相同元素视为一个“类别”,并为每个类别分配一定数量的元素到子集,这可能简化问题。

优化策略:

启发式预分配 + 精确调整:初步均匀分配: 按照子集大小比例,从超集中随机(或均匀)抽取元素填充子集 50%-7

以上就是基于均值优化的数据集子集划分:混合整数规划与启发式方法的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1372699.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python模块导入策略:直接引用类名与通配符导入
上一篇 2025年12月14日 12:32:37
Python模块导入进阶:直接引用模块内成员的技巧
下一篇 2025年12月14日 12:32:48

相关推荐

  • 苹果手机忘记密码

    确认你的Apple ID与密码情况 首先,确认你是否真的忘记了密码。有时候可能是输错了Apple ID或密码,建议仔细核对。回想一下是否曾修改过密码,并检查与该账户绑定的邮箱、安全提示问题或双重认证设备,这些都有助于找回账户访问权限。 如何重设密码 若确认密码遗失,最有效的解决方式是进行密码重置。请…

    2026年9月22日
    000
  • Laravel 8 登录后重定向到仪表盘:完整教程

    本教程详细阐述了在 Laravel 8 中实现用户登录后重定向到仪表盘的多种方法。我们将探讨 Laravel 默认的重定向机制、如何正确配置仪表盘路由及其中间件,并提供通过自定义 LoginController 实现精确重定向的示例代码。通过本文,您将全面掌握 Laravel 认证后的重定向流程,并…

    2026年9月22日
    400
  • Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」

    Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」

    大家好,很高兴再次与大家见面,我是你们的朋友全栈君。 说明:这篇博客是博主亲自编写的,内容独特,辛苦付出,请大家尊重原创,感谢支持! 一.前言VMware Ubuntu安装的详细指南:https://www.php.cn/link/35e7132c1742eaa9dacfedd5607b5f94。 …

    2026年9月22日 • 用户投稿
    800
  • VSCode如何集成Jai游戏开发环境 VSCode配置高性能游戏编程工作流

    配置#%#$#%@%@%$#%$#%#%#$%@_e2fc++805085e25c9761616c00e065bfe8集成jai游戏开发环境的核心在于正确设置编译器与调试器并利用扩展提升效率,1. 配置settings.json指定jai.compilerpath、builddirectory、in…

    2026年9月22日
    400
  • mac怎么使用iMovie剪辑视频_mac使用iMovie剪辑视频教程

    首先打开iMovie并导入视频素材,然后将视频拖入时间线进行裁剪与分割,接着为片段间添加转场效果,再插入背景音乐并调节音量,最后设置参数导出视频。 如果您想在Mac上对视频进行剪辑和编辑,但不知道如何使用系统自带的iMovie应用完成操作,可以按照以下步骤进行。iMovie提供了直观的界面和基础剪辑…

    2026年9月22日
    500
  • 淘宝签到红包如何兑换

    淘宝签到红包是平台为用户准备的一项实用福利,帮助你在日常购物中获得更多实惠。那么,如何顺利兑换这些签到红包呢?接下来为你一步步解析。 一、参与签到领取红包 打开淘宝App后,通常在首页就能看到醒目的“签到”入口,点击即可进入签到页面。每日坚持打卡,系统便会发放对应的签到红包。红包金额会根据连续签到的…

    2026年9月22日
    000
  • MySQL自动化备份如何实现_适合企业级部署吗?

    MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?

    mysql的自动化备份对企业级部署是必要的,且可通过多种方式实现。1. 使用mysqldump+定时任务(crontab)是最基础的方式,操作简单适合中小规模数据库,但备份时可能锁表影响业务;2. 增量备份结合二进制日志(binary log)更高效,适用于频繁变更的数据,支持精确恢复到某时间点;3…

    2026年9月21日 • 用户投稿
    000
  • TensorFlow的AI混合工具怎么操作?构建机器学习模型的详细步骤

    TensorFlow的混合编程核心在于结合Keras的高级抽象与TensorFlow底层API的灵活性,实现高效模型开发。首先使用tf.data构建高性能数据管道,通过map、batch、shuffle和prefetch等操作优化数据预处理;接着利用Keras快速搭建模型结构,同时通过继承tf.ke…

    2026年9月21日
    300
  • 360浏览器医生在哪里打开_360浏览器医生功能启动入口介绍

    360浏览器异常时可通过四种方式启动“浏览器医生”:1.点击右下角医疗箱图标;2.按下F1键;3.从菜单栏“帮助”中进入;4.在设置的扩展功能里查找,随后选择修复模式并重启浏览器。 如果您发现360浏览器运行异常,例如网页加载缓慢、频繁弹窗或无法正常打开页面,可以借助“浏览器医生”功能进行检测与修复…

    2026年9月21日
    100
  • 如何为iPhone14下载最新固件?官方渠道操作教程

    首先通过设备设置检查更新,进入“设置-通用-软件更新”下载并安装;若失败,可连接电脑使用Mac的访达或Windows的iTunes进行固件下载与更新。 如果您尝试为您的iPhone 14获取最新的系统版本,但无法通过常规方式完成下载,可能是由于网络连接不稳定或设备存储空间不足。以下是通过官方渠道进行…

    2026年9月21日
    200
  • Intel前CEO:公司过去15年连锁犯错、18A是重要里程碑

    10月14日,曾担任intel首席执行官的帕特·基辛格(pat gelsinger)在近期一次采访中分享了他对自身在intel职业生涯的反思,并就当下ai产业的发展态势表达了个人见解。 他坦言,Intel“在过去十五年间接连做出多项错误的战略选择”, 这使得公司进入了漫长的重建期,同时也失去了曾经在…

    2026年9月21日
    600
  • 抖音直播间管理员可以设置几个?做主播管理员有收入吗

    抖音直播已成为当前最火爆的社交形式之一。作为直播间的管理核心,抖音直播间管理员在维护秩序、提升体验以及推动直播间发展方面发挥着重要作用。本文将围绕抖音直播间管理员的设置要点进行详细解析,帮助管理者更有效地运营直播间,构建高质量的直播环境。 一、抖音直播间管理员设置关键点 1. 门槛设定 为了保证直播…

    2026年9月21日
    000
  • VSCode如何自定义文件图标 VSCode资源管理器视觉优化的技巧

    自定义vscode文件图标需安装图标主题扩展,如material icon theme;2. 通过扩展市场安装后,在文件图标主题设置中启用;3. 选择主题时应考虑视觉风格、图标覆盖率、辨识度和更新频率;4. 可结合文件嵌套、隐藏文件夹、缩进指南等设置优化资源管理器视觉体验;5. 自定义图标对性能影响…

    2026年9月21日
    000
  • 手机淘宝怎么加热区?淘宝怎么添加热区

    需商家账号在淘宝商家中心或旺铺PC端设置热区,普通买家无权限。①手机端:登录商家中心→店铺管理→详情页装修→选图添加热点→设链接保存;②PC端:登录旺铺官网→店铺装修→用图片热区工具划区域→设跳转链接→发布;③确认账号为已开店的商家主/子账号,未开通需申请店铺并订购旺铺服务。 如果您在使用手机淘宝时…

    2026年9月21日
    000
  • 如何使用Scikit-learn训练AI大模型?传统机器学习与深度结合

    如何使用Scikit-learn训练AI大模型?传统机器学习与深度结合如何使用Scikit-learn训练AI大模型?传统机器学习与深度结合如何使用Scikit-learn训练AI大模型?传统机器学习与深度结合如何使用Scikit-learn训练AI大模型?传统机器学习与深度结合

    Scikit-learn在大型模型预处理中的核心作用是提供数据清洗、特征缩放、编码和降维等工具,确保输入数据高质量且规范化,为深度学习模型奠定坚实基础。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 说实话,如果你的目标是纯粹地“训练AI大…

    2026年9月21日 • 用户投稿
    700
  • win11复制大文件时速度突然掉到0怎么办_win11大文件复制速度突然掉0解决方法

    传输速度降为0可尝试Robocopy命令、修复磁盘错误、更新驱动、关闭占用程序或格式化为NTFS。首先使用Robocopy无缓冲复制避免卡顿;其次通过chkdsk扫描修复文件系统错误;接着在设备管理器中更新USB与存储控制器驱动;然后通过任务管理器关闭高磁盘占用的后台进程;最后若目标盘为FAT32/…

    2026年9月21日
    200
  • Online Config VS Code

    Online Config VS CodeOnline Config VS CodeOnline Config VS CodeOnline Config VS Code

    run vs view Install Code Server Update Code Server Database:It is recommended to create a Docker container for the database. Code Language: JavaScript…

    2026年9月21日 • 用户投稿
    000
  • Java Collections.sort与Collections.reverse的使用区别

    Collections.sort用于排序,基于元素值比较,结果有序,默认升序,可自定义规则;2. Collections.reverse仅反转列表顺序,不比较元素,时间复杂度O(n);3. 两者功能不同,不可替代,按需选择使用。 Java 中 Collections.sort 和 Collectio…

    2026年9月21日
    200
  • MediBangPaint中AI生成图片如何导出?快速保存图像的详细方法

    答案:导出AI生成图片应优先选择PNG格式以保留细节和色彩。通过“文件”菜单中的“导出(单层)”功能,可将图像保存为PNG或JPG等格式,其中PNG为无损压缩,适合高质量输出;若需透明背景或后续编辑,更应选用PNG。清晰度不足常因原始分辨率低、过度放大或JPG压缩过度所致,建议导出时设置高质量(80…

    2026年9月21日
    300
  • 百度搜索app如何启用搜索关键词过滤_百度搜索app关键词过滤的设置技巧

    可通过减号语法排除关键词,如“健身教程 -广告”;用双引号实现精确匹配,如”瑜伽初学者教程”;结合site:指令限定范围,如Python入门教程 site:zhihu.com,提升搜索精准度。 如果您在使用百度搜索App时,希望减少不相关或不想要的搜索结果,可以通过设置关键词…

    2026年9月21日
    800

发表回复

登录后才能评论
关注微信