Polars数据帧高级排序:利用布尔逻辑实现复杂条件排序

Polars数据帧高级排序:利用布尔逻辑实现复杂条件排序

本教程详细阐述了如何在polars中实现复杂的条件排序,特别适用于根据模型预测结果和置信度对数据进行优先级排序的场景。通过巧妙结合布尔表达式、算术运算和多键排序,polars能够高效地将数据按“高置信度错误预测”、“低置信度错误预测”以及“从低到高置信度的正确预测”进行分组和排序,避免了传统的分拆合并操作,极大提升了数据处理的优雅性和效率。

在数据分析和机器学习模型评估中,我们经常需要对数据进行复杂的条件排序,以便优先关注某些特定模式的样本。例如,在二分类任务中,可能需要优先审查那些模型预测错误但置信度高的样本,以及预测正确但置信度低的样本,以发现模型潜在的改进点。传统的做法可能涉及将数据集拆分成多个子集,分别排序后再合并,但这往往会导致代码冗长且效率低下。Polars作为一个高性能的DataFrame库,提供了强大且富有表达力的API,可以优雅地解决这类复杂排序问题。

Polars多键排序的核心原理

Polars的DataFrame.sort()方法支持传入一个表达式列表作为排序键。这意味着我们可以定义多个排序规则,Polars会按照这些表达式在列表中的顺序依次进行排序。一个关键的特性是,Polars中的布尔值(True和False)在算术运算中会被隐式转换为整数(1和0)。这一特性为实现条件排序提供了极大的灵活性。

构建条件排序表达式

为了实现“高置信度错误预测优先,其次是低置信度正确预测”的排序逻辑,我们将构建三个关键的排序表达式。

1. 数据准备

首先,我们创建一个包含模型预测结果的Polars DataFrame作为示例数据。

import polars as pldf = pl.DataFrame({    "name": ["Alice", "Bob", "Caroline", "Dutch", "Emily", "Frank", "Gerald", "Henry", "Isabelle", "Jack"],    "truth": [1, 0, 1, 0, 1, 0, 0, 1, 1, 0],    "prediction": [1, 1, 1, 0, 0, 1, 0, 1, 1, 0],    "confidence": [0.343474, 0.298461, 0.420634, 0.125515, 0.772971, 0.646964, 0.833705, 0.837181, 0.790773, 0.144983]}).with_columns(    (pl.col("truth") == pl.col("prediction")).alias("correct_prediction"))print("原始数据:")print(df)

原始数据:

shape: (10, 5)┌──────────┬───────┬────────────┬────────────┬────────────────────┐│ name     ┆ truth ┆ prediction ┆ confidence ┆ correct_prediction ││ ---      ┆ ---   ┆ ---        ┆ ---        ┆ ---                ││ str      ┆ i64   ┆ i64        ┆ f64        ┆ bool               │╞══════════╪═══════╪════════════╪════════════╪════════════════════╡│ Alice    ┆ 1     ┆ 1          ┆ 0.343474   ┆ true               ││ Bob      ┆ 0     ┆ 1          ┆ 0.298461   ┆ false              ││ Caroline ┆ 1     ┆ 1          ┆ 0.420634   ┆ true               ││ Dutch    ┆ 0     ┆ 0          ┆ 0.125515   ┆ true               ││ Emily    ┆ 1     ┆ 0          ┆ 0.772971   ┆ false              ││ Frank    ┆ 0     ┆ 1          ┆ 0.646964   ┆ false              ││ Gerald   ┆ 0     ┆ 0          ┆ 0.833705   ┆ true               ││ Henry    ┆ 1     ┆ 1          ┆ 0.837181   ┆ true               ││ Isabelle ┆ 1     ┆ 1          ┆ 0.790773   ┆ true               ││ Jack     ┆ 0     ┆ 0          ┆ 0.144983   ┆ true               │└──────────┴───────┴────────────┴────────────┴────────────────────┘

2. 第一排序键:区分错误与正确预测

我们的首要目标是将错误预测排在正确预测之前。我们可以利用correct_prediction列(布尔类型)作为第一个排序键。在Polars中,False(对应整数0)会排在True(对应整数1)之前。

# 定义第一个排序键:判断是否是正确预测# False (0) 会排在 True (1) 之前,因此错误预测会优先出现first_key = pl.col('truth').eq(pl.col('prediction'))# 为了方便后续使用,我们可以将其赋值给一个变量# good_pred = pl.col('truth').eq(pl.col('prediction'))

这里我们直接在sort方法中使用表达式,并利用Python的赋值表达式:=将结果赋值给good_pred,以便在后续表达式中复用。

ima.copilot ima.copilot

腾讯大混元模型推出的智能工作台产品,提供知识库管理、AI问答、智能写作等功能

ima.copilot 317 查看详情 ima.copilot

3. 第二排序键:处理错误预测的置信度(降序)

在错误预测的组内,我们希望置信度最高的错误预测排在最前面。这意味着我们需要对置信度进行降序排序。对于正确预测的样本,这个排序键不应该影响它们的顺序,而是让下一个排序键来决定。

我们可以通过一个巧妙的数学表达式来实现这一点:(good_pred – 1) * pl.col(‘confidence’)

当good_pred为False(即0,表示错误预测)时:表达式变为 (0 – 1) * confidence = -confidence。对-confidence进行升序排序,实际上就是对confidence进行降序排序。这正是我们对错误预测所期望的。当good_pred为True(即1,表示正确预测)时:表达式变为 (1 – 1) * confidence = 0 * confidence = 0。这意味着所有正确预测的样本在这个排序键上的值都为0,它们之间保持相对顺序,等待下一个排序键来决定。

4. 第三排序键:处理正确预测的置信度(升序)

对于正确预测的组内,我们希望置信度最低的预测排在最前面,即对置信度进行升序排序。由于第二个排序键对正确预测的样本都返回了0,因此它们将由第三个排序键来决定顺序。

# 定义第三个排序键:对置信度进行升序排序# 这将应用于所有样本,但只有在前面键值相同的情况下才会生效third_key = pl.col('confidence')

完整示例代码

将以上三个排序键组合到DataFrame.sort()方法中:

sorted_df = df.sort([    (good_pred:=pl.col('truth').eq(pl.col('prediction'))), # 1. 错误预测 (False/0) 优先于正确预测 (True/1)    (good_pred-1)*pl.col('confidence'),                    # 2. 错误预测内部,按置信度降序    pl.col('confidence')                                   # 3. 正确预测内部,按置信度升序])print("n条件排序后的数据:")print(sorted_df)

条件排序后的数据:

shape: (10, 5)┌──────────┬───────┬────────────┬────────────┬────────────────────┐│ name     ┆ truth ┆ prediction ┆ confidence ┆ correct_prediction ││ ---      ┆ ---   ┆ ---        ┆ ---        ┆ ---                ││ str      ┆ i64   ┆ i64        ┆ f64        ┆ bool               │╞══════════╪═══════╪════════════╪════════════╪════════════════════╡│ Emily    ┆ 1     ┆ 0          ┆ 0.772971   ┆ false              ││ Frank    ┆ 0     ┆ 1          ┆ 0.646964   ┆ false              ││ Bob      ┆ 0     ┆ 1          ┆ 0.298461   ┆ false              ││ Dutch    ┆ 0     ┆ 0          ┆ 0.125515   ┆ true               ││ Jack     ┆ 0     ┆ 0          ┆ 0.144983   ┆ true               ││ Alice    ┆ 1     ┆ 1          ┆ 0.343474   ┆ true               ││ Caroline ┆ 1     ┆ 1          ┆ 0.420634   ┆ true               ││ Isabelle ┆ 1     ┆ 1          ┆ 0.790773   ┆ true               ││ Gerald   ┆ 0     ┆ 0          ┆ 0.833705   ┆ true               ││ Henry    ┆ 1     ┆ 1          ┆ 0.837181   ┆ true               │└──────────┴───────┴────────────┴────────────┴────────────────────┘

结果分析与验证

从输出结果可以看出,排序完全符合我们的预期:

错误预测优先: Emily、Frank、Bob 都属于 correct_prediction = False,它们排在所有正确预测之前。

以上就是Polars数据帧高级排序:利用布尔逻辑实现复杂条件排序的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/844894.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
win7如何创建应用程序快捷方式
上一篇 2025年11月27日 14:42:17
雷军辟谣小米只招聘 35 岁以下员工:只有招聘未来之星时才有年龄限制
下一篇 2025年11月27日 14:42:22

相关推荐

  • NS2版《无主之地4》突遭延期!预购将取消

    《无主之地4》现可提前购入,使用金币叠加限时优惠券后,标准版仅需244.5元(共节省 ¥53.5);超级豪华版为457.4元(总计优惠 ¥100.6)。 原计划于10月3日发布的《无主之地4》Nintendo Switch 2版本已确认延期。Gearbox Entertainment最新发布公告称,…

    2026年9月23日
    200
  • 如何在mysql中优化多表JOIN查询

    答案:优化MySQL多表JOIN需创建关联字段索引、提前过滤数据、选择合适JOIN类型与表序、利用EXPLAIN分析执行计划,并定期更新统计信息以提升查询效率。 在MySQL中优化多表JOIN查询,关键在于减少数据扫描量、提升连接效率,并合理利用索引和执行计划。以下是一些实用的优化策略。 1. 确保…

    2026年9月23日
    200
  • WooCommerce 购物车联动:实现赠品自动添加与移除的专业指南

    本文提供了一份关于在 woocommerce 中实现自动赠品系统的全面指南。它解决了在程序化添加产品时常见的 `woocommerce_add_to_cart` 递归问题,并提供了一个使用自定义购物车项元数据来管理关联赠品的健壮解决方案,确保赠品能与特定主产品同步添加和移除。 引言 在电子商务中,为…

    2026年9月23日
    400
  • MySQL安装需要哪些硬件配置要求?

    MySQL安装需要哪些硬件配置要求?MySQL安装需要哪些硬件配置要求?MySQL安装需要哪些硬件配置要求?MySQL安装需要哪些硬件配置要求?

    mysql的硬件配置需根据应用场景和负载决定,生产环境应重点考虑磁盘i/o、内存、cpu和网络。1. cpu:oltp场景多核心更重要,olap则更依赖主频和缓存;2. 内存:buffer pool越大越好,但需避免过度分配导致swap使用;3. 磁盘i/o:ssd是标配,nvme ssd和raid…

    2026年9月23日 用户投稿
    200
  • 硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线

    硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线

    如果你已经顺利解开《奥伯拉丁的回归》或《金偶像迷案》中的重重谜团,那么接下来的挑战将更加扑朔迷离!好莱坞正陷入一场震惊全城的连环谋杀风暴!你将化身为一名敏锐过人的侦探,运用你的观察力与推理能力:勘察犯罪现场,搜集关键证据,抽丝剥茧地还原真相。幕后黑手究竟是谁?他又为何精心策划这一系列隐秘的杀局? 这…

    2026年9月23日 用户投稿
    100
  • 如何在Procreate中使用AI导出图片?保存高质量图像的正确方法

    Procreate无内置AI导出功能,但可通过导出高质量图像(如PSD、TIFF、PNG)供外部AI工具优化;选择格式需根据用途,PSD适合协作,TIFF用于印刷,PNG支持透明背景,JPEG慎用以避免压缩损失;画布应高DPI创建,色彩配置优先sRGB,印刷时后期转CMYK更精准。 ☞☞☞AI 智能…

    2026年9月23日
    100
  • chrome浏览器最新官方网址下载 chrome浏览器官网链接快速直达

    Chrome浏览器最新官方下载网址是https://www.google.cn/chrome/,提供安卓版和手机版下载,界面简洁,支持书签同步、网页翻译、点按搜索等功能,确保快速安全的浏览体验。 chrome浏览器最新官方网址下载在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来chrome…

    2026年9月23日
    200
  • VSCode极速配置Scala:sbt支持、中文文档、REPL集成

    安装JDK和sbt后,在VSCode中安装Metals扩展,即可快速搭建Scala开发环境;2. Metals通过LSP和BSP协议实现代码补全、错误检查、重构及sbt项目自动导入;3. 支持通过sbt shell启动REPL或使用Run Worksheet实现交互式编程;4. 虽无内置中文文档,但…

    2026年9月23日
    100
  • 优麒麟 25.10 版本正式发布

    优麒麟 25.10 正式版现已上线,此版本将提供长达9个月的支持周期,基于最新的 linux 6.17 内核打造,在基础库、子系统及核心组件等方面实现了全面升级,显著提升了系统的稳定性与兼容性,同时推出了焕然一新的软件商店。 新增特性 1. 搭载 Linux 6.17 内核 优麒麟 25.10 集成…

    2026年9月23日
    100
  • linux如何优雅的关机

    优雅关机的三大法宝:拔电源、shutdown、poweroff 及其对硬件和数据的影响 在讨论关机方法之前,先了解一下机械硬盘的内部结构。 那固态硬盘SSD呢? FTL工作示意图。FTL表对SSD至关重要,如果在FTL写回Flash之前突然断电,内存数据丢失,FTL表也将丢失。因此,高端SSD和服务…

    2026年9月23日
    100
  • PHP自定义函数:创建与使用 prev_id() 函数的实践指南

    本文旨在指导读者如何定义和实现自定义PHP函数,以解决“Call to undefined function”错误。通过 prev_id() 函数的创建示例,详细阐述了函数的基本语法、参数传递、返回值以及在实际应用(如数据库查询)中的集成方法,并提供了关键注意事项,帮助开发者编写模块化、可维护的代码…

    2026年9月23日
    000
  • 四种获取fasta序列长度的方法

    在处理fasta序列时,我们常常需要知道每条序列的长度。今天小编将与大家分享四种获取fasta序列长度的方法。 一、使用awk 以下是使用awk获取fasta序列长度的代码: awk ‘/^>/{if (l!=””) print l; print; l=0; next}{l+=length($…

    2026年9月23日
    200
  • VSCode如何实现代码版本对比 VSCode Git差异对比的高效使用方法

    vscode通过scm视图直接对比工作区与head的差异;2. 点击已暂存文件可查看暂存区与head的差异;3. 通过命令面板、scm历史记录或右键菜单可对比任意版本或文件;4. 差异视图支持并排和内联模式,并提供跳转导航;5. 时间线视图可追溯文件级提交历史并对比各版本;6. gitlens扩展增…

    2026年9月23日
    600
  • mysql索引怎么用 mysql创建索引提高查询性能方法

    mysql索引怎么用 mysql创建索引提高查询性能方法mysql索引怎么用 mysql创建索引提高查询性能方法mysql索引怎么用 mysql创建索引提高查询性能方法mysql索引怎么用 mysql创建索引提高查询性能方法

    索引是mysql中提高查询性能的关键工具,它类似于书籍目录,可快速定位数据。创建索引主要使用create index或alter table语句,例如:create index idx_email on users (email); 或 alter table users add index idx…

    2026年9月23日 用户投稿
    000
  • Java中基于栈验证JSON字符串结构有效性的方法

    本文探讨了在Java中利用栈(Stack)数据结构验证JSON字符串结构有效性的方法。我们将分析一个常见的基于栈的实现示例,指出其在处理字符串内部字符、引号平衡以及转义字符方面的潜在缺陷。文章将提供一个改进的解决方案,并强调此方法主要用于结构匹配,而非完整的JSON语法验证,同时建议生产环境中使用专…

    2026年9月23日
    100
  • 快手极速版官方网页版地址_快手极速版App下载官网首页

    快手极速版官方网页版地址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来快手极速版官方网页版地址及App下载相关信息,感兴趣的网友一起随小编来瞧瞧吧! https://www.kuaishou.com/ 1、小步骤内容。进入官网后可直接浏览平台首页推荐内容,涵盖生活记录、才艺展示等多个领域…

    2026年9月23日
    300
  • Flink项目实践 | Flink 单机安装部署

    Flink项目实践 | Flink 单机安装部署Flink项目实践 | Flink 单机安装部署Flink项目实践 | Flink 单机安装部署Flink项目实践 | Flink 单机安装部署

    apache flink 是一个用于对无界和有界数据流进行状态计算的框架和分布式处理引擎。flink 设计旨在所有常见集群环境中运行,并以内存速度和任意规模进行计算。 为了深入了解 Flink,首先需要搭建其运行环境。 Flink 可以在所有类似 UNIX 的环境中运行,包括 Linux,Mac O…

    2026年9月23日 用户投稿
    200
  • Windows系统安装MySQL的完整步骤是什么?

    Windows系统安装MySQL的完整步骤是什么?Windows系统安装MySQL的完整步骤是什么?Windows系统安装MySQL的完整步骤是什么?Windows系统安装MySQL的完整步骤是什么?

    安装#%#$#%@%@%$#%$#%#%#$%@_81c++3b080dad537de7e10e0987a4bf52e前需准备系统兼容性、硬件资源、前置运行时库、管理员权限及排查端口冲突。1. 系统兼容性:确保使用windows 10/11或对应server版本;2. 硬件资源:建议至少4gb内存;…

    2026年9月23日 用户投稿
    200
  • 如何在AdobeFresco导出AI生成的画作?快速保存图像的教程

    答案:Adobe Fresco支持PNG、JPG、PSD、PDF和MP4等导出格式。PNG适合透明背景和高质量网络展示;JPG适用于小文件、快速分享的有损压缩图像;PSD保留图层与矢量信息,便于在Photoshop中继续编辑;PDF适合打印和跨平台文档共享;MP4用于导出创作延时视频。选择格式时需根…

    2026年9月23日
    100
  • VSCode配置MacOS C环境 详细图解VSCode搭建C++开发

    在mac++os上用vscode配置c/c++环境的关键是安装xcode command line tools以获取clang编译器和lldb调试器,然后安装vscode的c/c++扩展,接着创建项目文件夹和源文件,通过配置tasks.json定义编译任务,确保使用clang编译当前文件并生成可执行…

    2026年9月23日
    100

发表回复

登录后才能评论
关注微信