Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
计算Pandas数据框间Cohen’s Kappa一致性系数教程_创想鸟

计算Pandas数据框间Cohen’s Kappa一致性系数教程

计算Pandas数据框间Cohen's Kappa一致性系数教程

本教程详细介绍了如何在python中计算两个pandas数据框中列表数据的cohen’s kappa一致性系数。我们将探讨多种方法,包括使用列表推导式、`itertuples()`以及`merge(how=’cross’)`结合`np.vectorize`,最终目标是构建一个包含所有受试者(跨数据框)的完整 pairwise kappa 矩阵,并为后续的数据分析和可视化(如热图)奠定基础。

引言:Cohen’s Kappa 与一致性评估

Cohen’s Kappa 系数是一种统计量,用于衡量两个评估者之间对分类数据的协议(一致性)程度,它会纠正随机偶然性造成的一致性。在数据分析中,当我们需要比较不同来源(例如两个数据框)中同类型观测值(例如列表中的分类评分)之间的一致性时,Cohen’s Kappa 是一个非常有用的工具。本教程将指导您如何在Pandas数据框中,针对每个受试者列表计算与其他受试者列表的Cohen’s Kappa分数,并最终将这些分数组织成一个易于分析的矩阵。

数据准备

首先,我们创建两个示例Pandas数据框,每个数据框包含受试者ID、分组信息以及一个代表分类评分的列表。

import pandas as pdimport numpy as npfrom sklearn.metrics import cohen_kappa_score# 示例数据框1data1 = {'subject': ['A', 'B', 'C', 'D'],         'group': ['red', 'red', 'blue', 'blue'],         'lists': [[0, 1, 1], [0, 0, 0], [1, 1, 1], [0, 1, 0]]}df1 = pd.DataFrame(data1)# 示例数据框2data2 = {'subject': ['a', 'b', 'c', 'd'],         'group': ['red', 'red', 'blue', 'blue'],         'lists': [[0, 1, 0], [1, 1, 0], [1, 0, 1], [1, 1, 0]]}df2 = pd.DataFrame(data2)print("DataFrame 1:")print(df1)print("nDataFrame 2:")print(df2)

计算数据框间的 Pairwise Kappa 分数

我们的目标是计算 df1 中每个受试者列表与 df2 中每个受试者列表之间的 Cohen’s Kappa 分数。sklearn.metrics.cohen_kappa_score 函数接受两个一维数组或列表作为输入。

方法一:使用列表推导式(简洁直接)

这是最直接的方法,通过嵌套的列表推导式遍历 df1 和 df2 中的所有 lists,并计算它们之间的 Kappa 值。

# 计算 df1 中所有列表与 df2 中所有列表的 pairwise kappakappa_scores_flat = [cohen_kappa_score(i, j) for i in df1['lists'] for j in df2['lists']]print("nPairwise Kappa Scores (df1 vs df2, flat list):")print(kappa_scores_flat)

这种方法返回一个扁平的列表,其中包含了所有组合的 Kappa 分数。虽然简单,但它没有明确的结构来指示哪个分数对应哪个受试者对。

方法二:使用 itertuples() 构建结构化 DataFrame

为了更好地组织结果,我们可以使用 itertuples() 迭代数据框的行,并直接构建一个 Pandas DataFrame,其中行索引和列名对应于受试者ID。

# 使用 itertuples() 构建 df1 (行) vs df2 (列) 的 Kappa 矩阵kappa_matrix_df1_vs_df2 = pd.DataFrame(    {df2_row.subject: {df1_row.subject: cohen_kappa_score(df1_row.lists, df2_row.lists)                       for df1_row in df1.itertuples()}     for df2_row in df2.itertuples()}).T # 转置以使 df1 subjects 为行,df2 subjects 为列print("nPairwise Kappa Matrix (df1 subjects as rows, df2 subjects as columns):")print(kappa_matrix_df1_vs_df2)

这个方法生成了一个清晰的矩阵,其中 df1 的受试者作为行索引,df2 的受试者作为列名,每个单元格都是对应的 Kappa 分数。

方法三:利用 merge(how=’cross’) 和 np.vectorize(高效且简洁)

对于大型数据框,merge(how=’cross’) 可以生成所有可能的行组合,然后结合 np.vectorize 可以高效地对这些组合应用 cohen_kappa_score 函数。

# 创建 df1 和 df2 的笛卡尔积cross_merged_df = df1.merge(df2, how='cross', suffixes=('_df1', '_df2'))# 提取 'lists' 列,并使用 np.vectorize 计算 kappa# 注意:cohen_kappa_score 期望一维数组,所以需要先转换为 numpy 数组再转置kappa_scores_vectorized = np.vectorize(cohen_kappa_score)(    *cross_merged_df[['lists_df1', 'lists_df2']].to_numpy().T)# 将结果添加到交叉合并的 DataFrame 中cross_merged_df['kappa_score'] = kappa_scores_vectorizedprint("nCross-merged DataFrame with Kappa Scores:")print(cross_merged_df[['subject_df1', 'subject_df2', 'kappa_score']])

这种方法在生成中间的交叉合并数据框时可能会消耗较多内存,但对于计算本身来说效率较高。您可以通过进一步处理 cross_merged_df 来构建所需的矩阵。

怪兽AI数字人 怪兽AI数字人

数字人短视频创作,数字人直播,实时驱动数字人

怪兽AI数字人 44 查看详情 怪兽AI数字人

构建完整的综合一致性矩阵

用户通常希望看到一个包含所有受试者(来自所有数据框)的单一矩阵,以便同时比较数据框内部和数据框之间的 Kappa 值。

为了实现这一点,我们可以将所有受试者及其列表合并到一个临时数据框中,然后对这个合并后的数据框进行自比较。

# 1. 合并所有受试者及其数据到一个数据框# 添加一个 'source' 列以区分来源,如果需要的话df_combined = pd.concat([    df1.assign(source='df1'),    df2.assign(source='df2')]).reset_index(drop=True)# 2. 构建完整的 pairwise Kappa 矩阵# 行和列都包含 df_combined 中的所有受试者kappa_matrix_full = pd.DataFrame(    {row_i.subject: {row_j.subject: cohen_kappa_score(row_i.lists, row_j.lists)                     for row_j in df_combined.itertuples()}     for row_i in df_combined.itertuples()})print("nComprehensive Pairwise Kappa Matrix (all subjects):")print(kappa_matrix_full)

这个 kappa_matrix_full DataFrame 的行和列都包含了来自 df1 和 df2 的所有受试者。通过观察这个矩阵,您可以清晰地看到:

对角线元素: 通常为1,表示受试者自身与自身的一致性。左上角子矩阵: df1 内部受试者之间的一致性(例如 A vs B)。右下角子矩阵: df2 内部受试者之间的一致性(例如 a vs b)。右上角和左下角子矩阵: df1 受试者与 df2 受试者之间的一致性(例如 A vs a)。

Cohen’s Kappa 分数解读

Cohen’s Kappa 的值通常在 -1 到 1 之间:

1: 完美一致。0: 一致性完全由偶然性造成。负值: 一致性比偶然性更差(非常罕见)。

一般来说,对 Kappa 值的解释:

< 0:0.01 – 0.20: 略微0.21 – 0.40: 一般0.41 – 0.60: 中等0.61 – 0.80: 良好0.81 – 0.99: 极好1.00: 完美

可视化:使用热图

生成的 Kappa 矩阵非常适合使用 seaborn 库进行热图可视化,以直观地展示受试者之间的一致性模式。您可以使用 group 列来组织热图,例如,先按 group 对矩阵的行和列进行排序。

import seaborn as snsimport matplotlib.pyplot as plt# 为了更好的可视化,可以根据 'group' 列对矩阵进行排序# 首先,创建一个包含所有subject及其group的Seriessubject_groups = pd.concat([df1.set_index('subject')['group'], df2.set_index('subject')['group']])sorted_subjects = subject_groups.sort_values().index.tolist()# 重新排序 kappa_matrix_fullkappa_matrix_sorted = kappa_matrix_full.loc[sorted_subjects, sorted_subjects]plt.figure(figsize=(10, 8))sns.heatmap(kappa_matrix_sorted, annot=True, cmap='viridis', fmt=".2f", linewidths=.5)plt.title("Pairwise Cohen's Kappa Agreement Heatmap (Sorted by Group)")plt.xlabel("Subject 2")plt.ylabel("Subject 1")plt.show()

通过热图,您可以快速识别哪些受试者对之间具有高一致性(亮色),哪些具有低一致性(暗色),以及是否存在组内或组间的一致性模式。

注意事项

数据类型: cohen_kappa_score 函数期望输入为一维数组或列表,且元素应为类别型数据(例如整数或字符串)。列表长度: 参与比较的两个列表必须具有相同的长度。性能: 对于非常大的数据框,merge(how=’cross’) 会生成一个巨大的中间数据框,可能导致内存问题。在这种情况下,迭代方法(如 itertuples())可能更具内存效率,但计算时间可能更长。选择最适合您数据规模和性能需求的方法。解释: Cohen’s Kappa 假定类别是相互排斥且穷尽的。在解释结果时,应结合领域知识。

总结

本教程详细介绍了如何在Python中计算Pandas数据框中列表数据的 pairwise Cohen’s Kappa 一致性系数。我们探讨了多种实现方法,从简单的列表推导式到构建结构化数据框,并最终展示了如何生成一个全面的 Kappa 矩阵,该矩阵可以有效地用于分析和可视化不同数据源中受试者之间的一致性。掌握这些技术将有助于您在数据分析工作中更深入地评估分类数据的一致性。

以上就是计算Pandas数据框间Cohen’s Kappa一致性系数教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/580261.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
史上最强鸿蒙平板:华为 MatePad Pro 13.2 英寸柔光版今日首销,5699 元起
上一篇 2025年11月10日 10:36:40
红米k50电竞版有无线充电吗
下一篇 2025年11月10日 10:36:51

相关推荐

  • 压力测试(Benchmark)Swoole服务的工具与方法

    进行swoole服务的压力测试是为了确保服务在高负载下稳定运行。1. 选择工具:apache jmeter、wrk、locust。2. 使用方法:jmeter通过脚本配置,wrk通过命令行,locust通过python脚本。3. 注意事项:环境隔离、数据监控、脚本设计。4. 优化点:内存泄漏、连接池…

    2026年9月21日
    000
  • Windows11内存占用率过高怎么解决_Windows11内存占用过高修复方法

    1、通过任务管理器结束高内存占用进程;2、禁用Superfetch(SysMain)服务以降低内存负担;3、优化启动项减少后台负载;4、升级物理内存条提升系统性能。 如果您发现Windows 11系统运行缓慢,并且任务管理器显示内存占用率持续处于高位,这可能是由于后台进程过多、系统服务占用资源或硬件…

    2026年9月21日
    100
  • mysql常用存储引擎有哪些

    InnoDB是现代MySQL应用的首选存储引擎,因其支持事务(ACID)、行级锁、外键约束、崩溃恢复和MVCC,适用于高并发、数据完整性要求高的OLTP场景;MyISAM虽读取快但仅支持表级锁且无事务和外键,适用于读多写少的简单场景,已逐渐被淘汰;Memory引擎将数据存于内存,速度快但易失,适合临…

    2026年9月21日
    000
  • iPhone 12 Pro Max如何启用防水提示

    iPhone 12 Pro Max 具备 IP68 级防水,依赖密封设计无需启用;进水时会提示“闪电符号”,需晾干并避免使用吹风机,防水性能随时间可能下降。 iPhone 12 Pro Max 没有需要“启用”的防水提示功能。它的防溅、抗水和防尘能力是出厂时的硬件设计特性,无法通过设置开关来开启或关…

    2026年9月21日
    100
  • Linux目录结构与Windows目录结构对比

    Linux采用单一树状结构,所有文件系统挂载于根目录/下,如/home、/etc;Windows以C:\、D:\等独立盘符划分,无统一根节点。2. Linux将配置集中于/etc,用户数据存于/home,系统文件在/bin、/usr等,配置明文可编辑;Windows程序装在Program Files…

    用户投稿 2026年9月21日
    100
  • 谷歌浏览器图片无法显示怎么办 谷歌浏览器图片加载失败修复方法

    首先检查浏览器图片显示设置是否允许,确认无误后清除缓存和Cookie数据,接着排查扩展程序干扰,最后更新浏览器并检查硬件加速设置。 谷歌浏览器图片加载不出来,通常不是大问题,多数情况通过几个简单操作就能解决。下面列出几种常见且有效的排查方法。 检查图片显示设置 最直接的原因可能是浏览器被设置为阻止图…

    2026年9月21日
    000
  • 如何配置VSCode来完美支持Vue.js开发?

    安装Volar、TypeScript Vue Plugin、ESLint和Prettier扩展,禁用Vetur,在settings.json中配置vetur.enabled为false,设置ESLint保存时自动修复并指定Prettier为默认格式化工具,关联.vue文件语言,启用TypeScrip…

    2026年9月21日
    000
  • Potplayer如何修复卡顿问题_Potplayer解决播放卡顿的实用方案

    更换视频渲染器、更新显卡驱动、调整色彩格式、关闭叠加层特效及修复视频文件可解决PotPlayer播放卡顿问题。 如果您在使用PotPlayer播放视频时遇到画面卡顿、播放不流畅的情况,这可能是由于渲染器设置不当、硬件加速冲突或系统资源占用过高导致的。以下是解决此问题的具体步骤: 本文运行环境:Del…

    2026年9月21日
    100
  • 利用蝴蝶号搭建多账号无人直播系统的完整方案

    利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案

    搭建多账号无人直播系统并非一键操作,而是通过“蝴蝶号”实现自动化流程。首先,“蝴蝶号”负责多账号的生命周期管理,包括登录、状态维护、ip代理分配和设备指纹模拟;其次,内容调度系统决定直播内容及播放时间,可为预录视频或动态生成流;再次,推流引擎将内容实时推送至平台,推荐使用ffmpeg结合python…

    2026年9月21日 用户投稿
    100
  • 大润发优鲜如何邀请新用户

    你可以通过生成个人专属的邀请链接来参与大润发优鲜的“邀请有礼”活动。在App内找到相关入口后,系统会为你生成唯一的邀请链接。将这个链接通过微信、QQ、短信或其他社交渠道分享给朋友或家人,一旦对方点击链接并完成大润发优鲜App的下载与注册,你就能获得平台发放的奖励,例如购物优惠券或积分,而新用户通常也…

    2026年9月21日
    000
  • 锚定AI终端存储市场,康盈半导体连发三款新品

    锚定AI终端存储市场,康盈半导体连发三款新品锚定AI终端存储市场,康盈半导体连发三款新品锚定AI终端存储市场,康盈半导体连发三款新品锚定AI终端存储市场,康盈半导体连发三款新品

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 三款新品聚焦AI存储需求 在最新举行的产品发布会上,康盈半导体正式推出三款专为AI应用场景打造的全新存储解决方案,覆盖嵌入式存储与高性能固态硬盘等多个品类,旨在满足多样化AI终端对高效、紧凑、低…

    2026年9月21日 用户投稿
    100
  • 数据库运维开发环境的调试模式演进

    数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进

    这是学习笔记的第2393篇文章。 昨日,同事反馈了一个问题,原本的办公机环境中的虚拟机可以将办公机的IP暴露出来,提供数据库运维的API服务。例如,办公机的IP为192.168.10.100,而使用VirtualBox的虚拟机采用主机模式,其IP可能为192.168.56.100,那么192.168…

    2026年9月21日 用户投稿
    100
  • linux内核定时器实验

    linux内核定时器实验linux内核定时器实验linux内核定时器实验linux内核定时器实验

    大家好,又见面了,我是你们的朋友全栈君。 文章目录一、linux时间管理和内核定时器简介1.内核时间管理简介2.内核定时器简介1.init_timer 函数2.add_timer 函数3.del_timer 函数4.del_timer_sync 函数5.mod_timer 函数3.linux内核短延…

    2026年9月21日 用户投稿
    000
  • MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求

    MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求

    mysql日志审计是合规性的基石,因为它提供了数据库操作的完整证据链,记录用户身份、操作类型和时间戳等关键信息,满足gdpr、hipaa等法规要求,并支持事后追溯与事前震慑。1. mysql自身提供错误日志、通用查询日志、慢查询日志和二进制日志,其中通用查询日志记录所有sql语句,二进制日志用于数据…

    2026年9月21日 用户投稿
    000
  • WordPress插件定制:使用Filter Hook修改邮件通知接收者

    本教程将指导您如何在WordPress中利用Filter Hook定制插件行为,特别是修改第三方插件的邮件通知接收者。我们将详细讲解如何识别目标Filter、理解其参数,并正确编写回调函数来拦截或修改数据,以实现自定义的邮件发送逻辑,避免因参数不匹配导致的错误。 WordPress Hook机制概览…

    2026年9月21日
    100
  • Java Collections.singletonList如何创建单元素集合

    Collections.singletonList(T item) 返回只含一个元素的不可变列表,传入指定对象后生成轻量级只读集合,适用于需高效传递单元素场景。该列表禁止修改操作,否则抛出异常,允许 null 元素,内部优化减少内存开销,常用于 API 参数传递或流处理中的临时数据构造。 Java …

    2026年9月21日
    100
  • win8怎么更改锁屏壁纸_Win8锁屏壁纸修改方法

    首先通过电脑设置更换锁屏壁纸,进入“锁屏界面”选择图片或浏览自定义图片;其次可通过控制面板跳转至电脑设置完成相同操作;最后可启用幻灯片放映功能,添加文件夹实现锁屏背景自动轮换。 如果您希望个性化您的Windows 8设备,更改锁屏壁纸是一个简单而有效的方式。系统提供了多种途径来替换默认的锁屏背景图片…

    2026年9月21日
    100
  • VSCode编写Java代码方法_VSCode搭建Java开发环境实战教程

    答案:在VSCode中配置Java开发环境需安装JDK并设置环境变量,再安装VSCode及Java扩展包,即可实现Java项目的创建、编写、运行与调试。它轻量、启动快,支持多语言和丰富扩展,集成Maven/Gradle,适合日常开发。 在VSCode里编写Java代码,说白了,就是把这个轻量级的代码…

    2026年9月21日
    100
  • JavaScript中的模块联邦如何实现微前端的代码共享?

    模块联邦通过运行时动态加载实现微前端代码共享,无需打包公共依赖。使用 ModuleFederationPlugin 配置 name、remotes、exposes 和 shared,使应用可暴露或引入远程模块,支持组件、工具函数及状态管理共享,提升复用性并减少冗余。 模块联邦通过在构建时让不同应用直…

    2026年9月21日
    200
  • 如何系统学习蝴蝶号无人直播运营的核心知识

    如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识

    要系统学习蝴蝶号无人直播运营的核心知识,首先要理解平台逻辑、制定精细化内容策略、掌握自动化技术并持续进行数据分析与风险控制。具体包括:一是深入研究平台算法和规则边界,确保操作合规;二是构建高质量、多样化且合规的内容素材库,并进行标签化管理;三是选择安全可靠的自动化工具,避免使用违规软件;四是模拟真人…

    2026年9月21日 用户投稿
    300

发表回复

登录后才能评论
关注微信