Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Python Pandas生成混合类型虚拟数据:数值与文本的正确姿势_创想鸟

Python Pandas生成混合类型虚拟数据:数值与文本的正确姿势

Python Pandas生成混合类型虚拟数据:数值与文本的正确姿势

本教程旨在指导用户如何使用Python和Pandas库高效地生成包含数值和文本类型数据的虚拟数据集。文章将深入探讨在生成文本型数据时常见的误区,特别是避免将单一随机值广播到所有行的错误,并详细介绍如何通过列表推导式结合random.choice()方法,为每一行独立生成随机的文本类别数据,确保数据的多样性和准确性。

1. 虚拟数据生成概述

在数据分析、机器学习模型开发或测试阶段,我们经常需要创建虚拟数据集。这些数据集通常包含多种数据类型,例如数值型(如面积、价格)和类别型(如区域、产品类型)。使用python的pandas和numpy库可以高效地完成这项任务。

2. 生成数值型数据

对于数值型数据,numpy.random.randint或numpy.random.uniform等函数是理想的选择。它们允许我们指定数值范围和所需的数据量。

例如,生成50,000行房屋面积和价格数据:

import numpy as npimport pandas as pdSIZE = 50000 # 定义数据行数,推荐使用变量而非硬编码np.random.seed(1) # 设置随机种子以确保结果可复现# 生成面积数据:75到325之间的随机整数sq_feet_data = np.random.randint(low=75, high=325, size=SIZE)# 生成价格数据:200,000到1,250,000之间的随机整数price_data = np.random.randint(low=200000, high=1250000, size=SIZE)

3. 生成文本类别型数据的常见误区

在生成文本类别型数据时,一个常见的错误是尝试使用类似random.randrange(len(word))的方式。这种方法的问题在于:

random.choice(WORDS):首先从WORDS列表中随机选择一个单词,例如”Pimlico”。len(word):计算这个单词的长度,例如len(“Pimlico”)得到7。random.randrange(len(word)):生成一个0到6(不包括7)之间的随机整数。将这个单一的随机整数(例如5)广播到所有50,000行,而不是为每一行生成一个随机的区域名称。

因此,最终结果会是一个所有行的“Borough”列都显示相同数字(例如5)的数据框,这显然不是我们期望的随机文本类别数据。

立即学习“Python免费学习笔记(深入)”;

4. 正确生成文本类别型数据的方法:列表推导式与random.choice()

要为每一行独立生成随机的文本类别数据,我们需要使用random.choice()函数结合列表推导式。random.choice(list)从给定的列表中随机选择一个元素。通过在列表推导式中重复执行此操作SIZE次,我们可以生成一个包含SIZE个随机类别值的列表。

import randomBOROUGHS = ["Chelsea", "Kensington", "Westminster", "Pimlico", "Bank", "Holborn", "Camden",            "Islington", "Angel", "Battersea", "Knightsbridge", "Bermondsey", "Newham"]# 使用列表推导式为每一行生成一个随机区域borough_data = [random.choice(BOROUGHS) for _ in range(SIZE)]

这里的_是一个占位符变量,表示我们不需要在循环内部使用迭代器的值。range(SIZE)确保了random.choice(BOROUGHS)操作被执行了SIZE次,从而生成了一个长度为SIZE的随机区域列表。

5. 整合所有数据并导出为CSV

将数值型和文本类别型数据整合到一个Pandas DataFrame中,并导出为CSV文件:

# 整合所有数据到DataFramedata_frame = pd.DataFrame({    "Sq. feet": sq_feet_data,    "Price": price_data,    "Borough": borough_data})# 打印DataFrame的前几行以验证结果print(data_frame.head())# 将DataFrame保存为CSV文件# index=False 避免将DataFrame的索引写入CSV文件data_frame.to_csv("realestate.csv", index=False)print("n虚拟数据已成功生成并保存到 realestate.csv")

完整示例代码:

import randomimport pandas as pdimport numpy as np# 定义数据行数,使用常量可提高代码可维护性SIZE = 50_000# 定义区域列表,建议使用更具描述性的变量名BOROUGHS = ["Chelsea", "Kensington", "Westminster", "Pimlico", "Bank", "Holborn",            "Camden", "Islington", "Angel", "Battersea", "Knightsbridge",            "Bermondsey", "Newham"]# 设置随机种子以确保结果可复现np.random.seed(1)# 构建DataFramedata_frame = pd.DataFrame({    "Sq. feet": np.random.randint(low=75, high=325, size=SIZE),    "Price": np.random.randint(low=200000, high=1250000, size=SIZE),    # 正确生成文本类别数据:使用列表推导式和random.choice    "Borough": [random.choice(BOROUGHS) for _ in range(SIZE)]})# 打印DataFrame的前几行print(data_frame.head())# 将DataFrame保存为CSV文件,不包含索引data_frame.to_csv("realestate.csv", index=False)print("n虚拟数据已成功生成并保存到 realestate.csv")

输出示例:

   Sq. feet    Price      Borough0       112   345382      Pimlico1       310   901500    Battersea2       215   661033      Holborn3       147  1038431  Westminster4       212   296497      Holborn

6. 注意事项与最佳实践

使用常量定义重复值: 对于像数据行数SIZE这样的重复使用的数值,将其定义为一个常量(例如SIZE = 50_000)放置在代码顶部是一个好习惯。这不仅提高了代码的可读性,也便于未来修改参数时只需更改一处。清晰的变量命名: 将WORDS重命名为更具体的BOROUGHS,可以使代码意图更加明确。随机种子: 使用np.random.seed()可以确保每次运行代码时,随机数生成的结果都是相同的,这对于调试和结果复现至关重要。列表推导式: [expression for item in iterable]是Python中一种简洁高效的创建列表的方法,非常适用于批量生成数据。对于本例中的类别数据生成,它比传统的for循环更具可读性和效率。

7. 总结

通过本教程,我们学习了如何使用pandas和numpy库生成包含数值和文本类别数据的虚拟数据集。关键在于理解random.choice()与列表推导式结合使用的强大功能,以避免在生成类别数据时常见的单一值广播错误。遵循这些最佳实践,可以确保生成的数据集既准确又易于维护,为后续的数据分析和模型开发工作打下坚实基础。

以上就是Python Pandas生成混合类型虚拟数据:数值与文本的正确姿势的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1372565.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
AWS Lambda异步调用间歇性超时:VPC网络配置与混合子网的陷阱
上一篇 2025年12月14日 12:25:25
使用Pandas生成混合类型虚拟数据:数值与文本列的正确实践
下一篇 2025年12月14日 12:25:33

相关推荐

  • VSCode怎么改环境_VSCode切换Python/Node等多版本环境教程

    切换VSCode环境需先安装对应语言扩展,再通过命令面板选择解释器或使用nvm切换Node版本,配合虚拟环境或launch.json配置确保运行和调试时使用正确版本,可通过终端命令验证环境,若失效可检查缓存、扩展冲突或权限问题。 VSCode改环境,其实就是让VSCode知道你想用哪个版本的Pyth…

    2026年9月21日
    000
  • Linux中如何安装Redis_Linux安装Redis服务的完整教程

    安装编译环境和依赖:Ubuntu/Debian用apt安装build-essential tcl wget,CentOS/RHEL用yum安装Development Tools和tcl wget。2. 下载Redis 7.2.4源码包并%ignore_a_1%,进入目录后执行make编译,可选mak…

    2026年9月21日
    000
  • VSCode代码空格怎么解决_VSCode缩进与格式处理教程

    解决VSCode代码空格和缩进问题,需配置settings.json中的缩进规则并引入外部格式化工具。首先设置”editor.tabSize”、”editor.insertSpaces”和”editor.detectIndentation&…

    2026年9月21日
    100
  • 52核+288MB缓存痛击AMD锐龙X3D Intel确认Nova Lake史上最强

    10月26日消息,在amd推出锐龙x3d家族处理器后,凭借超大容量的3d缓存实现了游戏性能的全面反超,成功登顶最强游戏cpu宝座。 过去,Intel酷睿处理器虽在多核性能上稍逊一筹,但在游戏领域始终占据主导地位。然而,随着X3D系列的强势崛起,这一最后的防线也被攻破。此前,Intel已公开承认其在桌…

    2026年9月21日
    000
  • Java中字符到数字转换:解决for循环提前返回的常见陷阱

    本文探讨java中`for`循环在字符到数字转换时,因`return`语句放置不当导致程序提前终止、无法完整处理字符串的问题。我们将分析这种常见陷阱,并提供修正方案,演示如何正确利用循环填充数组,并在循环结束后统一返回最终结果,确保每个字符都能被准确映射和组合。 引言:字符到数字的映射需求 在编程实…

    2026年9月21日
    000
  • word怎么设置页边距_word文档页边距设置步骤

    首先打开Word文档,点击“布局”选项卡中的“页边距”按钮,可选择预设值或点击“自定义页边距”进行详细设置,输入上下左右边距及装订线数值,再通过“应用于”选择范围,最后点击“确定”完成设置。 在使用Word编辑文档时,设置合适的页边距能让内容排版更美观,也符合打印或提交要求。下面介绍如何在Word中…

    2026年9月21日
    000
  • LLaVA-OneVision-1.5— EvolvingLMMS-Lab开源的多模态模型

    LLaVA-OneVision-1.5— EvolvingLMMS-Lab开源的多模态模型LLaVA-OneVision-1.5— EvolvingLMMS-Lab开源的多模态模型LLaVA-OneVision-1.5— EvolvingLMMS-Lab开源的多模态模型LLaVA-OneVision-1.5— EvolvingLMMS-Lab开源的多模态模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 百灵大模型 蚂蚁集团自研的多模态AI大模型系列 177 查看详情 llava-onevision-1.5 是一款开源的先进多模态大模型,凭借高效的训练策略与高质量的数据构建,在性能、成本控制和可…

    2026年9月21日 • 用户投稿
    000
  • win10平板模式下屏幕键盘不自动弹出怎么办_恢复屏幕键盘自动弹出的技巧

    1、检查平板电脑模式设置,确保登录和使用时均启用平板模式并重启;2、在设备→输入中开启“不处于平板模式且未连接键盘时显示触摸键盘”;3、通过注册表编辑器创建InitialKeyboardIndicators值为2(十六进制)以强制启用键盘指示器;4、手动显示触摸键盘按钮并测试各应用兼容性,排查特定软…

    2026年9月21日
    000
  • 钉钉视频通话模糊怎么办 钉钉视频清晰度调整与网络优化方法

    视频模糊主因是网络、设备或设置问题。先优化Wi-Fi并关后台应用,再清洁镜头、调光线和物理对焦,最后开高清模式、更新钉钉版本或换高清设备,多数可改善。 钉钉视频通话模糊,通常不是单一原因导致的,而是网络、设备或软件设置共同影响的结果。想要快速改善画面质量,可以从以下几个方面着手排查和优化。 检查并优…

    2026年9月21日
    000
  • 如何配置VSCode与Jupyter Notebook进行交互式数据科学编程?

    首先安装Python、VSCode及Python扩展,再通过pip安装jupyter;接着在VSCode中创建或打开.ipynb文件,使用Shift+Enter运行单元格;然后通过Ctrl+Shift+P选择Python解释器并确保安装ipykernel以匹配内核;最后启用变量查看器、代码块分隔符和…

    2026年9月21日
    000
  • 蝴蝶号内容创作不露脸的五大绝技与执行方法 | 快速提升曝光率的实用操作流程

    不露脸也能玩转蝴蝶号内容创作,关键在于将焦点从个人形象转移到内容本身与观众体验上,通过声音叙事、动态文字、手部特写、数据可视化和场景搭建五大核心策略构建吸引力,结合高质量音画配合、精准的受众定位、稳定更新与算法互动,提升曝光率;同时规避素材版权、声音质量与画面单调等技术挑战,善用免费或付费正版素材、…

    2026年9月21日
    100
  • Flyway配置中安全使用环境变量的实践指南

    flyway配置中直接暴露数据库连接参数存在安全隐患。本文详细阐述了如何通过命令行参数和api调用两种主要方式,将环境变量安全地集成到flyway配置流程中。通过外部化管理敏感信息,可以有效提升数据库迁移配置的安全性、灵活性和可维护性,避免将凭证硬编码到配置文件中。 在数据库迁移实践中,将敏感的数据…

    2026年9月21日
    100
  • PHP 数组值比较与嵌套数组过滤教程

    本教程详细讲解如何在 PHP 中比较一个简单数组与一个复杂嵌套数组,并根据特定条件(如文件名匹配)过滤嵌套数组中的所有相关子数组。我们将通过识别非匹配项的索引,然后从所有子数组中移除这些项并重新索引,实现精确的数据筛选。 问题背景 在 php 开发中,我们经常会遇到需要处理结构复杂的数组数据。例如,…

    2026年9月21日
    100
  • Java集合框架在数据处理中的应用实例

    使用Set去重:通过LinkedHashSet去除标签重复并保持顺序;2. Map统计频次:利用HashMap统计单词出现次数;3. List结合Comparator排序:按年龄升序、姓名降序排列用户;4. 集合嵌套处理数据:用Map组织部门与员工列表。集合框架提升数据处理效率与代码可读性。 Jav…

    2026年9月21日
    000
  • 如何使用XGBoost训练AI大模型?优化机器学习模型的步骤

    XGBoost并非用于训练GPT类大模型,而是擅长处理结构化数据的高效梯度提升算法,其优势在于速度快、准确性高、支持并行计算、内置正则化与缺失值处理,适用于表格数据建模;通过分阶段超参数调优(如学习率、树深度、采样策略)、结合贝叶斯优化与交叉验证,并配合特征工程、数据预处理和集成学习等关键步骤,可显…

    2026年9月21日
    000
  • win8如何禁用笔记本自带键盘_Win8笔记本键盘禁用方法

    可通过命令提示符、设备管理器或注册表编辑器禁用Win8笔记本自带键盘。1、命令提示符输入sc config i8042prt start= disabled并重启;2、设备管理器中禁用“PS/2标准键盘”或“HID Keyboard Device”;3、注册表中将i8042prt服务的Start值改…

    2026年9月21日
    000
  • 如何在Java中配置与数据库连接环境

    答案:Java中配置数据库连接需引入JDBC驱动,如MySQL在Maven中添加对应依赖;通过DriverManager或连接池(如HikariCP)获取Connection,使用try-with-resources管理资源;建议将连接参数存入properties文件,并处理常见问题如驱动加载、权限…

    2026年9月21日
    000
  • VSCode怎么运行全部代码_VSCode批量执行代码教程

    在VSCode里“运行全部代码”或“批量执行代码”,其实很少是一个单一的、所有语言通用的按钮。它更多的是指根据你项目的具体需求,通过配置任务(Tasks)、使用集成终端(Integrated Terminal)配合脚本,或者利用特定语言的运行/调试配置(Launch Configurations)来…

    2026年9月21日
    100
  • win11管理员权限不够怎么办_win11管理员权限不足解决方法

    首先以管理员身份运行程序,其次修改文件权限或启用Administrator账户,最后通过调整UAC设置或注册表禁用UAC来解决权限不足问题。 如果您在使用Windows 11时尝试执行某些系统级操作,但提示权限不足或被拒绝,即使当前账户为管理员,也可能是由于用户账户控制(UAC)或特定文件/程序的权…

    2026年9月21日
    100
  • 如何使用mysql设计客户信息管理项目

    答案:设计客户信息管理系统需先明确功能需求,再合理规划数据库结构。1. 根据客户需求划分模块,包括客户基本信息、分类、状态、跟进记录等;2. 创建核心表如customers、company_info、follow_ups和users,确保字段完整且符合业务逻辑;3. 在关键字段上建立索引以提升查询效…

    2026年9月21日
    400

发表回复

登录后才能评论
关注微信