小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

FireDucks是一个兼容pandas API的编译器加速库,通过惰性执行和多线程优化提升大数据处理性能。基准测试显示,在1000万行数据集上,FireDucks在排序、分组、过滤等七项任务中均快于pandas,速度提升2.66倍至20.77倍,平均7.28倍。安装后仅需替换import语句即可使用,适合大规模数据处理场景。

这个Python库能让Pandas工作负载提速高达20倍

KDnuggets KDnuggets · 2026-09-02T14:00:11Z
Python在机械工程中的应用

freeCodeCamp发布新课程,教授工程师使用Python提升工作流程和技术分析。课程涵盖Python基础、环境搭建、NumPy、Pandas、Matplotlib等库,以及AI工具应用,并通过材料选择、仿真、自动化数据处理和机器人等案例实践。适合机械工程师、机器人爱好者等,时长7小时。

Python在机械工程中的应用

freeCodeCamp.org freeCodeCamp.org · 2026-08-13T13:50:26Z
JetBrains Academy – 七月简报

JetBrains Academy七月简报:推出AI应用开发实战课程(含PyCharm练习)及pandas官方文档配套课程(含TED推荐项目);庆祝Kotlin 15周年,新用户可免费学习至10月9日;公布IntelliJ IDEA Conf 2026完整议程(9月8-9日免费注册);并采访Python软件基金会董事,探讨AI时代学习Python的方法。

JetBrains Academy – 七月简报

The JetBrains Blog The JetBrains Blog · 2026-08-07T08:23:39Z
正确学习pandas:一门不浪费你时间的Python库课程

JetBrains Academy推出pandas课程,基于官方文档,在IDE中实时编码学习,涵盖Series、DataFrame、数据清洗、筛选排序等核心技能。完成课程可获得两个真实项目(TED推荐模型和LLM成本分析)。适合懂基础Python者,提供Coursera完整版和免费编码版两种学习方式,完成Coursera课程并评价可获20美元礼品卡。

正确学习pandas:一门不浪费你时间的Python库课程

The JetBrains Blog The JetBrains Blog · 2026-08-03T14:07:09Z
第743期:栈与队列、Django F表达式、MCP客户端及更多(2026-07-14)

本文介绍了如何在Python中使用列表实现栈操作(后进先出)和使用collections模块中的deque实现队列操作(先进先出)。此外,还讨论了如何使用GitHub Actions安全发布Python库,以及如何使用pandas清理CSV文件数据。

第743期:栈与队列、Django F表达式、MCP客户端及更多(2026-07-14)

PyCoder’s Weekly PyCoder’s Weekly · 2026-07-14T19:30:00Z

数据清洗是数据分析的重要技能。本文介绍了如何使用Python和pandas清理客户CSV文件,包括加载数据、检查数据、清理列名、处理缺失值、去除重复项、标准化文本、转换数据类型和验证电子邮件等步骤。最终,清理后的数据将保存为新的CSV文件,以便后续分析。

如何使用Python清理混乱的CSV文件:初学者指南

KDnuggets KDnuggets · 2026-07-08T15:10:39Z

本文比较了SQL、Pandas和Claude代理在数据分析中的表现。通过三道不同难度的问题,评估了它们在速度、准确性和可解释性方面的差异。结果显示,SQL执行速度最快,Pandas适合自定义转换,而Claude在完整模式下能生成正确SQL,但存在延迟和输出不一致的风险。总体而言,SQL适合结构化检索,Pandas适合逐步处理,Claude适合初步查询和探索。

SQL与Pandas与AI代理:谁能更好地解决分析问题?

KDnuggets KDnuggets · 2026-07-07T16:00:29Z

在处理大型数据集时,逐行迭代会导致性能瓶颈。本文介绍了七种在pandas中替代循环的方法,包括向量化操作、条件逻辑函数、np.where()、np.select()、字典查找、字符串操作和.groupby(),这些方法能有效提高数据处理效率。

停止在Pandas中编写循环:7种更快的替代方法

KDnuggets KDnuggets · 2026-06-16T12:00:08Z

数据清洗和准备占数据科学家工作流程的80%。使用Pandas库可以提高数据处理效率。文章介绍了三种Pandas技巧:1. 使用方法链(如.assign()和.query())提高代码可读性和安全性;2. 将低基数字符串列转换为类别类型,优化内存和速度;3. 使用.groupby()和.transform()进行分组插补,避免低效的自定义循环。这些方法显著提升数据清洗和特征工程的效率。

数据清洗与准备的三种Pandas技巧

KDnuggets KDnuggets · 2026-06-15T12:00:35Z

本文介绍了五个重要的Python概念,以提高数据科学中的性能和可读性。首先,NumPy的向量化加速数据处理,避免慢速循环。其次,广播机制允许在不同维度的数组上运算,减少内存复制。第三,Pandas的.pipe()和.assign()方法促进功能性数据管道的构建,提升代码可读性。第四,使用lambda函数简化数据转换,避免冗长循环。最后,通过优化数据框的dtype,降低内存占用。这些技巧帮助数据科学家构建高效、可维护的数据处理流程。

数据科学家必知的五个Python概念

KDnuggets KDnuggets · 2026-06-01T12:00:24Z
Pandas GroupBy 的示例解析

Pandas是Python中用于数据分析的流行库,GroupBy功能可以按类别分组数据并进行聚合。本文介绍了如何使用GroupBy进行数据汇总,包括创建示例数据集、基本聚合、命名聚合、多列分组、排序、过滤和自定义逻辑等操作。这些技术帮助用户高效分析和总结数据。

Pandas GroupBy 的示例解析

KDnuggets KDnuggets · 2026-05-27T14:00:09Z

Pandas在处理小数据集时表现良好,但在大数据处理上效率低下。Polars是基于Rust的DataFrame库,支持并行计算和延迟评估,显著提高性能。在处理大规模数据时,Polars表现出5-10倍的速度优势,适合数据科学家解决性能问题。

使用Polars替代Pandas:性能深入分析

KDnuggets KDnuggets · 2026-05-12T14:00:13Z

本文讨论了数据科学中使用pandas的最佳实践,重点介绍了方法链、pipe()模式、高效的连接与合并、groupby优化、向量化条件逻辑和性能陷阱。通过避免不必要的中间变量和使用向量化操作,可以提高代码的可读性和执行效率。建议使用transform()替代agg(),并利用np.where()和np.select()进行条件赋值,以提升性能。

大多数数据科学家未使用的高级Pandas模式

KDnuggets KDnuggets · 2026-04-21T14:00:40Z
Python 潮流周刊#147:Python 和 Ruby 的 JIT 故事

本期Python潮流周刊分享了12篇文章和开源项目,重点讨论Python与Ruby的JIT故事、Django ORM解耦、Pandas与Polars的基准测试等技术话题,并介绍了多个AI智能体项目和Python包管理器的安全最佳实践。

Python 潮流周刊#147:Python 和 Ruby 的 JIT 故事

豌豆花下猫 | Python猫 豌豆花下猫 | Python猫 · 2026-04-18T00:00:00Z
第730期:Django类型提示、Python字典、pandas与Polars的比较及更多(2026年4月14日)

Django项目在2026年的类型提示使用较为复杂,因为Django早于Python的类型提示标准化发布。文章探讨了如何在Django中有效应用类型提示,以及相关的安全性和包管理问题。

第730期:Django类型提示、Python字典、pandas与Polars的比较及更多(2026年4月14日)

PyCoder’s Weekly PyCoder’s Weekly · 2026-04-14T19:30:00Z

本文比较了Python中的数据处理库pandas和Polars。Polars在读取CSV文件时速度更快,内存使用更高效,读取速度比pandas快8.2倍,内存使用减少97.1%。Polars语法简洁,支持惰性计算,优化查询性能。尽管pandas用户基础广泛,但对于大规模数据分析,学习Polars是值得的。

Pandas与Polars:语法、速度和内存的全面比较

KDnuggets KDnuggets · 2026-03-05T15:00:58Z
Pandas 3.0引入默认字符串数据类型和写时复制语义

pandas 3.0.0发布,更新了字符串处理、内存语义和日期时间解析,移除过时功能。新版本引入专用字符串dtype,简化缺失值管理,采用写时复制语义,改善索引操作,支持新表达式语法pd.col(),并调整日期时间处理精度。最低要求升级至Python 3.11和NumPy 1.26.0,社区讨论pandas未来及其竞争对手Polars。

Pandas 3.0引入默认字符串数据类型和写时复制语义

InfoQ InfoQ · 2026-02-11T08:40:00Z
Python 潮流周刊#137:Pandas 3.0 发布了

本周精选400+信息源,分享12篇文章和开源项目,涵盖Pandas新特性、Django游戏引擎和Asyncio支持,助力Python技术提升与职业发展。

Python 潮流周刊#137:Pandas 3.0 发布了

豌豆花下猫 | Python猫 豌豆花下猫 | Python猫 · 2026-01-24T00:00:00Z
第718期:pandas 3.0、deque、tprof及更多(2026年1月20日)

Pandas 3.0 引入了 pd.col 表达式、Copy-on-Write 机制和 PyArrow 支持的字符串,性能提升 5-10 倍。Python deque 用于高效管理队列和栈。Anthropic 向 PSF 投资 150 万美元,关注 Python 生态安全。

第718期:pandas 3.0、deque、tprof及更多(2026年1月20日)

PyCoder’s Weekly PyCoder’s Weekly · 2026-01-20T19:30:00Z
演讲:如何构建无服务器数据库

Alex Seaton介绍了如何构建无服务器数据库,使用Python和pandas DataFrames进行数据管理,旨在简化系统、提高读取速度,避免MongoDB的复杂性。通过对象存储实现数据版本控制和一致性,解决了全局状态和冲突解决等数据管理挑战,最终发展出高效的时间序列数据存储解决方案ArcticDB。

演讲:如何构建无服务器数据库

InfoQ InfoQ · 2026-01-07T14:50:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码