小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

FireDucks是一个兼容pandas API的编译器加速库,通过惰性执行和多线程优化提升大数据处理性能。基准测试显示,在1000万行数据集上,FireDucks在排序、分组、过滤等七项任务中均快于pandas,速度提升2.66倍至20.77倍,平均7.28倍。安装后仅需替换import语句即可使用,适合大规模数据处理场景。

这个Python库能让Pandas工作负载提速高达20倍

KDnuggets KDnuggets · 2026-09-02T14:00:11Z
从数据到价值:通过真实世界用例理解数据管理 [全书]

数据管理涵盖数据仓库、商业智能、分析型存储、维度建模、指标与KPI、语义层、报表仪表盘、自助分析及大数据架构等技术。通过事实与维度组织数据,语义层统一指标定义,自助分析赋能用户。大数据应对海量数据的规模、速度与多样性,需分布式存储与处理。分析流程包括探索性分析、特征工程、实验与模型就绪数据,最终以数据产品形式交付,并依赖成熟度评估与组织治理。

从数据到价值:通过真实世界用例理解数据管理 [全书]

freeCodeCamp.org freeCodeCamp.org · 2026-08-25T15:50:26Z
大数据技术的演进:从 Hive、GFS 到 Raft

大数据技术经历了从GFS、Hive到Raft的演进。GFS解决了数据存储和容错问题,Hive将SQL转化为分布式计算作业,Raft算法提供了分布式共识机制,确保数据一致性。这些技术的发展逐步解决了数据存储、计算效率和管理问题,奠定了现代大数据架构的基础。

大数据技术的演进:从 Hive、GFS 到 Raft

御坂研究所 御坂研究所 · 2026-07-15T21:30:00Z
粤港澳大湾区大数据研究院词元经济联合创新应用中心在深圳揭牌成立

粤港澳大湾区大数据研究院与迅策科技合作成立了词元经济联合创新应用中心,专注于数据要素、算力经济和人工智能领域,推动项目协同机制,建设数据资产、算力基础设施及AI应用,服务大湾区及全国算力网络。

粤港澳大湾区大数据研究院词元经济联合创新应用中心在深圳揭牌成立

全球TMT-美通国际 全球TMT-美通国际 · 2026-07-03T06:37:02Z
百融智能 x 湖北大数据集团:数据要素价值释放,正在走向结果交付

湖北大数据集团与百融智能近期合作,旨在探索数据要素的价值释放、人工智能应用及产业智能化升级。双方将结合各自优势,推动数据要素从可流通、可计算转向可应用、可产生实际价值。

百融智能 x 湖北大数据集团:数据要素价值释放,正在走向结果交付

mongona news mongona news · 2026-06-23T05:35:37Z

第28期大数据师资培训班将于2026年8月在泉州举行,旨在提升中国高校大数据课程的教学水平。培训内容包括课程知识体系、授课方法和实验环境搭建,帮助教师建立整体认识,促进大数据人才的培养。

第28期大数据师资培训班报名主页(Hadoop+Spark+实战案例班,暑假,泉州,2026年8月6日-13日)

厦大数据库实验室博客 厦大数据库实验室博客 · 2026-06-05T09:05:52Z

DuckDB 是一个适用于 Python 开发者的嵌入式分析数据库,支持直接用 SQL 查询 CSV 和 Parquet 文件,无需加载到内存,安装简单。它提供 SQL API 和 Relational API 两种查询方式,能高效处理大数据集,性能通常比 pandas 快 5 到 15 倍。DuckDB 通过 Apache Arrow 格式实现零拷贝,适合分析聚合任务,最佳实践是结合使用 DuckDB 和 pandas。

读:DuckDB for Python Developers

暗无天日 暗无天日 · 2026-06-03T00:00:00Z
伊丽莎白·加雷特·克里斯滕森:使用Apache AGE在Postgres中进行图形查询

Apache AGE是一个PostgreSQL扩展,支持图形查询,便于处理大数据集。用户可以通过将数据存储在Iceberg表中,创建节点和边,构建图形关系,解决复杂的分析问题,如医疗网络中的转诊链查询。AGE与pg_lake结合,简化了数据访问和分析,提升了查询效率。

伊丽莎白·加雷特·克里斯滕森:使用Apache AGE在Postgres中进行图形查询

Planet PostgreSQL Planet PostgreSQL · 2026-05-27T07:00:00Z
一条短信,把我对“大数据”的认知狠狠干碎了

作者分享了孩子因鼻炎就医后,医生提到甘草片的经历。回家后收到药店关于甘草片的促销短信,令他感到手机可能在监听。尽管检查手机权限未发现异常,但他对智能手机的隐私问题感到不适。

一条短信,把我对“大数据”的认知狠狠干碎了

如有乐享 如有乐享 · 2026-05-18T00:30:28Z

Pandas在处理小数据集时表现良好,但在大数据处理上效率低下。Polars是基于Rust的DataFrame库,支持并行计算和延迟评估,显著提高性能。在处理大规模数据时,Polars表现出5-10倍的速度优势,适合数据科学家解决性能问题。

使用Polars替代Pandas:性能深入分析

KDnuggets KDnuggets · 2026-05-12T14:00:13Z
加一人物系列:让-巴蒂斯特·奥诺弗雷

让-巴蒂斯特·奥诺弗雷(JB)是Apache软件基金会的董事会成员,专注于大数据和分布式系统的架构挑战。他认为AI的崛起为开源带来了机遇,但也面临低质量贡献的挑战。他强调社区优先于代码,并建议新贡献者寻找合适的项目和导师。

加一人物系列:让-巴蒂斯特·奥诺弗雷

The Apache Software Foundation Blog The Apache Software Foundation Blog · 2026-03-31T19:46:16Z
游戏版大数据杀熟?索尼PS游戏商店面向不同用户会提供不同的折扣价格

索尼在PS游戏商店实施动态定价策略,针对不同国家和用户提供5%至17.5%的折扣,导致同款游戏价格差异。这一举措旨在刺激购买,但可能影响用户满意度和品牌声誉。

游戏版大数据杀熟?索尼PS游戏商店面向不同用户会提供不同的折扣价格

蓝点网 蓝点网 · 2026-03-08T08:36:19Z

PL/Python扩展使DWS数据库能够直接使用Python,简化复杂运算和数据处理。通过Fenced模式确保安全性和资源控制,支持Pandas、Numpy等库,提高开发效率,适合AI和大数据应用,为数据仓库提供强大的算法处理能力。

进阶指南:在 DWS 中利用 PL/Python 解锁数据库无限可能

华为云官方博客 华为云官方博客 · 2026-02-10T07:06:58Z
如何优化PySpark作业:理解逻辑计划的实际场景

在大数据时代,性能不仅依赖于集群规模,更在于代码的智能优化。Spark代码易写但难以优化,因其执行与编写的代码存在差异。本文手册指导如何阅读和控制Spark的逻辑计划,以编写高效的PySpark代码,提升数据处理效率,避免不必要的配置调整。

如何优化PySpark作业:理解逻辑计划的实际场景

freeCodeCamp.org freeCodeCamp.org · 2026-02-05T22:45:15Z
在Python中处理十亿行数据集(使用Vaex)

Vaex是一个高性能的Python库,专为处理超大数据集而设计。它通过外存处理和延迟计算,避免将整个数据集加载到内存中,实现快速分析,特别适合处理超过1GB的大数据。

在Python中处理十亿行数据集(使用Vaex)

KDnuggets KDnuggets · 2026-02-02T17:00:24Z
自主大数据优化:多智能体强化学习实现自调节Apache Spark

一款Q学习强化学习代理通过观察数据集特征和实验不同设置,自动优化Spark配置。结合自适应查询执行(AQE)和RL代理,性能优于单独使用。该代理能够处理动态工作负载,优化资源分配,降低云成本,提高查询性能。

自主大数据优化:多智能体强化学习实现自调节Apache Spark

InfoQ InfoQ · 2026-01-30T09:00:00Z
如何在Python中使用ORC文件格式 - 带示例的指南

ORC文件是一种为Hadoop设计的列式存储格式,适合大数据分析。使用Python的PyArrow库,可以高效读取、写入和处理ORC文件,支持压缩和索引,优化查询性能。

如何在Python中使用ORC文件格式 - 带示例的指南

freeCodeCamp.org freeCodeCamp.org · 2026-01-14T01:24:44Z
2026年社区优于代码欧洲大会将在苏格兰格拉斯哥举行

阿帕奇软件基金会将于2026年10月11日至14日在苏格兰格拉斯哥举办“社区优于代码”大会,展示大数据、物联网等多个项目,并提供互动和社区交流机会。

2026年社区优于代码欧洲大会将在苏格兰格拉斯哥举行

The Apache Software Foundation Blog The Apache Software Foundation Blog · 2026-01-13T13:12:43Z
从零开始大数据

大数据技术通过采集、存储和分析海量数据,广泛应用于推荐系统、金融和医疗等领域。其特点包括数据量大、处理速度快、多样性、低价值密度和真实性。大数据技术起源于Google的GFS、MapReduce和BigTable,随后Hadoop和Spark等框架的出现推动了大数据生态的发展。

从零开始大数据

Sekyoro的博客小屋 Sekyoro的博客小屋 · 2026-01-10T07:44:55Z
科幻终端模拟器:黑客风格炫酷狂拽! | 开源日报 No.845

LLMCompiler 是一个支持多种模型的并行函数调用编译器框架,旨在提高效率和降低成本,适合用于创建互动课程,特别适合组织和学校。BigDataView 提供多行业的大数据可视化模板,而 eDEX-UI 是一个可定制的终端模拟器,支持监控和触摸屏功能。

科幻终端模拟器:黑客风格炫酷狂拽! | 开源日报 No.845

开源服务指南 开源服务指南 · 2026-01-09T07:35:55Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码