小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
大数据技术的演进:从 Hive、GFS 到 Raft

大数据技术经历了从GFS、Hive到Raft的演进。GFS解决了数据存储和容错问题,Hive将SQL转化为分布式计算作业,Raft算法提供了分布式共识机制,确保数据一致性。这些技术的发展逐步解决了数据存储、计算效率和管理问题,奠定了现代大数据架构的基础。

大数据技术的演进:从 Hive、GFS 到 Raft

御坂研究所
御坂研究所 · 2026-07-15T21:30:00Z
粤港澳大湾区大数据研究院词元经济联合创新应用中心在深圳揭牌成立

粤港澳大湾区大数据研究院与迅策科技合作成立了词元经济联合创新应用中心,专注于数据要素、算力经济和人工智能领域,推动项目协同机制,建设数据资产、算力基础设施及AI应用,服务大湾区及全国算力网络。

粤港澳大湾区大数据研究院词元经济联合创新应用中心在深圳揭牌成立

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-03T06:37:02Z
百融智能 x 湖北大数据集团:数据要素价值释放,正在走向结果交付

湖北大数据集团与百融智能近期合作,旨在探索数据要素的价值释放、人工智能应用及产业智能化升级。双方将结合各自优势,推动数据要素从可流通、可计算转向可应用、可产生实际价值。

百融智能 x 湖北大数据集团:数据要素价值释放,正在走向结果交付

mongona news
mongona news · 2026-06-23T05:35:37Z

第28期大数据师资培训班将于2026年8月在泉州举行,旨在提升中国高校大数据课程的教学水平。培训内容包括课程知识体系、授课方法和实验环境搭建,帮助教师建立整体认识,促进大数据人才的培养。

第28期大数据师资培训班报名主页(Hadoop+Spark+实战案例班,暑假,泉州,2026年8月6日-13日)

厦大数据库实验室博客
厦大数据库实验室博客 · 2026-06-05T09:05:52Z

DuckDB 是一个适用于 Python 开发者的嵌入式分析数据库,支持直接用 SQL 查询 CSV 和 Parquet 文件,无需加载到内存,安装简单。它提供 SQL API 和 Relational API 两种查询方式,能高效处理大数据集,性能通常比 pandas 快 5 到 15 倍。DuckDB 通过 Apache Arrow 格式实现零拷贝,适合分析聚合任务,最佳实践是结合使用 DuckDB 和 pandas。

读:DuckDB for Python Developers

暗无天日
暗无天日 · 2026-06-03T00:00:00Z
伊丽莎白·加雷特·克里斯滕森:使用Apache AGE在Postgres中进行图形查询

Apache AGE是一个PostgreSQL扩展,支持图形查询,便于处理大数据集。用户可以通过将数据存储在Iceberg表中,创建节点和边,构建图形关系,解决复杂的分析问题,如医疗网络中的转诊链查询。AGE与pg_lake结合,简化了数据访问和分析,提升了查询效率。

伊丽莎白·加雷特·克里斯滕森:使用Apache AGE在Postgres中进行图形查询

Planet PostgreSQL
Planet PostgreSQL · 2026-05-27T07:00:00Z
一条短信,把我对“大数据”的认知狠狠干碎了

作者分享了孩子因鼻炎就医后,医生提到甘草片的经历。回家后收到药店关于甘草片的促销短信,令他感到手机可能在监听。尽管检查手机权限未发现异常,但他对智能手机的隐私问题感到不适。

一条短信,把我对“大数据”的认知狠狠干碎了

如有乐享
如有乐享 · 2026-05-18T00:30:28Z

Pandas在处理小数据集时表现良好,但在大数据处理上效率低下。Polars是基于Rust的DataFrame库,支持并行计算和延迟评估,显著提高性能。在处理大规模数据时,Polars表现出5-10倍的速度优势,适合数据科学家解决性能问题。

使用Polars替代Pandas:性能深入分析

KDnuggets
KDnuggets · 2026-05-12T14:00:13Z
加一人物系列:让-巴蒂斯特·奥诺弗雷

让-巴蒂斯特·奥诺弗雷(JB)是Apache软件基金会的董事会成员,专注于大数据和分布式系统的架构挑战。他认为AI的崛起为开源带来了机遇,但也面临低质量贡献的挑战。他强调社区优先于代码,并建议新贡献者寻找合适的项目和导师。

加一人物系列:让-巴蒂斯特·奥诺弗雷

The Apache Software Foundation Blog
The Apache Software Foundation Blog · 2026-03-31T19:46:16Z
游戏版大数据杀熟?索尼PS游戏商店面向不同用户会提供不同的折扣价格

索尼在PS游戏商店实施动态定价策略,针对不同国家和用户提供5%至17.5%的折扣,导致同款游戏价格差异。这一举措旨在刺激购买,但可能影响用户满意度和品牌声誉。

游戏版大数据杀熟?索尼PS游戏商店面向不同用户会提供不同的折扣价格

蓝点网
蓝点网 · 2026-03-08T08:36:19Z

PL/Python扩展使DWS数据库能够直接使用Python,简化复杂运算和数据处理。通过Fenced模式确保安全性和资源控制,支持Pandas、Numpy等库,提高开发效率,适合AI和大数据应用,为数据仓库提供强大的算法处理能力。

进阶指南:在 DWS 中利用 PL/Python 解锁数据库无限可能

华为云官方博客
华为云官方博客 · 2026-02-10T07:06:58Z
如何优化PySpark作业:理解逻辑计划的实际场景

在大数据时代,性能不仅依赖于集群规模,更在于代码的智能优化。Spark代码易写但难以优化,因其执行与编写的代码存在差异。本文手册指导如何阅读和控制Spark的逻辑计划,以编写高效的PySpark代码,提升数据处理效率,避免不必要的配置调整。

如何优化PySpark作业:理解逻辑计划的实际场景

freeCodeCamp.org
freeCodeCamp.org · 2026-02-05T22:45:15Z
在Python中处理十亿行数据集(使用Vaex)

Vaex是一个高性能的Python库,专为处理超大数据集而设计。它通过外存处理和延迟计算,避免将整个数据集加载到内存中,实现快速分析,特别适合处理超过1GB的大数据。

在Python中处理十亿行数据集(使用Vaex)

KDnuggets
KDnuggets · 2026-02-02T17:00:24Z
自主大数据优化:多智能体强化学习实现自调节Apache Spark

一款Q学习强化学习代理通过观察数据集特征和实验不同设置,自动优化Spark配置。结合自适应查询执行(AQE)和RL代理,性能优于单独使用。该代理能够处理动态工作负载,优化资源分配,降低云成本,提高查询性能。

自主大数据优化:多智能体强化学习实现自调节Apache Spark

InfoQ
InfoQ · 2026-01-30T09:00:00Z
如何在Python中使用ORC文件格式 - 带示例的指南

ORC文件是一种为Hadoop设计的列式存储格式,适合大数据分析。使用Python的PyArrow库,可以高效读取、写入和处理ORC文件,支持压缩和索引,优化查询性能。

如何在Python中使用ORC文件格式 - 带示例的指南

freeCodeCamp.org
freeCodeCamp.org · 2026-01-14T01:24:44Z
2026年社区优于代码欧洲大会将在苏格兰格拉斯哥举行

阿帕奇软件基金会将于2026年10月11日至14日在苏格兰格拉斯哥举办“社区优于代码”大会,展示大数据、物联网等多个项目,并提供互动和社区交流机会。

2026年社区优于代码欧洲大会将在苏格兰格拉斯哥举行

The Apache Software Foundation Blog
The Apache Software Foundation Blog · 2026-01-13T13:12:43Z
从零开始大数据

大数据技术通过采集、存储和分析海量数据,广泛应用于推荐系统、金融和医疗等领域。其特点包括数据量大、处理速度快、多样性、低价值密度和真实性。大数据技术起源于Google的GFS、MapReduce和BigTable,随后Hadoop和Spark等框架的出现推动了大数据生态的发展。

从零开始大数据

Sekyoro的博客小屋
Sekyoro的博客小屋 · 2026-01-10T07:44:55Z
科幻终端模拟器:黑客风格炫酷狂拽! | 开源日报 No.845

LLMCompiler 是一个支持多种模型的并行函数调用编译器框架,旨在提高效率和降低成本,适合用于创建互动课程,特别适合组织和学校。BigDataView 提供多行业的大数据可视化模板,而 eDEX-UI 是一个可定制的终端模拟器,支持监控和触摸屏功能。

科幻终端模拟器:黑客风格炫酷狂拽! | 开源日报 No.845

开源服务指南
开源服务指南 · 2026-01-09T07:35:55Z
强大的数据分析工具:轻松处理、转换、可视化 | 开源日报 No.833

Blaze 是一个扩展 NumPy 和 Pandas 接口的大数据工具,支持多种后端,便于数据查询和转换。WebGPT 在浏览器中运行 GPT 模型,支持高达 500M 参数的模型。ai-exploits 收集机器学习工具的漏洞,帮助安全专家识别脆弱性。Pandas 是强大的数据分析库,支持灵活的数据处理和统计功能。

强大的数据分析工具:轻松处理、转换、可视化 | 开源日报 No.833

开源服务指南
开源服务指南 · 2025-12-26T07:35:39Z
即使是初学者也能在Python中处理大数据集的方法

使用Python处理大数据集不需要高级技能。通过分块读取、选择特定列和优化数据类型等技术,可以有效管理超出内存限制的数据集,适合初学者,提高数据处理效率。

即使是初学者也能在Python中处理大数据集的方法

KDnuggets
KDnuggets · 2025-12-17T15:23:55Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码