小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

蚂蚁集团研发的统一宽表系统OmniTable获VLDB 2026工业赛道最佳论文。该系统管理超35PB、3050亿条大模型训练数据,通过逻辑统一、物理分离设计,将数据批次和特征列作为一等对象,简化数据定位、特征回刷和结果追溯。实际应用中,SFT数据准备周期从14天缩短至2.5天,手工步骤减少73.3%,显著提升数据工程效率。

还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

量子位 量子位 · 2026-09-02T06:20:17Z
从本地IDE运行、调试和扩展Databricks工作负载

Databricks 推出新功能,允许用户通过SSH隧道将本地VS Code、Cursor或终端连接到Databricks计算资源,实现远程运行、调试Python和SQL工作负载,并保持依赖同步。支持Serverless、AI Runtime和专用集群,兼容Cursor、Copilot等编码代理。用户可通过CLI命令或IDE扩展快速启动,提升数据工程和机器学习开发效率。

从本地IDE运行、调试和扩展Databricks工作负载

Databricks Databricks · 2026-08-24T17:01:08Z
AI-DLC 在数据工程中的实践:从分层建模到数据质量的全流程协作

本文介绍亚马逊云科技提出的AI-DLC开发方法论在数据工程中的实践。AI-DLC强调AI执行、人做关键决策,通过Inception、Construction、Operations三阶段及Human Gate审查节点,应用于dbt分层建模和数据质量管理。实战显示,该方法将需求到规格时间从数天缩短至数小时,提升测试覆盖率,实现隐性知识显性化,带来工程纪律的系统性升级。

AI-DLC 在数据工程中的实践:从分层建模到数据质量的全流程协作

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-21T07:46:31Z
令人印象深刻的AI演示已死。实际上,什么才会进入生产阶段

许多工程团队能够展示AI原型,但在实际生产中面临数据收集和解析的困难。研究显示,32%的组织在生产中使用自主AI,数据基础设施和质量是主要障碍。IT领导者指出,实时数据处理基础设施不足和相关技能短缺是AI应用的主要挑战。成功的组织重视数据工程,构建实时数据管道,以确保数据的可靠性和时效性。

令人印象深刻的AI演示已死。实际上,什么才会进入生产阶段

The New Stack The New Stack · 2026-07-11T16:00:00Z
现代数据工程的DataOps策略

DataOps将DevOps原则应用于数据管道,以加速交付和提高数据质量。通过自动化数据工作流和促进跨职能团队协作,DataOps持续改进数据质量,强调将数据视为产品,推动快速迭代和反馈,显著降低数据停机时间和运营成本。实施DataOps的组织报告数据停机事件减少高达99%。

现代数据工程的DataOps策略

Databricks Databricks · 2026-06-22T19:38:25Z
通过Amazon SageMaker Unified Studio 现代化金融分析

Avanse金融服务公司通过迁移到Amazon SageMaker Unified Studio,整合了数据工程、分析和人工智能工作流,解决了与外部分析应用的五个主要问题。新架构直接查询Amazon S3中的数据,消除了数据同步瓶颈,降低了许可和存储成本,提高了报告生成效率,并加强了合规性和治理。

通过Amazon SageMaker Unified Studio 现代化金融分析

AWS Architecture Blog AWS Architecture Blog · 2026-06-22T16:42:55Z
人工智能的数据工程:数据专业人士的实用指南

数据工程在人工智能中扮演着重要角色,涉及数据管道构建、特征工程和合规性。数据工程师需确保数据质量,以支持AI模型的训练与部署。AI驱动的自动化提高了数据处理效率,但也带来了数据质量和可扩展性挑战。生成式AI能够生成合成数据,帮助解决训练数据不足的问题。数据工程师需与数据科学家紧密合作,确保数据的可靠性和合规性,以推动AI项目的成功。

人工智能的数据工程:数据专业人士的实用指南

Databricks Databricks · 2026-06-18T08:03:49Z
Lakeflow:智能数据工程的新纪元

Databricks推出Lakeflow平台,整合数据工程、人工智能和应用,简化数据处理。新功能包括Genie Code和Lakeflow Designer,支持无代码构建ETL管道。Genie ZeroOps监控数据资产并自动修复问题。Lakeflow Connect扩展支持100多个连接器,简化数据摄取。Zerobus Ingest实现高吞吐量数据传输,降低延迟。Lakeflow Jobs优化数据管道调度,提升处理效率。

Lakeflow:智能数据工程的新纪元

Databricks Databricks · 2026-06-16T12:45:00Z
为MHHS扩展:Octopus Energy如何在边际数据工程中实现50倍的成本降低

Octopus Energy通过重新架构数据管道,成功应对数据量增加48倍的挑战,降低了50倍的成本。新系统优化了数据处理流程,符合市场半小时结算(MHHS)要求,提升了结算和定价效率,同时增强了能源使用的智能化和可持续性。

为MHHS扩展:Octopus Energy如何在边际数据工程中实现50倍的成本降低

Databricks Databricks · 2026-05-23T00:40:09Z

本文介绍了十个有用的Python库,帮助数据工程师提高工作效率。这些库包括:Prefect(工作流管理)、SQLMesh(SQL转换)、dlt(数据摄取)、Bytewax(实时流处理)、PySpark(分布式批处理)、Great Expectations(数据质量验证)、Pandera(模式强制)、DuckDB(内嵌分析查询)、Polars(高性能数据框转换)和Ibis(后端无关的数据转换)。

2026年数据工程十大Python库

KDnuggets KDnuggets · 2026-05-19T12:00:04Z
AI 驱动的大数据工程:从平台驱动到 AIDLC 的范式迁移

数据工程正在从“平台驱动”向“AI驱动”的AIDLC范式转型。这一转型改变了控制面、开发模式和质量保障,强调知识资产和声明式开发。AI作为协作者参与整个开发生命周期,提高团队生产力。企业可通过成熟度模型和实施建议逐步实现这一转型,提升数据处理效率和质量。

AI 驱动的大数据工程:从平台驱动到 AIDLC 的范式迁移

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-05-08T02:13:16Z
数据科学与数据工程:选择分析还是基础设施

数据工程师和数据科学家在数据处理中的角色不同。数据工程师负责构建和维护数据基础设施,确保数据的可靠流动和存储;数据科学家则分析数据,生成预测模型和商业洞察。两者需紧密合作,数据工程师提供清洁数据,数据科学家利用这些数据进行分析。随着对数据基础设施和AI支持的需求增加,这两个角色的就业前景乐观。

数据科学与数据工程:选择分析还是基础设施

Databricks Databricks · 2026-05-01T10:45:54Z

Zero To Mastery(ZTM)在4月30日至5月10日提供167门免费课程,涵盖Python、AI工程、数据工程等,适合希望转行的学生。课程更新及时,加入社区可获得支持和指导,无需信用卡。

免费学习最受欢迎的技术技能

KDnuggets KDnuggets · 2026-04-30T17:00:00Z
使用 Genie Code 和 Lakeflow 的自主数据工程

Genie Code 是一种数据工程工具,允许工程师通过自然语言生成数据管道,简化开发、调度和故障调试。它能将原本需要数周的任务缩短至数小时,并确保符合治理标准。未来将推出 AI 优化工作负载,进一步提升效率。

使用 Genie Code 和 Lakeflow 的自主数据工程

Databricks Databricks · 2026-04-28T15:00:00Z

大模型训练应视为流水线,分为数据工程、预训练、中训、微调和对齐等阶段。每个环节有不同的算力需求和挑战,数据质量至关重要。预训练需处理大量干净数据以确保模型稳定性,中训通过调整数据配比提升能力,微调教会模型理解指令,对齐阶段则使用多种算法优化模型表现。整体训练过程复杂,需关注数据、算力和工程细节。

【大模型基础设施工程】05:训练全景:Pre-train、SFT、RLHF、DPO、蒸馏

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z
数据编排:DataOps的核心支柱

本文介绍了数据工程团队在从POC到POV转型中的挑战,以及如何通过DataOps和数据编排来构建下一代数据平台。企业应考虑数据工程和DataOps原则,以提高流程规范性和效率。

数据编排:DataOps的核心支柱

BMC Software | Blogs BMC Software | Blogs · 2026-03-30T08:08:02Z

最近,Snowflake举办了一场研讨会,教授如何使用动态表创建声明式数据管道。与传统ETL流程相比,声明式方法简化了数据转换,减轻了开发者的认知负担。研讨会包括六个模块,强调自动依赖管理、数据质量集成和内置可视化等优势,使数据工程师能更专注于数据建模和业务逻辑,提升数据处理效率。

使用Snowflake动态表构建声明式数据管道:研讨会深入探讨

KDnuggets KDnuggets · 2026-03-25T15:11:42Z
前Snowflake工程师指出数据工程中的盲点——因此他们创建了Tower来解决这个问题

Tower是一家由前Snowflake工程师创立的初创公司,获得640万美元融资,旨在简化Python数据管道的部署与管理。该平台为中型企业和小型数据团队提供托管环境,使开发者无需管理底层基础设施即可在生产环境中运行数据应用,解决了传统数据基础设施的复杂性问题。

前Snowflake工程师指出数据工程中的盲点——因此他们创建了Tower来解决这个问题

The New Stack The New Stack · 2026-03-15T14:00:36Z
数据工程的演变:无服务器计算如何改变笔记本、Lakeflow作业和Spark声明式管道

Databricks的无服务器计算通过自动优化和智能基础设施选择,提高了数据工程的效率和成本效益。新功能帮助团队节省时间和成本,简化基础设施管理,自动处理版本升级和资源配置,使用户能够专注于数据产品和业务价值。

数据工程的演变:无服务器计算如何改变笔记本、Lakeflow作业和Spark声明式管道

Databricks Databricks · 2026-03-12T15:00:00Z
迁移新功能:更快且更可预测

Lakebridge帮助数据工程师简化遗留数据仓库迁移,提供自动化和可预测的流程。新功能包括全面评估、AI驱动的SQL转换和用户引导体验,减少不确定性,提高迁移效率,帮助团队更快、更准确地完成迁移。

迁移新功能:更快且更可预测

Databricks Databricks · 2026-03-05T00:41:31Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码