内容提要
NBCUniversal与Databricks及EXL合作,迁移至统一数据智能平台,采用job-specific计算和Delta Lake架构,实现数据基础设施现代化。此举降低30%成本,支持300名分析师,提升弹性扩展和ML能力,加速决策,增强竞争优势。
延伸解读
迁移策略:分阶段与并行验证
NBCUniversal的迁移并非一蹴而就,而是采用分阶段、风险优先的策略。先通过MVP验证方法,并开发了四个自动化加速器(SQL翻译、编排迁移、数据传输、验证框架),将数月手工工作转化为自动化流程。迁移按波次进行,优先处理高价值、低复杂度的管道,并在最终切换前并行运行两套平台数周,对比输出结果,确保一致性后才逐步退役旧系统。这种谨慎的迁移方式降低了业务中断风险,值得类似规模企业借鉴。
成本降低的关键:任务级计算
NBCUniversal实现30%成本削减的核心在于采用Databricks的任务级计算(job-specific compute)。相比原有的槽位预留模式,每个数据管道运行在专用计算资源上,可根据负载独立伸缩,避免了高峰期的资源争用和低峰期的槽位浪费。这种精细化的计算资源控制,不仅降低了成本,还提升了弹性,使得在大型活动期间能动态扩容而不影响其他工作负载。对于依赖波峰波谷工作负载的企业,这种模式具有显著的成本优势。
统一平台带来的组织变革
迁移至Databricks不仅带来技术和成本效益,还催化了组织文化的转变。统一平台消除了数据工程、数据科学和商业智能之间的工具壁垒,使得约300名分析师能快速上手,通过Databricks SQL的ANSI SQL兼容性轻松进行查询和仪表盘创建。同时,MLflow和Lakeflow Jobs的集成简化了机器学习生命周期管理,让团队更专注于业务问题而非基础设施。这种平台统一促进了跨团队协作,增强了数据驱动决策的文化。
Q&A
NBCUniversal为什么决定迁移到Databricks平台?
NBCUniversal迁移到Databricks是因为其原有数据架构难以应对数据量增长和高级分析需求,存在计算成本高、资源争用等问题,且希望获得更好的灵活性、支持机器学习以及增强数据治理能力。
NBCUniversal迁移到Databricks后取得了哪些具体成果?
迁移后,NBCUniversal实现了数据基础设施成本降低30%,约300名分析师顺利过渡到Databricks SQL,获得了弹性扩展能力以应对高流量事件,并通过MLflow和Lakeflow Jobs实现了统一的机器学习和分析。
NBCUniversal在迁移过程中使用了哪些加速工具?
EXL为NBCUniversal开发了四个专有加速器:SQL转换引擎、编排迁移器、数据传输编排器和验证框架。这些工具自动化了代码转换、工作流迁移、数据迁移和结果验证,大大加快了迁移进程。
NBCUniversal如何确保迁移过程中业务不中断?
NBCUniversal采用了分阶段迁移和并行运行策略。他们先进行MVP试点,然后按风险排序分批迁移,最后在切换前并行运行新旧平台数周,对比输出结果,确保一致性后才逐步停用旧系统。
Databricks的job-specific compute如何帮助NBCUniversal节省成本?
Databricks的job-specific compute允许每个数据管道在专用计算资源上运行,独立扩展,避免了共享槽位的资源争用和预保留槽位的浪费,从而实现了30%的成本降低。
NBCUniversal迁移后获得了哪些新的分析能力?
迁移后,NBCUniversal获得了统一的机器学习操作(通过MLflow),包括实验跟踪和模型版本管理,以及通过Lakeflow Jobs实现的工作流自动化标准化,还支持更灵活的数据处理和分析。
NBCUniversal的迁移项目涉及哪些合作伙伴?
NBCUniversal与Databricks和EXL合作。Databricks提供数据智能平台,EXL作为全球咨询公司提供迁移专业知识和加速工具。
NBCUniversal如何实现弹性扩展以应对高流量事件?
通过Databricks的job-specific compute,NBCUniversal可以在高流量事件(如内容发布或颁奖典礼)期间动态扩展作业集群容量,而不会影响其他工作负载,也无需预保留槽位,从而避免了资源浪费。