实时和离线
原文中文,约3200字,阅读约需8分钟。发表于: 。1.时间的边界 1.1. T+1 时间分两种,处理时间和事件时间。大部分情况,数据处理都会选择事件时间。 以离线的天级 Hive 表任务为例,我们看看是如何产出 T+1 的数据的。 T+1 00:00 是处理时间,假定 A 表 Tday 的数据在 00:05 完全到达,B 表 T-day 的数据在 01:05 完全到达。 数据完全到达后,开始 merge Tday...
文章讨论了离线数据处理的时间边界和调度问题,提出了离线数仓任务的模型和任务调度系统。还讨论了微批处理和流处理的模型变化,以及T+1和流处理任务的调度要求和差异。最后,提出了一套统一开发和管理任务的平台。