Flink 流批一体在模型特征场景的使用
原文中文,约5600字,阅读约需14分钟。
📝
内容提要
本文总结了B站资深开发工程师张杨在Flink Forward Asia 2023中的分享,包括模型特征场景、流批一体、性能优化和未来展望。
❓
Q&A
Flink流批一体的主要优势是什么?
Flink流批一体方案通过兼容实时和离线场景,减少了用户的重复开发工作,并优化了资源调度,提高了计算效率。
B站在特征计算中使用了哪些技术?
B站在特征计算中使用了Kafka进行实时数据流处理,Flink进行实时特征计算,Spark进行离线特征计算。
流批一体方案如何解决计算一致性问题?
流批一体方案通过Flink 1.15版本的兼容性优化,减少了实时和离线计算结果之间的差异,提升了计算一致性。
在性能优化方面,B站做了哪些改进?
B站通过采用Apache Celeborn Shuffle替代Netty Shuffle,优化了Shuffle性能,并进行了调度器的拆分以满足不同资源需求。
流批一体方案对资源调度有什么影响?
流批一体方案通过错峰资源利用和K8S集群的优化,提高了资源利用率,确保了流和批任务的高效调度。
未来B站在流批一体方面有哪些展望?
未来B站希望探索更多特征场景的流批一体,提升特征样本计算性能,并支持更多引擎的UDF。
🏷️