Meta的GEM广告推荐模型通过软硬件协同设计,将端到端训练效率提升至20-25% MFU,训练FLOPs一年内增长4倍。核心创新包括定制内核库(如Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练提升计算效率;拓扑感知的5D并行、SM-free通信、自动激活检查点和负载均衡优化扩展效率。这些方法解决了推荐系统与LLM混合架构的独特挑战。
黄仁勋在采访中提到,AI算力集群将扩展至100万芯片,并提出“超级摩尔定律”,预计每年性能提升两到三倍。他强调软硬件协同设计和数据中心创新的重要性,认为AI将推动科学与工程的突破,未来每篇论文都将与AI相关。此外,英伟达正在构建完整的数据中心以支持AI发展。
完成下面两步后,将自动完成登录并继续当前操作。