本文介绍IBM研究团队将CUDA内核优化知识自动迁移至Apple Silicon的MLX框架。他们扩展K-Search进化搜索框架,通过概念映射表将CUDA优化策略转化为MLX/Metal原生策略,在注意力内核上达到0.97倍原生性能,在Mamba SSM内核上实现20倍预填充加速,展示了跨硬件优化知识迁移的可行性。
完成下面两步后,将自动完成登录并继续当前操作。