Core Automation,由OpenAI前科学家创办,在显存效率上取得重大突破,可能颠覆大模型的算力瓶颈。新算法的优化有望提升显卡使用效率,帮助中小公司降低成本。业内对注意力机制的改进和缓存技术的应用表示关注,若成功,可能导致大厂硬件贬值。尽管存在质疑,AI行业对这种创新充满期待。
本研究提出了一种新的混合查找专家架构(MoLE),旨在解决混合专家模型在推理时对大量专家的依赖问题。MoLE通过重参数化专家为查找表,提高了通信和显存效率。实验结果表明,MoLE的推理速度与稠密模型相当,且显著快于传统的混合专家模型,同时保持了性能水平。
完成下面两步后,将自动完成登录并继续当前操作。