开发者用C99编写推理引擎,在无GPU、仅8.24GB内存的CPU上成功运行Kimi K3模型,速度33秒/Token;内存增至128GB时提速至20秒/Token,但已达上限。该引擎按需从NVMe读取专家权重,采用4-bit格式,验证了超大规模模型在低内存设备上的可行性,并已开源。
LoRA-FA是一种低内存权重更新方法,专为大型语言模型的微调设计,具有高准确性和低内存使用。通过低秩适应和量化技术,显著减少可训练参数,提高训练效率。研究表明,LoRA微调模型在多个任务上优于基准模型,并开发了支持多模型推理的LoRAX服务器,提升了质量和成本效益。
完成下面两步后,将自动完成登录并继续当前操作。