Kimi K3采用KDA与MLA混合注意力架构,引入循环状态缓存,改变传统KV缓存语义。Mooncake与SGLang、vLLM、TokenSpeed合作,实现KDA感知的检查点管理、跨实例缓存复用及统一数据传输平面,支持百万级长上下文推理,降低冗余计算,提升多轮对话和智能体任务效率。
智谱AI推出新模型GLM-4.7-Flash,参数300亿,激活仅30亿,适用于本地编程和智能助手。该模型在代码修复测试中表现优异,支持200K上下文窗口,兼容多平台,并可在苹果M5上运行。API免费开放,具备创意写作和翻译功能。
DeepSeek-V3.2引入了稀疏注意力机制(DSA),优化了长文本处理的效率。通过闪电索引器和细粒度选择机制,DSA减少了计算量并提升了模型性能。该版本在持续预训练和后训练中结合专家蒸馏和强化学习,显著提高了推理效率和稳定性。
在文章《Transformer升级之路:20、MLA好在哪里?(上)》中,我们对MLA相比常见MHA、GQA、MQA的一些变化分别做了消融实验,其中的变化包括“增大head_dims”、“Par...
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
多头潜在注意力(MLA)是一种新型注意力机制,旨在降低计算成本和内存使用。通过低秩近似,将大矩阵分解为两个小矩阵,从而提高推理速度。MLA在推理时使用共享的压缩矩阵优化计算,且在模型质量和推理速度上优于传统多头注意力。
ResearchWize是一款AI学术助手,简化引用过程,支持MLA和APA格式,自动生成引用,组织研究材料,节省时间,提高准确性,帮助学生专注于学习。
本文总结了MHA、GQA、MQA和MLA等注意力结构的源码及其演变过程,涵盖多头注意力、前馈神经网络和层归一化等实现细节。
PLM团队开发了一种新型边缘设备语言模型,结合MLA注意力机制和ReLU²激活函数,优化了计算效率和内存使用。该模型在多项任务中表现优异,适配多种硬件,展现出高效、低延迟的性能,推动了边缘设备AI应用的发展。
本文概述了AWS考试相关的服务和功能,涵盖分析、应用集成、云财务管理、计算、容器、数据库、开发工具、机器学习、管理与治理、媒体、迁移与传输、网络与内容交付、安全、身份与合规、存储等多个类别,并指出了一些不在考试范围内的服务。
复旦NLP实验室的纪焘博士后研究了如何高效地将基于多头自注意力(MHA)的大语言模型迁移至多头潜在注意力(MLA)架构,提出了MHA2MLA框架。该框架通过部分RoPE保留和低秩近似,显著降低推理成本,仅需0.3%至0.6%的预训练数据,兼容现有技术,为资源高效的LLMs部署提供新路径。
FlashMLA是DeepSeek开发的多层注意力解码内核,专为NVIDIA Hopper GPU优化,提升大语言模型性能。支持BF16、分页KV缓存和可变长度序列,适用于医疗和金融行业。代码开源,促进AI技术合作与创新。
DeepSeek推出开源项目Flash MLA,旨在优化英伟达H系列芯片性能。该项目采用MIT协议,通过分页式间值缓存、BF16精度和并行计算提升效率。尽管短期影响有限,但在中国出口限制背景下,可能对英伟达市场造成压力。
本文介绍了Open R1的开源内容及其复现R1训练流程的过程,包括GRPO实现、数据生成和评估。OpenR1-Math-220k数据集生成了22万条高质量数学推理数据,提升了模型性能。通过改进验证工具和使用奖励模型,确保了数据质量和推理能力。
本文探讨了DeepSeek从教育向科技转型的过程,重点关注V3和R1模型的开源内容及复现问题。尽管V3未开源核心训练数据,但仍具科研价值。Open R1复现了R1的前两个训练阶段,并提供相关代码和实现细节,以帮助更多人理解和应用这些技术。
我于1月29日参加了AWS Certified Machine Learning Engineer - Associate考试,但未能通过。尽管1月9日已通过AWS Certified AI Practitioner,但对Machine Learning Engineer的知识准备不足,导致不合格。考试难度较高,需要掌握实际应用知识。我希望在2月15日前再次挑战,以获得Early Adopter数字徽章。
DeepSeek V3将于2024年12月发布,凭借1/14的算力超越Llama 3.1 405B,采用多头潜在注意力和负载平衡策略,训练成本仅为558万美元,展现了国内AI领域的创新能力。
本文介绍了DeepSeek-V2中的MHA创新点,包括MLA降低KV Cache开销,FFN结构改为DeepseekMoE,以及MLA对Query和Key的压缩和RoPE编码。
完成下面两步后,将自动完成登录并继续当前操作。