6GB显存可运行Qwen3.6-35B-A3B-NVFP4,但需32GB以上内存,依赖CPU和PCIe。配置建议:Triton attention、memory-ratio 0.92、Prefill 2048、512专家槽。性能低于8GB的39.3 tok/s,适合短上下文和编码实验。需Ampere架构,逐步调优专家缓存和KV,实测不同后端。
DeepSeek通过系统级创新,用2048块H800和557.6万美元完成训练,成本仅为GPT-4o的二十分之一。它未发明新技术,但优化了MLA压缩KV缓存、MoE专家激活、FP8混合精度训练、DualPipe计算通信重叠等六项技术,显著降低内存和算力消耗,提升效率,突破芯片限制。
上个月,我们发布了迄今为止最大的开源模型K3。作为K2的继任者,K3并不是一次从零开始的重新设计,而是沿着我们过去一系列工作自然演化而来,并融合了我们对效果、效率、稳定性的一些最新理解和改进。可...
Colibri 是一个开源项目,允许普通电脑在仅有 25GB 内存的情况下运行 GLM-5.2 模型,无需 GPU。它通过按需加载模型参数,节省内存和硬盘空间。GLM-5.2 是智谱发布的强大开源模型,支持多种操作系统,但需要 370GB 硬盘。
蚂蚁灵波推出了LingBot-Video,这是全球首个针对具身智能的视频生成模型。该模型专注于生成符合物理规律的视频,帮助机器人理解真实世界的互动。LingBot-Video结合了大量具身数据和互联网视频,通过MoE架构降低计算成本,提升训练效率,应用于机器人动作规划和策略评估,标志着视频生成技术向物理世界模拟器的转变。
英伟达推出NeMo AutoModel,基于Transformers v5,提升MoE模型微调速度3.4-3.7倍,显存减少29%-32%。通过专家并行、DeepEP和TransformerEngine等技术,优化内存和计算效率。用户只需添加一行代码即可实现升级,支持更大批次和更长序列,相关代码已开源。
本文探讨了750B MoE模型从自建RoCE集群迁移至AWS EFA的过程,验证了Prefill-Decode分离推理的通信架构。客户希望利用AWS的弹性算力扩展本地GPU资源,降低硬件风险。通过理论分析和实际测试,比较了AWS EFA与自建RoCE集群的性能,发现EFA在复杂通信负载下表现良好,尽管在某些延迟指标上略逊一筹,但在尾延迟稳定性上有显著优势。整体来看,EFA已可替代RoCE,尤其在对尾延迟敏感的场景中表现出色。
Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升了性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,支持多种应用场景。
Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,适用于多种应用场景。
追溯一下MoE历史,我们都能发现,早些年MoE的Router在作为Gate去乘到Expert上时,基本都是用Softmax激活,直到现在它仍是MoE的标准形式之一。不过,为了配合Loss-Fre...
Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。
KT-FT v0.6.1更新了MoE SFT后端,提升了训练速度和内存使用效率。新版本支持将训练好的适配器无缝集成到SGLang中,并优化了本地服务流程。用户可通过转换脚本将适配器分为专家和非专家LoRA,确保有效运行,目标是实现从本地微调到服务的完整闭环。
到目前为止,“MoE环游记”系列已经写了7篇文章,其中5篇都是围绕着MoE的路由和负载均衡展开的。从路由的形式来看,它们可以分为静态计算和动态计算两类;从实现负载均衡的方法上看,它们又可以分为A...
DeepSeek-V4系列模型推出了1.6T和284B参数的两个版本,采用混合注意力架构和流形约束超连接,提升了长上下文处理效率。通过Muon优化器和多项基础设施优化,模型在训练和推理阶段展现出更高的稳定性和效率。预训练后,DeepSeek-V4在多个基准测试中超越前代,设立了新的性能标准。
2024年,混合专家(MoE)架构成为大模型的主流,开源项目如Mixtral和DeepSeek推动了其发展。MoE通过减少激活参数显著降低计算成本,同时提升模型表达能力,适合算力充裕的场景。关键技术包括细粒度专家、共享专家和改进的负载均衡策略。未来,MoE将向更大规模和动态专家数发展。
OpenMythos是一种新型的循环深度Transformer架构,采用MoE路由机制,通过跨专家权重共享实现高效推理。在参数量减少近一半的情况下,其性能与传统模型相当。研究表明,循环Transformer在处理未见知识组合和深度推理方面表现更佳,可能改变大模型的训练方式,受到学术界关注。
Mistral AI 发布了 Mistral Small 4,具备指令执行、推理和多模态理解功能,支持256k上下文窗口,具有可配置推理强度,提升了推理效率和经济性,适合通用聊天和复杂推理。
本文介绍了Voyage AI在嵌入模型扩展方面的研究,特别是通过混合专家(MoE)架构提高效率。Voyage-4-large模型实现了75%的参数减少,同时保持检索准确率,显著降低计算成本和延迟。MoE模型通过优化设计有效解耦知识容量与计算成本。
上一篇文章《MoE环游记:6、最优分配促均衡》中,我们通过求解如下最优分配问题来实现负载均衡\begin{equation}\max_{x_{i,j}\in\{0,1\}} \sum_{i,j}...
我们知道,负载均衡(Load Balance)是MoE架构中基本且关键的一环,直接影响模型的效率和性能。本系列已经有两篇文章介绍了两种实现负载均衡的主流思路,分别是《MoE环游记:2、不患寡而患...
完成下面两步后,将自动完成登录并继续当前操作。