腾讯AI Gateway现已支持Hy4 Preview模型。该模型为开源混合专家模型,总参数770B,每令牌激活49B,支持100万上下文,适用于长时编码、文档分析、游戏开发及科学推理。用户可通过AI SDK设置模型为tencent/hy4-preview,并接入Claude Code等编码代理。AI Gateway提供统一API、成本追踪、重试及故障转移功能,无加价及平台费。
2026年2月至7月,Opus级AI模型价格暴跌98.5%,从每百万tokens 3.85美元降至0.058美元,降幅达66倍。原因包括混合专家模型、开源竞争、缓存定价和战略降价。实际任务成本受模型输出长度影响,需关注总花费。价格下降使AI从旗舰专属变为基础设施,未来AI团队应混编不同模型,以性价比最优完成工作。
文章讨论了本地运行AI模型时的硬件选择,比较了独立显卡和板载芯片组的优缺点。独立显卡算力强大,但显存不足可能无法运行大型模型;而板载芯片组内存更大,适合处理复杂模型。内存带宽也很重要,建议使用“混合专家模型”以提高效率。
colibri项目通过混合专家模型(MoE)将7440亿参数的AI模型压缩至25GB内存,使其能够在普通游戏本上运行。尽管推理速度较慢,但该项目挑战了传统AI部署观念,展示了普通硬件的潜力,受到社区的赞赏,体现了黑客精神。
本文介绍了Transformer模型的注意力机制及其背景。传统的卷积神经网络(CNN)和循环神经网络(RNN)在处理长距离依赖时存在局限,而Transformer通过自注意力机制解决了这些问题。模型使用位置编码来区分词序,核心是通过Query、Key和Value计算注意力权重。多头注意力允许模型并行处理不同关系,增强表达能力。混合专家模型(MoE)通过选择部分专家参与计算,提高了效率和性能。
DeepSeek正在构建一个价值10万亿美元的中国AI硬件生态系统,目标是实现1万亿美元市值。通过创新的混合专家模型和多项技术,DeepSeek显著降低了AI模型的计算和存储成本,推动国产存储芯片和算力芯片的发展,助力中国在全球AI硬件市场中崛起。
Mistral AI发布了Mistral 3系列模型,优化了NVIDIA平台,支持云到边缘的分布式智能。Mistral Large 3采用混合专家模型,具备41B活跃参数和675B总参数,提供高效能和准确性,适用于企业AI,支持快速部署和定制,推动AI创新。
LongCat-Flash-Chat正式发布并开源,采用混合专家模型架构,参数总量560B,激活参数27B,性能优越且推理速度快,适合复杂智能体应用。评测显示其在智能体工具使用和指令遵循方面表现卓越,支持高效部署,开源地址为GitHub和官网。
OpenAI发布了开源模型GPT-OSS,包含20B和120B两种参数,采用混合专家模型,支持128K的上下文。这一举措加剧了中美AI竞争,展示了不同的开源策略。中国的开源模型如千问和DeepSeek直接开放最新版本,与美国的“开小闭大”策略形成对比。两国在AI领域的博弈将持续,未来发展值得关注。
MoMoE(内存优化的专家混合模型)通过结合Triton内核和优化内存布局,显著提高了混合专家模型的训练和推理速度及内存效率。与现有开源实现相比,MoMoE在前向和反向传递中具有更高的吞吐量和更低的内存消耗,适合大规模训练和推理。该实现允许用户灵活选择内存与计算的权衡,推动了专家混合模型的高效应用。
华为提出OmniPlacement方法,通过优化混合专家模型中的专家分配,降低推理延迟约10%,提升吞吐量。该方法动态调整专家优先级、冗余部署和实时调度,解决专家负载不均的问题,确保高负载下系统稳定运行,并计划开源。
本研究提出了一种测试时间模型合并(TTMM)方法,旨在解决混合专家模型因训练和推理成本高而只能使用少量专家的问题。TTMM显著增加了专家数量,并且测试时间比传统方法快100倍以上,为大规模测试提供了经济有效的解决方案。
NEXA-MOE是一种高效的混合专家模型,参数仅1.1亿,能够在物理、生物和材料科学领域进行假设生成和方法设计。其模块化架构通过智能路由优化资源使用,在有限硬件上实现卓越性能,展示了在资源受限环境中构建高效AI系统的可能性。
本研究提出了Compass-v2,一种轻量级混合专家模型,旨在提升东南亚低资源语言和电子商务领域的模型性能。通过构建高质量数据集,该模型在多语言和电子商务应用中表现优异,并降低了推理成本。
本文提出了一种新的混合专家模型(EC-DIT),通过优化专家选择路由以适应不同文本图像的复杂度。EC-DIT可扩展至970亿参数,显著提升训练收敛性和生成质量,并在文本对齐评估中获得71.68%的最佳GenEval分数。
Llama 4发布了三个版本,支持1,000万TOKEN的长上下文,并采用混合专家模型。尽管中文能力有所提升,但与主流模型相比进步不明显,市场反响平淡。开源模型竞争激烈,千问和DeepSeek等已具备可用性,Meta需寻找新应用场景以保持竞争力。
本研究提出了一种新的混合专家模型框架,通过分段分配嵌入维度来提升计算效率,并提供了在特定架构下识别最佳专家数量的闭式表达式,为大规模模型设计提供指导。
本研究提出了一种新型混合专家模型Race-DiT,采用“专家竞赛”路由策略,动态分配专家以提升扩散模型的性能和扩展性。实验结果表明,该模型在ImageNet数据集上表现优异。
本研究提出了COMET系统,通过数据依赖性分析和任务重调度,优化了混合专家模型在分布式环境中的通信开销,实现了计算与通信的重叠,从而显著加速了模型执行。
MeteoRA是一个高效的多任务嵌入架构,通过LoRA适配器和混合专家模型(MoE)提升大语言模型性能,支持自主选择和切换LoRA适配器,显著增强复合任务处理能力,实验结果显示其在多项任务中表现优异。
完成下面两步后,将自动完成登录并继续当前操作。