小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。

Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:40:00Z
localStorage挑战数据库:谁在引领开发新趋势!

localStorage与数据库之争引发热议。前者免费、快速,适合单机工具,但容量小、数据易失、安全性弱;后者支持多用户、同步和事务,成本高。争论本质是场景错位,技术选型应权衡需求,混合架构或为趋势,无万能方案。

localStorage挑战数据库:谁在引领开发新趋势!

极道 极道 · 2026-08-15T22:59:00Z

Transformer 将进化为混合架构,结合注意力机制、长程状态和外部记忆等模块,以更高效地处理信息并支持多模态输入。硬件发展将影响架构设计,评估方式将变得复杂,强调系统协作和可控性。理解 Transformer 的成功在于其抽象层次和应对未来挑战的能力。

【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文介绍状态空间模型(SSM)如何通过固定大小状态压缩历史,解决Transformer长序列瓶颈。S4用HiPPO矩阵实现长程记忆,Mamba引入选择性机制按内容更新状态,并用并行扫描保持训练效率。推理时SSM显存O(1)优于KV Cache,但在精确检索任务上受容量限制。SSD揭示SSM与注意力对偶,混合架构如Jamba平衡两者优势。

【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文综述了线性注意力、RWKV和RetNet三种将Transformer复杂度从O(n²)降至O(n)的路径。它们用固定状态替代完整注意力,但存在表达力短板:关联检索任务需更大维度或数据依赖门控。理论复杂度不等于实际吞吐,需I/O感知kernel优化。这些模型各有取舍,混合架构或更接近实用。

【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨了企业级AI聊天机器人的构建挑战,指出通用LLM在上下文限制、长尾信息利用和幻觉方面存在不足。作者提出混合架构方案:结合RAG(检索增强生成)提供事实依据,以及通过LoRA微调Qwen模型来规范回答风格和推理。实验表明,单独使用RAG或微调各有缺陷,而两者结合能显著提升事实准确性和语气一致性,实现安全、精准且可控的响应。

超越机器人:用混合AI架构重新思考AI支持

KDnuggets KDnuggets · 2026-08-06T16:00:53Z
GEM训练:Meta如何将其LLM规模广告基础模型的效率提升一倍

Meta的GEM广告推荐模型通过软硬件协同设计,将端到端训练效率提升至20-25% MFU,训练FLOPs一年内增长4倍。核心创新包括定制内核库(如Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练提升计算效率;拓扑感知的5D并行、SM-free通信、自动激活检查点和负载均衡优化扩展效率。这些方法解决了推荐系统与LLM混合架构的独特挑战。

GEM训练:Meta如何将其LLM规模广告基础模型的效率提升一倍

Engineering at Meta Engineering at Meta · 2026-08-03T18:00:17Z
英伟达如何构建面向AI时代的开放模型

英伟达不仅是GPU供应商,还是全球最大的开源AI模型发布者,覆盖推理、物理AI、机器人、医疗、自动驾驶等领域。其模型采用混合架构(Mamba+注意力)和MoE提升效率,并与自家GPU协同设计。英伟达开源模型、数据及训练方法,旨在推动AI生态发展,吸引更多客户使用其算力,并认为开放能促进安全与创新。

英伟达如何构建面向AI时代的开放模型

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-07-27T15:01:46Z
深入解析Roblox对世界模型的押注

Roblox采用混合架构,将游戏引擎与视频世界模型结合,实现照片级真实感。引擎负责世界一致性、规则和物理,模型负责生成精细纹理和光照。通过自强制、边缘GPU和上下文扩展解决延迟、一致性和多人问题。目标是让小型创作者也能制作高质量游戏,早期版本预计今年或明年初推出。

深入解析Roblox对世界模型的押注

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-07-21T14:30:48Z
体育赛事直播中的 CDN 和 RTC 直播有什么区别

CDN直播和RTC直播是两种不同的直播架构。CDN适合大规模分发,延迟为3-10秒,适用于大型赛事;RTC则为实时互动设计,延迟为200毫秒-1秒,适合在线教育和互动带货。在选择方案时,需要考虑观众接受的延迟、并发规模和预算。混合架构结合了两者的优点,成为主流选择。

体育赛事直播中的 CDN 和 RTC 直播有什么区别

实时互动网 实时互动网 · 2026-06-26T09:32:49Z
代理工作流与自主代理:有什么区别?

本文探讨了“代理工作流”和“自主代理”的区别,重点在于控制流的所有权。代理工作流由人类预先编写,具有可预测性,而自主代理则在运行时进行动态决策。文章分析了不同类型的工作流和代理系统,强调在生产中工作流仍占主导地位,混合架构是未来的发展趋势。

代理工作流与自主代理:有什么区别?

MachineLearningMastery.com MachineLearningMastery.com · 2026-06-25T12:00:29Z

本文讨论了客户身份管理(CIAM)与员工身份管理(Workforce IAM)之间的五个主要差异,包括用户量级、用户来源、认证强度、隐私合规和用户体验优先级。CIAM 更注重用户体验和转化率,而 Workforce IAM 强调安全性和合规性。此外,CIAM 的同意管理和数据保护要求更高,涉及 GDPR 等法规。最后,混合架构设计需兼顾 B2B 和 B2C 用户的不同需求。

【身份与访问控制工程】CIAM 架构:面向 B2B / B2C SaaS 的身份平台

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-21T00:00:00Z
Python中的高效数据处理:批处理与流处理管道解析

在编写数据管道代码前,需要选择批处理或流处理。批处理适合处理历史数据,适用于数据新鲜度要求低的场景;流处理则适合实时需求。选择时需考虑数据新鲜度、处理复杂性和操作能力。混合架构(如Lambda和Kappa)结合了两者的优点,适应不同场景。理解这两种模式有助于选择合适的解决方案。

Python中的高效数据处理:批处理与流处理管道解析

freeCodeCamp.org freeCodeCamp.org · 2026-04-13T13:51:23Z
超越向量存储:构建AI应用的完整数据层

生产AI应用需要结合向量数据库和关系数据库。向量数据库擅长语义检索,但在结构化数据和事务处理上有限制。关系数据库则负责管理用户权限、元数据和账单等关键功能。混合架构能够有效整合两者,确保AI系统的可靠性和效率。

超越向量存储:构建AI应用的完整数据层

MachineLearningMastery.com MachineLearningMastery.com · 2026-03-24T09:00:03Z
RAG与大上下文窗口:AI应用的真实权衡

RAG(检索增强生成)和大上下文窗口各自解决不同问题,结合使用更为高效。RAG通过外部数据减少模型幻觉、更新知识并提供专业性,而大上下文窗口适合处理完整文档。两者在速度、成本和质量上存在权衡,选择应基于查询类型、数据量和延迟需求。混合架构可优化生产AI系统。

RAG与大上下文窗口:AI应用的真实权衡

Redis Blog Redis Blog · 2026-02-06T00:00:00Z
何时使用生成性人工智能:实用决策框架

随着生成性人工智能(GenAI)的发展,软件架构师需在GenAI与传统编程之间做出选择。通过四维决策框架评估特性,包括推理与逻辑、数据类型、可扩展性和任务复杂性。GenAI适合处理复杂和模糊的输入,而传统编程更适合结构化数据和高吞吐量操作。成功的系统可采用混合架构,结合GenAI的灵活性与传统代码的可靠性。

何时使用生成性人工智能:实用决策框架

The New Stack The New Stack · 2026-01-11T18:00:35Z
IBM新推出的Granite 4模型:采用高效推理的混合Mamba-2架构,降低人工智能成本

IBM推出Granite 4.0小型语言模型系列,采用混合Mamba/变换器架构,显著降低内存需求和运行成本,同时保持高准确性。Granite提供三种模型变体,适用于不同场景,支持高效推理和长输入处理,已在Hugging Face和watsonx.ai上开源,并获得ISO/IEC 42001:2023认证。

IBM新推出的Granite 4模型:采用高效推理的混合Mamba-2架构,降低人工智能成本

InfoQ InfoQ · 2025-11-18T02:48:00Z
开普勒机器人完成K2“大黄蜂”的全新步态升级

上海开普勒机器人有限公司完成了人形机器人K2“大黄蜂”的步态升级,发布了“混合架构抗扰动”步态视频。K2在复杂地形中保持稳定步伐,并通过VLA+模型理解自然语言指令。其混动架构结合滚柱丝杠和旋转执行器,确保高负载下的精确控制,提升行走自然性和灵活性。

开普勒机器人完成K2“大黄蜂”的全新步态升级

全球TMT-美通国际 全球TMT-美通国际 · 2025-09-11T06:25:30Z
vLLM 现已支持 Qwen3-Next:极高效率的混合架构

vLLM现已支持Qwen3-Next,采用混合架构以提升长上下文处理效率,创新点包括混合注意力、高稀疏MoE和多标记预测。

vLLM 现已支持 Qwen3-Next:极高效率的混合架构

vLLM Blog vLLM Blog · 2025-09-11T00:00:00Z
为什么联邦API管理对混合云至关重要

企业在向混合和多云架构转型时,面临API管理的挑战,尤其是API网关的分散和缺乏集中控制。联邦API管理提供可见性和控制力,帮助企业在不妨碍创新的前提下,进行API治理,确保安全与合规。

为什么联邦API管理对混合云至关重要

The New Stack The New Stack · 2025-08-27T16:00:31Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码