小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
SimpleDesign:蛋白质序列与结构协同设计的联合模型

SimpleDesign是一种多模态蛋白质设计模型,无需多阶段训练,直接在数据空间端到端训练,结合序列交叉熵与结构回归目标,采用Transformer多模态骨干,在超200万序列-结构对上训练,在协同设计和无条件生成任务上表现优异。

SimpleDesign:蛋白质序列与结构协同设计的联合模型

Apple Machine Learning Research Apple Machine Learning Research · 2026-09-11T00:00:00Z

本文讲述Phorge搜索服务在接入真实Elasticsearch和Meilisearch后暴露的兼容性问题。因Elasticsearch版本升级移除mapping type,Gorge需按版本调整索引结构、写入路径和查询过滤,并修复include_in_all、not query等过时语法。Meilisearch则需声明id为可过滤属性。通过增加结构关系测试和真实后端联调,确保协议兼容。

Phorge 现代化改造实战(十二):兼容 Elasticsearch 5、6、7,版本配置决定整个索引结构

苏洋博客 苏洋博客 · 2026-09-08T03:20:00Z
Kimi K3 模型结构(10):RL 与服务,状态住在哪里

本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间迁移,训练态让位NVMe,参考模型权重借梯度缓冲槽位流入GPU,沙箱支持pause/fork/snapshot,集群调度采用缓存亲和与预算准入,确保资源高效利用。

Kimi K3 模型结构(10):RL 与服务,状态住在哪里

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T21:00:00Z
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。

Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:30:00Z
DeepSeek-V4 模型结构(7):结构决定系统

DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-gather处理跨rank压缩窗口。磁盘前缀缓存中,压缩条目易存,滑窗KV需重算或周期检查点。mHC通过融合内核、重算和DualPipe优化,将访存开销压至6.7%。

DeepSeek-V4 模型结构(7):结构决定系统

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:20:00Z
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁

本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任意router输出都能使各rank计算完全平衡,消除负载不均和动态shape问题。同时用感知负载的GEMM调度解决rank内偏斜,并将视觉编码器计算塞入流水线气泡,减少等待开销。

Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。

DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。

DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:40:00Z
DeepSeek-V4 模型结构(4):深度维度,mHC

该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和均为1),经Sinkhorn-Knopp迭代投影实现,使复合映射增益从3000降至1.6。初始化时等价于普通Transformer,参数量仅占0.005%,带来推理性能提升,并与Kimi K3的Attention Residuals形成对比。

DeepSeek-V4 模型结构(4):深度维度,mHC

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:20:00Z
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件

本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩导致近token不可见;Q/KV归一化替代QK-Clip;部分RoPE加输出反旋转消除绝对位置;attention sink解决softmax权重分配缺陷;1M上下文KV cache仅5.3GiB,FLOPs约38G。

DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:00:00Z
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择

本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。

DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:40:00Z
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV

本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维KV向量,采用重叠窗口和逐通道softmax加权,K与V共享单头,配合分组输出投影降低参数。相比前代,V4首次压缩缓存条目数,以支持1M上下文的高效推理。

DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:20:00Z
DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。

DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:00:00Z
Kimi K3 模型结构(7):结构决定系统

本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通过可结合前缀扫描分解,避免直接加和;Block AttnRes优化内存通信;Stable LatentMoE融合GEMM与token中心解码;混合架构前缀缓存解耦粒度,支持512-token边界复用;视觉编码器动态并行并填充流水线气泡。核心是将固定权重累加转为数据相关选择。

Kimi K3 模型结构(7):结构决定系统

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:40:00Z
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE-3投机解码draft模型;Per-Head Muon优化器按头正交化动量矩阵,提升训练稳定性。词表大小163840,采用稠密层设计,强调结构选择对系统设计的影响。

Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:00:00Z
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSNorm稳定训练,用SiTU-GLU激活控制输出,并通过Quantile Balancing实现负载均衡。该模块占模型98%参数,每层激活16个专家,显著提升效率与性能。

Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T15:20:00Z
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。

Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:40:00Z
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使16-token对角tile也能用BF16矩阵乘,消除FP32逐位置对瓶颈。相比通用DPLR内核,KDA内核因结构简化速度快约一倍。训练和prefill用chunkwise形式,decode用递推形式。

Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:00:00Z
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。

Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T13:20:00Z
Kimi K3 模型结构(4):深度维度,Attention Residuals

本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对embedding及各层输出做softmax加权,替代固定求和。K3采用Block形式,将93层分为8块,块内普通求和,块间注意力聚合,共9个来源。相比普通残差,此设计提升多步推理能力,降低输出幅度增长,并支持高效两阶段推理。

Kimi K3 模型结构(4):深度维度,Attention Residuals

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T12:40:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码