➡️
继续阅读
-
GPT-6带火循环Transformer,阿里早已布局
阿里团队针对循环Transformer的计算冗余问题,提出两篇论文:MeSH通过动态记忆缓冲和路由器解决循环空转,提升零样本准确率;SpiralForme...
-
开源dsh-image-gen:在DeepSeek Harness聊天框直接生图修图
dsh-image-gen是DeepSeek Harness的AI图像插件,支持对话生图、连续编辑、Studio批量创作、多模型对比、500+Prompt...
-
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术...
-
并行策略总览:六个维度各切什么、怎么通信
本文介绍大模型并行训练的核心概念,将DP、TP、SP、PP、EP、CP六种并行方式按切分维度、显存减少、通信开销和等待关系列表对比。并行本质是切分模型并引...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU
本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反...