➡️
继续阅读
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
作者测试了MiniMax H3视频生成模型,用中英文提示词生成同一首诗的视频,发现宏观效果差别不大,仅微观细节略有不同。原因是简单指令语义重叠,且随机性干...
-
从零搭建实体驱动型SEO内容架构:一套可复用的实操流程
实体驱动型SEO通过识别核心实体、构建主题集群、优化内部链接和结构化标记,取代传统关键词优化。它利用知识图谱关联推理,让页面获得未明确关键词的排名。实施分...
-
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...