➡️
继续阅读
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
作者测试了MiniMax H3视频生成模型,用中英文提示词生成同一首诗的视频,发现宏观效果差别不大,仅微观细节略有不同。原因是简单指令语义重叠,且随机性干...
-
OpenVX 1.3.2 发布:更精确的错误信息、更好的一致性以及为 2.0 版本奠定的基础
Khronos发布OpenVX 1.3.2,增强错误处理、图像格式支持及类型安全,提升一致性和可调试性,为OpenVX 2.0奠定基础。新版本引入新错误代...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4
本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与Mo...
-
CD销量激增,实体媒体持续复兴
美国唱片业协会报告显示,2026年上半年CD销量达1750万张,同比增长45.7%,销售额增长58.6%至1.711亿美元,扭转了此前下滑趋势。黑胶唱片销...
-
Kimi K3 模型结构(7):结构决定系统
本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通...