➡️
继续阅读
-
Qwen3.8: 从 0 到 1 用 Rust 重写 Mooncake: Suncake
本文介绍作者用Rust重写Mooncake存储模块为Suncake项目,通过Qoder和Qwen3.8从零开发,仅用37个提交完成。相比C++版,性能提升...
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
作者测试了MiniMax H3视频生成模型,用中英文提示词生成同一首诗的视频,发现宏观效果差别不大,仅微观细节略有不同。原因是简单指令语义重叠,且随机性干...
-
Cloudflare D1开始强制执行免费额度:超额后数据库查询直接失败 次日0点恢复
Cloudflare D1数据库免费版自2026年9月1日起强制执行每日额度,免费用户每天限500万次行读取和10万次行写入,超额后查询直接报错,不会产生...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...