➡️
继续阅读
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
作者测试了MiniMax H3视频生成模型,用中英文提示词生成同一首诗的视频,发现宏观效果差别不大,仅微观细节略有不同。原因是简单指令语义重叠,且随机性干...
-
李开复彭博社专访:中国AI以“六个月差距”挑战美国,开源模型将赢得全球覆盖战
李开复表示,中美AI模型差距约六个月,但中国以低价提供性能接近的产品,类似安卓与苹果模式。美国公司盈利高,中国公司获更大用户规模。尽管芯片受限,中国工程师...
-
金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
AFAC 2026金融AI大赛在上海举办,吸引全球5027支队伍参赛。赛事聚焦真实金融场景,设置交易行为识别、复杂文档还原、稀疏反馈实验和长文本Agent...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...