➡️
继续阅读
-
李飞飞刚发Atlas,中国开源“同款”已抢跑半年?
文章介绍了世界模型的最新进展:李飞飞团队发布多模态世界模型Atlas,能重建3D场景并生成新视角;国内影溯的InSpatio-World也能从视频构建动态...
-
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程...
-
一台 3D 打印机,为什么藏着 GPT-6 最大的野心?|硬哲学
GPT-6 Astra宣传片展示了从画黄色圆圈到生成3D模型,最终通过拓竹P1S打印机变成实物的过程,体现AI从屏幕内容生成进入现实操作。文章认为GUI是...
-
Allora Labs证明变异AI模型群体性能超单个优化模型
Allora Labs研究表明,在AI模型群体中引入随机变异可提升整体性能,超越单个优化模型。变异群体在环境变化时表现更优,最佳情况下约80%优于优化群体...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...