➡️
继续阅读
-
押中SpaceX的硅谷老将,把票投给了一家中国世界模型公司
AI虽擅长语言理解,却缺乏对物理世界的认知与决策能力,难以应对暴雨洪水等真实灾害。飞渡科技推出空间智能“峥嵘大模型”,构建全栈基础设施,通过动态边界控制、...
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...
-
这个世界模型训练完就“退场”,机器人反而更能干了
光象科技联合清华发布物理原生世界模型ActEffect,训练时预测动作后果并优化策略,执行时退出部署以降低成本。在LIBERO等基准测试中成功率领先,已用...
-
smolts:面向教学语言的教学型IDE
作者开发了名为smolts的教学IDE,用于SMoL教学语言,灵感来自Stacker项目。该IDE支持S表达式编程,可逐步执行并可视化显示continua...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...