阿里巴巴发布Qwen3.8-Flash,一款1250亿参数的开源多模态MoE模型,作为Qwen4的架构预览。该模型在编码和办公任务上性能优越,训练资源仅需同类模型的九分之一,成本更低。它支持26万token上下文,可扩展至百万,并已在Hugging Face和ModelScope开放。开发者反应不一,有人称赞其能在消费级硬件运行,也有人认为本地模型尚不足以替代远程服务。
DeepSeek的核心优势在于其基础设施(Infra)能力,而非仅算法创新。其母公司幻方量化自2019年起投入巨资自建超算平台,积累了深厚工程经验。DeepSeek团队通过自研3FS文件系统、DualPipe算法等,以极低成本高效训练模型,获全球顶尖同行认可。公司正将Infra能力扩展至物理基建,建设大型数据中心,追求总体拥有成本最优,Infra在组织内主导模型架构决策。
WALL-OSS正式开源,超越π0,成为具身智能领域唯一具备多模态统一输出能力的模型,支持低成本训练,适用于多种场景,推动行业发展,降低技术门槛。
完成下面两步后,将自动完成登录并继续当前操作。