阿里通义千问发布Qwen3.8-Flash-Next,作为Qwen4架构预览,采用多模态MoE设计,通过混合注意力、门控残差和N-gram嵌入提升效率,主模型125B参数,激活仅6B,训练成本降至1/9,支持262K上下文,可扩展至百万Token,并已上线HyperAI教程供一键部署体验。
DeepSeek通过系统级创新,用2048块H800和557.6万美元完成训练,成本仅为GPT-4o的二十分之一。它未发明新技术,但优化了MLA压缩KV缓存、MoE专家激活、FP8混合精度训练、DualPipe计算通信重叠等六项技术,显著降低内存和算力消耗,提升效率,突破芯片限制。
何恺明团队推出了首个扩散语言模型ELF,采用105M参数和45B训练token,成功超越主流模型。ELF通过在连续空间中去噪生成离散token,显著提高生成速度和质量,展示了小规模模型的高效输出,降低了训练成本,未来有望推动AI生成速度提升。
蚂蚁灵波科技开源了具身大模型LingBot-VLA,提升了机器人在真实场景中的操作能力。该模型实现了跨本体和跨任务的泛化,降低了训练成本,并在多项评测中刷新成功率纪录。LingBot-VLA结合高精度空间感知模型,增强了深度信息处理能力,助力开发者快速适应不同场景,推动具身智能的发展。
艾伦人工智能研究所(Ai2)推出了一系列开源编码代理模型,性能优于同类产品。用户可以根据私有代码库进行微调,以提升特定任务的表现。新模型SERA-32B和SERA-8B在解决GitHub问题上表现出色,且训练成本显著低于传统方法。通过创新的软验证生成和多样化训练数据,Ai2旨在让强大的编码代理更易获取。
月之暗面推出的Kimi K2 Thinking模型以460万美元的训练成本,展现出与顶级AI模型相当的性能,颠覆了传统AI投资观念。中国AI产业通过高效策略和低成本实现快速创新,挑战美国的资本密集型模式,展现出新的竞争优势。
中国初创公司月之暗面推出的开源AI模型Kimi K2 Thinking在多项基准测试中超越GPT-5,训练成本仅为460万美元,显示出开源模型在性能与成本上的优势,可能改变全球AI竞争格局。
腾讯推出的无训练组相对策略优化(Training-Free GRPO)方法,仅需120元即可显著提升大模型性能,超越70000元的微调方案。该方法通过动态更新经验知识库,无需调整模型参数,降低训练成本,适用于数学推理和网页搜索等任务。实验结果表明,Training-Free GRPO在多个基准测试中表现优异,具有高性价比和有效性。
根据国际能源署,预计到2030年数据中心电力消耗将达到945太瓦时,超过大多数国家。AI芯片市场预计到2024年将达到1230亿美元,年增长率为33%。OpenAI和Anthropic等公司的估值大幅上升,但训练成本也在增加。基础设施层推动AI革命,应用层则实现经济价值。
DeepSeek-R1于9月17日登上《Nature》封面,成为首个经过同行评审的大模型。其训练成本仅为29.4万美元,远低于行业标准。研究表明,DeepSeek-R1-Zero在推理能力上表现出色,数学竞赛准确率提升至86.7%。该成果为AI研究提供了透明和规范的范例。
Sanaka AI提出了一种新方法,使教师模型能够像人类教师一样进行启发式教学,训练出7B小模型在推理能力上超越671B的DeepSeek-R1。该方法通过逐步解释提高了教学效率,并显著降低了训练成本。
本文介绍了一种新型极简激活超级大脑模型,参数总数为142B,动态激活为14B,训练成本仅为Qwen2.5-72B的1/4。该模型在中文理解、数学推理和代码生成等任务中表现优异,并开源了训练过程,强调数据质量和系统创新的重要性。未来将探索稀疏注意力和模拟人类学习效率。
阿里通义推出PARSCALE新策略,使1.6B模型性能接近4.4B,内存占用仅为1/22,延迟增加1/6。该方法通过并行计算和动态聚合权重,显著提升模型能力,训练成本降低98%。
本研究提出双头优化(DHO)框架,旨在解决资源有限环境中视觉语言模型(VLMs)的计算复杂性和训练成本问题。DHO通过独立学习标记数据和教师预测,显著提升特征学习效率,并在多个领域和数据集上超越传统基线。
本研究提出了一种弹性推理框架,解决了大型推理模型在复杂任务中输出长度不受控的问题。该框架将推理过程分为思考和解决两个阶段,独立分配预算,从而提高了在资源紧张情况下的可靠性。实验证明,弹性推理在严格预算下表现优异,训练成本低于基线方法。
中国科学院计算技术研究所推出的LLaMA-Omni2是一个支持语音的大型语言模型,结合语音感知与语言理解,实现实时口语对话。该模型采用端到端流水线,训练成本低且具有模块化可解释性。在200K语音对话样本上训练后,LLaMA-Omni2的表现优于基线模型,证明高质量、低延迟的语音交互无需大量语料库。
本研究提出了一种新型低比特优化器,利用超低精度量化技术降低训练成本,解决了信号淹没和梯度方差增加的问题,实现显著的内存节省,促进基础研究的可达性。
斯坦福大学发布的《2025 AI Index》报告分析了人工智能的发展现状,指出美国在模型发布方面领先,中国迅速追赶。报告强调训练成本上升、推理成本下降,人工智能的碳足迹仍在增加。尽管企业投资持续增长,实际回报尚未显著。报告还提到人工智能在医疗领域的潜力,以及美国政策向州级转变。总体来看,公众对人工智能持乐观态度。
该研究提出了一种新的微调迁移方法,旨在提高大型语言模型的更新效率。通过从旧模型转移微调,可以显著提升新模型的性能,减少训练成本。
本研究提出了一种遮罩指导的视频生成方法,旨在降低文本到视频生成模型的训练成本和数据需求。该模型通过前景遮罩和运动轨迹控制,提升了视频生成的一致性和质量,适用于视频编辑和艺术视频生成。
完成下面两步后,将自动完成登录并继续当前操作。