Meta的GEM广告推荐模型通过软硬件协同设计,将端到端训练效率提升至20-25% MFU,训练FLOPs一年内增长4倍。核心创新包括定制内核库(如Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练提升计算效率;拓扑感知的5D并行、SM-free通信、自动激活检查点和负载均衡优化扩展效率。这些方法解决了推荐系统与LLM混合架构的独特挑战。
ScaleCUA是清华大学和Z.AI团队提出的框架,旨在解决Computer Use Agent(CUA)训练数据稀缺问题。通过可验证任务合成、动态学习前沿采样和视觉上下文分割,ScaleCUA显著提升了数据质量和训练效率,使开源CUA在OSWorld上达到了68.7%的新高,超越了参数量大四倍的竞品。这一方法强调了数据质量的重要性,证明了在CUA领域,数据效率优于模型参数规模。
VideoFlexTok是一种灵活的视频标记方法,通过粗到细的方式表示视频,初始标记捕捉抽象信息,后续标记添加细节。这种结构允许根据需求调整标记数量,提升训练效率,生成质量与传统3D网格标记相当,但模型更小,支持长视频生成,计算成本低。
Andrej Karpathy发布了名为autoresearch的开源Python工具,允许AI代理在GPU上自动进行实验。该工具通过编辑代码、训练模型和评估结果,发现了20个有效的改进,显著提升了模型性能。autoresearch的设计使AI能够在固定时间预算内进行科学实验,优化训练效率,展示了AI在细节调整方面的潜力。
Cursor公司发布了Composer 2.5,显著提升了编码任务和训练效率。尽管基准测试表现优于前代产品,实际应用效果仍需验证。Composer 2.5的定价低于竞争对手,未来与SpaceX的合作将进一步增强模型能力。
何恺明团队推出了新的扩散语言模型ELF,该模型采用连续的embedding空间进行文本生成,显著降低了生成困惑度。ELF在训练和采样效率上表现优异,仅用105M参数和45B训练token,生成质量超过主流模型。该模型首次实现了连续与离散的有效结合,推动了扩散语言模型的发展。
麻省理工学院的研究人员开发了一种新方法,提升了联邦学习的效率,使其在资源有限的设备上更快地训练人工智能模型。该方法通过减少内存需求和通信负担,加速训练过程,平均提高了81%的速度。这项技术有望在医疗和金融等高风险领域应用,同时保护用户数据安全。
苹果研究人员提出了ParaRNN框架,显著提高了非线性递归神经网络(RNN)的训练效率,实现了大规模并行训练。该方法使得7亿参数的RNN在语言建模任务中表现出与变换器相当的性能,且通过引入牛顿法,ParaRNN在保持非线性表达能力的同时实现了高效的并行计算。这一进展为RNN的广泛应用和进一步研究提供了新的可能性。
戴盟机器人联合多家顶尖机构发布了全球最大的触觉全模态数据集Daimon Infinity,旨在提升具身智能的训练效率。该数据集包含触觉和视觉等多维信息,预计年内达到数百万小时,助力机器人在复杂环境中精准操作。触觉数据的引入显著提高了模型的训练效果,推动行业标准化和资源共享,加速具身智能的商业化进程。
MixAtlas是一种用于多模态大模型中期训练的数据混合优化框架,通过领域分解和小型代理模型提高样本效率和下游泛化能力。它在图像概念和任务监督两个方面分解训练数据,显著提升训练效率,实现3倍的收敛速度和2-5%的性能提升,尤其在文本丰富的基准测试中表现突出。
《Attention Is All You Need》论文通过WMT14英译德和英译法任务取得优异的BLEU分数,证明了Transformer架构的有效性。其训练效率显著优于前代模型,且不依赖递归和卷积,推动了机器翻译领域的变革。论文强调了注意力机制的重要性,并展示了其在现代硬件上的并行性优势,为后续大模型的发展奠定了基础。
本文介绍了SafetyPairs框架,生成仅在安全特征上不同的图像对,以区分安全与不安全的图像。通过图像编辑模型进行针对性修改,构建了一个包含3020个图像的安全基准,提升了视觉语言模型的评估能力,并改善了轻量级模型的训练效率。
Kimi团队的《Attention Residuals》报告改进了残差连接结构,显著提升了大模型的训练效率。在相同算力下,该方法的效果相当于基线模型1.25倍算力的成果,获得硅谷AI界的认可,标志着深度学习基础范式的变革。
ReSyn是卡内基梅隆大学与AWS团队开发的工具,旨在自动生成推理环境,使AI能够在无监督下学习推理。该工具降低了标注成本,提高了训练效率,实验表明性能提升达27%。未来,AI将能够自我进化,生成更多样化的环境。
近期,基于PaddleFormers v1.0,在昆仑芯P800上成功完成DeepSeek-V3模型的全参数微调,验证了超大规模模型的可控性及优化训练效率。通过混合并行训练策略和多硬件算子验证工具,显著提升了算力利用效率,并总结了显存管理、长序列输入处理及负载均衡等关键技术,为未来大规模模型训练提供了参考。
何恺明团队的GeoPT提出了一种新预训练范式,通过合成动力学将静态几何转化为动态空间,使模型能够在无标签数据上学习物理规律。该方法节省了20-60%的物理仿真数据,提高了训练效率和适应性,为物理仿真提供了新思路。
在旧金山的技能之夜活动中,开发者展示了如何利用skills.sh生态系统提升智能代理能力。该项目起源于Shu Ding记录的React知识,现已发展至69000个技能和200万次安装。为应对安全问题,团队与多家安全公司合作进行审计。活动强调了技能在缩短训练时间和提升代理效率方面的重要性,以及提供正确上下文的必要性。
生成式推荐作为新兴推荐系统,提升了推荐多样性和复杂语义处理能力。京东九数算法团队开发的9N-LLM统一训练引擎,支持多框架和硬件,解决了训练效率和模型规模问题,推动生成式推荐的实际应用。该引擎通过优化样本处理、稀疏参数计算和强化学习流程,提高了训练效率和效果。
Meta推出生成广告模型(GEM),旨在提升广告推荐效果。该模型通过处理大量用户与广告的互动,解决推荐系统的挑战。GEM利用先进架构、知识转移和优化训练基础设施,提高性能,并支持广告主目标与用户行为。Meta还采用多种并行策略和GPU优化,提升训练效率,帮助广告主实现更精准的广告投放。
DeepSeek-R1展示了强化学习(RLHF)在大模型推理中的重要性,挑战了传统观念。通过去除Critic和采用组内统计方法,提升了训练效率,推动了RL后训练的变革,未来将向自我验证循环发展。
完成下面两步后,将自动完成登录并继续当前操作。