蚂蚁灵波发布了LingBot-VA 2.0,这是全球首个具身原生的预训练VA模型。该模型通过预判能力提升机器人在复杂任务中的表现,如桌面整理和轻柔抓取。LingBot-VA 2.0采用新一代VAE、因果预训练和稀疏MoE架构,显著提高了推理速度和实时控制能力,标志着机器人技术进入新阶段。
CoCoEmo是一种新型情感语音合成框架,旨在生成复杂的人类情感表达。它通过在预训练模型中注入情感引导向量,实现多种情绪的组合,表现出更稳定的控制能力,适用于有声书和角色配音等场景,提升情感语音生成的自然性和细腻度。
零样本文本分类是一种无需特定任务训练数据即可标记文本的方法。模型通过将标签转化为自然语言陈述,判断输入文本与这些陈述的匹配程度。这种方法适用于快速原型开发和资源有限的任务。使用预训练模型(如facebook/bart-large-mnli)可以有效进行多标签分类和自定义假设模板,从而提高分类准确性,关键在于清晰的标签定义和合理的假设模板。
本文探讨了预训练模型的三种主要目标:自回归语言建模(GPT)、掩码语言建模(BERT)和去噪序列到序列(T5/BART)。每种方法在训练任务上有所不同,导致模型在生成、理解和条件生成能力上的差异。GPT专注于续写,BERT擅长理解,而T5/BART兼顾生成与理解。最终,GPT因其统一接口和扩展性成为主流。
MIT师生提出RandOpt算法,通过随机扰动参数简化预训练模型的调参过程,能够找到“专家”,效果与传统方法相当。研究表明,模型越大,随机改动的效果越明显,且无需复杂训练。此方法节省时间和算力,但依赖优质的预训练数据。
P5是一个统一的推荐系统框架,通过个性化提示和预训练模型提升推荐任务的泛化能力。它将用户-物品交互数据转化为自然语言序列,支持多种推荐任务,实验结果显示P5在多个基准测试中表现优异,具备零样本泛化能力。
零样本工业缺陷检测模型是工业AI的前沿研究,解决了传统方法对大量样本的依赖。通过无监督学习和预训练模型(如ResNet、CLIP等),该模型能够根据自然语言描述定位缺陷,灵活应对新类型缺陷。尽管在工业应用中表现出高准确率,但对硬件要求较高,推理速度依赖强大计算资源。预计到2026年,掌握此技术的公司将占据市场主动权。
国际语音会议Interspeech 2026将于2026年9月在悉尼举行,期间将举办音频编码器能力挑战赛(AECC)。比赛聚焦音频编码器在复杂场景下的表现,参赛者需提交预训练模型,主办方提供评估系统。参赛者可使用公开数据集,报名截止日期为2026年1月25日。
ML.NET 可通过文本分类和命名实体识别(NER)提取人名和地名。实现步骤包括安装必要的包、准备预训练模型、定义数据结构、构建 ML 管道并进行预测。尽管 ML.NET 在 NER 生态中不如 Python 库丰富,但适合于已有 .NET 技术栈的轻量集成场景。
本文介绍了一种新的扩散采样方法,其速度比现有最优解快186%。该方法无需训练,利用普通微分方程求解器,通过高维初始噪声生成更详细的样本,并控制细节水平。研究表明,该方法在多个预训练扩散模型上表现优异。
这篇博客推荐书籍《大规模语言模型:从理论到实践》,认为其为中文领域较为系统的预训练模型学习资料,内容更新及时,适合跳读,帮助读者发现知识盲点。
本文介绍了一种联合自动语音识别(ASR)和音调重音检测模型,显著提升了ASR系统的性能。音调重音检测模块使F1-score提高41%,并在LibriSpeech数据集上将错误率降低28.3%。研究强调了扩展预训练语音模型以保留重要韵律线索的必要性。
本文介绍了最优语料感知训练(OCAT),该方法通过微调预训练模型提升模型准确性。在翻译任务中,OCAT相较于传统训练提高了3.6和1.8的chrF分数,且具有轻量、不易过拟合和强适应性等优点。
微调是深度学习中的迁移学习方法,利用预训练模型适应新任务。根据任务差异,微调可分为全参数和部分参数微调;在资源有限时,部分参数微调能提高性能。微调还可分为监督与无监督微调,以及指令与对齐微调。参数高效微调方法如Adapter Tuning和LoRA,通过减少更新参数量降低计算成本。
本文为开发者和数据从业者提供生成式AI系统的实用指南,涵盖从基础模型到生产部署的各个方面,强调预训练模型和概率输出在内容创作中的应用。文章还介绍了Python编程、机器学习概念及大型语言模型的实践项目,以提升技能和展示能力。
happy-llm 是一个中文教程项目,介绍大语言模型的原理与实践,涵盖 Transformer 架构、预训练模型及 LLaMA2 的搭建与训练,适合有编程基础的 NLP 爱好者。
李飞飞团队提出了一种名为“嫁接”的新方法,通过修改预训练模型组件,节省计算资源并验证新架构设计。研究表明,使用不到2%的预训练算力仍能保持模型性能,并提升生成速度,适合资源有限的场景。
本研究探讨了预训练模型在人工智能创新中的应用,分析了HCI研究者的案例,提出了创新机会、能力分类和新兴交互设计模式,为有效应用提供指导,强调理解这些模型对推动AI创新的重要性。
本研究提出了一种变分前缀调优(VPT)方法,旨在解决代码摘要生成中对多样性和替代选项的忽视。该方法基于条件变分自编码器框架,增强了预训练模型生成多样且精确摘要的能力,使用户能够选择最合适的摘要,并在参数效率上优于传统方法。
Amazon Bedrock是AWS服务,简化生成AI应用的构建与扩展。用户可通过Python调用多种预训练模型,便于与其他AWS服务集成。使用时需安装AWS SDK,配置凭证,并选择基础模型,适合智能应用开发。
完成下面两步后,将自动完成登录并继续当前操作。