西工大等机构提出MeanVC 2,一种低延迟鲁棒的流式零样本语音转换方法。它通过未来感受野分块机制提升小块转换稳定性,并引入通用音色Token编码器增强低质量参考音频下的说话人建模鲁棒性。实验表明,MeanVC 2在保持轻量化的同时,降低了延迟并提升了转换质量,相关论文被INTERSPEECH 2026接收。
本文介绍亚马逊云科技推出的Chronos-Bolt时序预测基础模型,基于T5架构预训练于近千亿条数据,支持零样本预测,推理速度提升250倍。文章详述其技术原理、确定性及概率预测模式,并通过SageMaker AI JumpStart演示快速部署流程,对比DeepAR优势,提供成本分析与选型建议,适合快速验证和批量预测场景。
COMPASS是一种泛癌症AI基础模型,基于33种癌症的转录组数据训练,用于预测免疫检查点抑制剂治疗响应。该模型通过44个生物学概念编码基因表达,在16个临床队列中优于22种现有方法,准确率提升8.5%,AUPRC提升15.7%,并能泛化至未涉及的癌症类型和治疗方案,为个体化治疗提供可解释的机制线索。
TabFM 是 Google Research 发布的基础模型,专注于处理结构化表格数据,支持分类和回归任务。该模型通过上下文学习重塑表格预测,显著提升数据处理效率,并在零样本配置下超越多个传统基线模型。
Gemma 4是谷歌DeepMind推出的文档解析工具,能够处理扫描和数字PDF,提取发票信息。它通过将PDF页面渲染为高分辨率图像,利用视觉语言模型读取内容,克服传统文本提取工具的局限性。该工具支持灵活的视觉令牌预算,以适应不同文档的复杂性,确保高效准确的提取。
Humanoid-GPT是一种新型的GPT风格Transformer模型,专为人形机器人的零样本运动跟踪设计。研究者利用20亿帧的动作数据进行训练,克服了以往模型在灵活性和泛化能力上的不足。该模型采用因果注意力机制,在未见过的动作和控制任务中表现出色,推动了人形智能体的通用AGI发展。
银河通用机器人发布了AstraBrain-WBC 0.5,标志着人形机器人进入“GPT时代”。该模型基于20亿帧人类动作数据,具备全身实时运动控制能力,展现出强大的泛化性和稳定性,推动机器人从单一技能学习向通用运动生成转变。
Google开源的TimesFM是一款零样本学习的时间序列预测模型,用户只需一行命令即可使用。它能够快速预测未来数据,并提供不确定性区间,适用于加密货币等领域。该模型支持外部变量微调,完全开源,用户可在本地运行,确保数据安全。
在AI时代,专家的经验因AI的辅助而获得更高的溢价。研究显示,专家使用AI工具的成功率高达91%,而新手仅为15%。AI成为高效执行者,人类负责决策。非软件行业的专家也通过AI提升编码能力,打破传统程序员的垄断。未来,程序员需转型为“代码审计师”,深入理解业务逻辑,以应对AI带来的挑战。
香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。
ChartNet是由麻省理工学院等机构开发的高质量多模态数据集,包含150万个图表样本,涵盖24种图表类型,旨在提升AI对图表的理解能力。该数据集支持图表重建、数据提取和摘要生成等任务。研究表明,微调模型在ChartNet上表现优于现有大型模型,推动了视觉语言模型在图表理解领域的进步。
HumanEgo框架通过人类第一视角视频学习机器人策略,成功解决了人类与机器人之间的具身鸿沟。研究者利用佩戴的Aria眼镜采集示范数据,实现了零样本迁移,平均成功率达到92.5%。该方法无需机器人数据,数据高效,支持在新环境中稳健迁移,显著提升了机器人操作效率。
中国疾病预防控制中心与中国防痨协会近日举办了“2026年全国生物样本与数据资源学术大会”,讨论生物样本与数据资源在传染病防控中的重要性。绿盟科技分享了在疾控数据安全方面的探索,强调数据安全建设面临的五大风险,并提出AI技术在数据安全中的应用方案,旨在构建全链路数据安全体系,推动公共卫生事业的发展。
样本指导优化(SPGO)是微软Visual Studio 2022和2026中的新功能,旨在简化性能优化过程。与传统的PGO不同,SPGO利用实际发布二进制文件的硬件性能计数器进行数据采集,避免复杂的仪器化步骤。通过结合实验室、内部监控和生产环境的数据,SPGO为C/C++应用程序提供5-15%的性能提升,降低了数据收集的开销,适合生产环境使用。
研究表明,传统小样本生物医学研究存在统计效力不足的问题。德国法兰克福大学研发的genESOM生成式AI模型,通过分离结构学习与数据生成,有效恢复小样本中的生物学信号,降低假阳性率。在多发性硬化研究中,该模型表现优异,能减少动物用量30%-50%,为小样本研究提供了新方案。
Databricks推出了新的监控平台Pantheon,基于开源项目Thanos,能够实时处理50亿个活动时间序列,每天接收超过10万亿个样本。通过优化存储架构和聚合策略,Pantheon提高了监控系统的可靠性和效率,降低了云成本,减少了手动操作,并与Databricks的湖仓架构结合,提升了工程师的工作效率。
最近的零样本测试表明,利用多模态和Transformer大模型可以高效检测工业缺陷,如裂纹和污垢。这项技术实现了零样本检测,显著提高了项目交付速度,适用于多种样品和行业转换。
高德推出的ABot-World模型是全球首款具身智能机器人操作系统,采用双引擎架构,突破了物理一致性、动作可控性和零样本泛化能力。该模型通过物理优先原则生成高保真场景,支持精确的动作条件化控制,提升了机器人在真实环境中的可靠性。ABot-World在多个评测中表现优异,展现了其在工业级应用中的潜力。
零样本文本分类是一种无需特定任务训练数据即可标记文本的方法。模型通过将标签转化为自然语言陈述,判断输入文本与这些陈述的匹配程度。这种方法适用于快速原型开发和资源有限的任务。使用预训练模型(如facebook/bart-large-mnli)可以有效进行多标签分类和自定义假设模板,从而提高分类准确性,关键在于清晰的标签定义和合理的假设模板。
美团LongCat团队发布了LongCat-AudioDiT模型,采用全新的端到端文本转语音技术,减少信息损失。该模型在Seed基准测试中表现优异,取得最佳的说话人相似度和可懂度,证明了在波形潜空间生成语音的有效性。LongCat-AudioDiT以简化架构和高保真合成为目标,已开源,期待推动语音生成技术的发展。
完成下面两步后,将自动完成登录并继续当前操作。