阿里团队的研究STAR-VAE在音频生成领域取得突破,提出了一种新型正则化策略,解决了音频VAE的“率-失真-规整度不可能三角”问题。该方法通过结构化拓扑感知正则化,优化潜在空间,提高了音频重建和文本生成音频的质量,刷新了当前最优结果。
缅因猫(MaineCoon)是一种新型AI音视频生成模型,具备实时生成和高质量输出的能力,推理速度达到47.5 FPS,成本低,能生成超过30分钟的内容。该模型通过自重采样和流式表征对齐技术,解决了传统模型的延迟和音画不同步问题,提供更自然的社交互动体验。开发团队Catnip由年轻技术专家组成,致力于推动下一代社交平台的发展。
香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。
Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升了性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,支持多种应用场景。
Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,适用于多种应用场景。
摩尔线程发布了开源大模型MusaCoder,专为GPU底层算子生成设计,支持从PyTorch自动生成高性能CUDA/MUSA代码,提升开发效率。MusaCoder在KernelBench评测中表现优异,超越多款主流模型。其全链路训练依托国产MTT S5000集群,验证了国产GPU的强大能力,推动GPU编程和AI技术的创新与应用。
对地观测卫星在农业和生态监测中至关重要,但卫星数据常受云层干扰。研究团队提出TESSERA模型,利用含云数据学习地表变化,优化数据处理流程,提升模型在低标注和稀疏数据下的表现,展现出更强的鲁棒性和泛化能力。
TACK 是 AI Laboratory for Molecular Engineering 于 2026 年发布的一个标准化知识库数据集与基准测试集,旨在解决现有 PROTAC 机器学习基准中数据稀缺、缺乏严格评估及覆盖范围有限的问题,广泛应用于 PROTAC...
百度发布的PaddleOCR-VL-1.6在OmniDocBench v1.6评测中准确率超过96.3%,综合性能全球第一,支持100多种语言,适应复杂文档场景,满足文档数字化需求。该模型已上线官网并开源,供全球开发者使用。
材料AI模型MPA通过中期训练和混合头设计,显著提升了对真实实验数据的预测能力。在40个工业任务中,MPA表现优异,尤其在新结构方面展现出强大的“物理直觉”。该方法结合理论计算与实验数据,推动了材料科学的发展。
PaddleOCR-VL-1.6正式发布,基于1.5版本进行了优化,文档解析性能显著提升,OmniDocBench v1.6指标突破96.3%。新版本支持异形框定位,增强了表格、古籍及生僻字的识别能力,模型结构保持一致,用户可快速适配。此外,PaddleOCR-VL系列与多家硬件及云平台合作,推动文档智能化转型。
小米汽车发布了Xiaomi Auto World Model框架,结合重建与生成技术,提升辅助驾驶的认知能力。该模型通过深度耦合,实现高稳定性和一致性,能够有效应对复杂场景,生成高质量合成数据,已在实际应用中落地,推动智能汽车的发展。
谷歌DeepMind推出的「AI联合数学家」成功解决了Kourovka Notebook第21.10号问题,标志着数学研究的新突破。该系统通过人机协作,提升了解决数学难题的效率,强调持续互动与反馈,记录失败假设,帮助数学家更好地研究。在FrontierMath基准测试中,该系统取得了48%的准确率,超越了其他AI模型,展示了AI与数学家合作的潜力。
Google has unvelied a new generation of Tensor Processing Units (TPUs), featuring two specialized chips designed to accelerate model training and agent workflows, which require continuous,...
SOTA是“State Of The Art”的缩写,指当前最先进的技术水平。在机器学习和深度学习中,SOTA模型是指在特定任务上表现最佳的模型。理解SOTA有助于识别技术前沿和模型性能。
蚂蚁Inclusion AI团队推出了名为「大象」的AI模型,大小仅100B,具备高效的代码生成和修复能力。实测显示,「大象」在处理代码、会议纪要和数据分析等任务时,速度快、准确性高且节省Token。尽管在复杂任务和新知识处理上有所不足,但其高效性使其成为中小企业的理想选择。
浙江大学和上海人工智能实验室提出的IBISAgent框架,将医学图像分割重新定义为多步视觉决策过程,克服了现有方法的局限。通过冷启动和强化学习,IBISAgent在多个基准测试中显著提升了分割性能,展示了自主多轮交互推理的优势,为智能医学图像分析奠定了基础。
高德推出了面向AGI的全栈具身技术体系ABot,利用地图数据构建物理优先的机器人操作系统。ABot-World通过重建物理世界生成高质量训练数据,解决机器人理解物理的难题。高德的创新在于系统工程和物理智能内核,使机器人在真实环境中持续进化。该平台的开源将推动行业生态发展。
阿里巴巴旗下高德发布全球首款全自主具身机器人“高德途途”,成功协助视障人士完成复杂任务。该机器人基于高德新发布的ABot全栈具身技术体系,具备高效的数据驱动模型和持续自我进化能力,提升了在真实环境中的导航和操作能力。
ERNIE-Image是百度文心团队开发的开源文生图模型,基于8B参数的Diffusion Transformer架构,支持多种视觉风格,适合海报和漫画等内容生产。该模型在Hugging Face上开源,支持多语言生成,降低了创作门槛,鼓励用户参与创作。
完成下面两步后,将自动完成登录并继续当前操作。