小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA

阿里团队的研究STAR-VAE在音频生成领域取得突破,提出了一种新型正则化策略,解决了音频VAE的“率-失真-规整度不可能三角”问题。该方法通过结构化拓扑感知正则化,优化潜在空间,提高了音频重建和文本生成音频的质量,刷新了当前最优结果。

STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA

实时互动网
实时互动网 · 2026-07-14T03:14:00Z
撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型

缅因猫(MaineCoon)是一种新型AI音视频生成模型,具备实时生成和高质量输出的能力,推理速度达到47.5 FPS,成本低,能生成超过30分钟的内容。该模型通过自重采样和流式表征对齐技术,解决了传统模型的延迟和音画不同步问题,提供更自然的社交互动体验。开发团队Catnip由年轻技术专家组成,致力于推动下一代社交平台的发展。

撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型

量子位
量子位 · 2026-06-20T10:42:35Z
在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。

在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

HyperAI超神经
HyperAI超神经 · 2026-06-18T06:45:41Z
Modular:Modular 26.4:SOTA MoE服务、通过代理技能进行模型启动、Mojo 1.0 Beta 2及更多

Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升了性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,支持多种应用场景。

Modular:Modular 26.4:SOTA MoE服务、通过代理技能进行模型启动、Mojo 1.0 Beta 2及更多

Modular Blog
Modular Blog · 2026-06-18T00:00:00Z
Modular:Modular 26.4:SOTA MoE服务、通过代理技能进行模型启动、Mojo 1.0 Beta 2及更多

Modular 26.4版本推出,支持MiniMax M3和GLM 5.2等前沿模型,增强了模型架构和API兼容性。新功能包括稀疏激活的Mixture-of-Experts(MoE)架构,提升性能和开发体验。用户可通过Modular Cloud访问500多种模型架构,适用于多种应用场景。

Modular:Modular 26.4:SOTA MoE服务、通过代理技能进行模型启动、Mojo 1.0 Beta 2及更多

Modular Blog
Modular Blog · 2026-06-18T00:00:00Z
摩尔线程MusaCoder开源:首个基于国产全功能GPU全栈训练的代码大模型,性能比肩国际SOTA

摩尔线程发布了开源大模型MusaCoder,专为GPU底层算子生成设计,支持从PyTorch自动生成高性能CUDA/MUSA代码,提升开发效率。MusaCoder在KernelBench评测中表现优异,超越多款主流模型。其全链路训练依托国产MTT S5000集群,验证了国产GPU的强大能力,推动GPU编程和AI技术的创新与应用。

摩尔线程MusaCoder开源:首个基于国产全功能GPU全栈训练的代码大模型,性能比肩国际SOTA

实时互动网
实时互动网 · 2026-06-10T09:59:05Z
剑桥大学等提出面向对地观测任务的像素级基础模型,在多项任务中精度达SOTA

对地观测卫星在农业和生态监测中至关重要,但卫星数据常受云层干扰。研究团队提出TESSERA模型,利用含云数据学习地表变化,优化数据处理流程,提升模型在低标注和稀疏数据下的表现,展现出更强的鲁棒性和泛化能力。

剑桥大学等提出面向对地观测任务的像素级基础模型,在多项任务中精度达SOTA

HyperAI超神经
HyperAI超神经 · 2026-06-10T09:01:54Z
MiniCPM5-1B采用RL+OPD训练,多项复杂任务达SOTA;面向复杂医疗业务自动化:医疗智能体评测数据集 CHI-Bench

TACK 是 AI Laboratory for Molecular Engineering 于 2026 年发布的一个标准化知识库数据集与基准测试集,旨在解决现有 PROTAC 机器学习基准中数据稀缺、缺乏严格评估及覆盖范围有限的问题,广泛应用于 PROTAC...

MiniCPM5-1B采用RL+OPD训练,多项复杂任务达SOTA;面向复杂医疗业务自动化:医疗智能体评测数据集 CHI-Bench

HyperAI超神经
HyperAI超神经 · 2026-06-05T05:55:57Z
百度文心发布 PaddleOCR-VL-1.6:准确率突破 96.33%,刷新文档解析 SOTA

百度发布的PaddleOCR-VL-1.6在OmniDocBench v1.6评测中准确率超过96.3%,综合性能全球第一,支持100多种语言,适应复杂文档场景,满足文档数字化需求。该模型已上线官网并开源,供全球开发者使用。

百度文心发布 PaddleOCR-VL-1.6:准确率突破 96.33%,刷新文档解析 SOTA

量子位
量子位 · 2026-06-02T07:47:30Z
材料版AlphaFold来了!40个工业任务全方位SOTA,AI4S迎来行业大突破

材料AI模型MPA通过中期训练和混合头设计,显著提升了对真实实验数据的预测能力。在40个工业任务中,MPA表现优异,尤其在新结构方面展现出强大的“物理直觉”。该方法结合理论计算与实验数据,推动了材料科学的发展。

材料版AlphaFold来了!40个工业任务全方位SOTA,AI4S迎来行业大突破

量子位
量子位 · 2026-06-01T05:25:27Z
96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级

PaddleOCR-VL-1.6正式发布,基于1.5版本进行了优化,文档解析性能显著提升,OmniDocBench v1.6指标突破96.3%。新版本支持异形框定位,增强了表格、古籍及生僻字的识别能力,模型结构保持一致,用户可快速适配。此外,PaddleOCR-VL系列与多家硬件及云平台合作,推动文档智能化转型。

96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级

百度大脑
百度大脑 · 2026-05-28T12:31:56Z
小米汽车世界模型全新框架:重建+生成一体化,主流基准测试全面 SOTA

小米汽车发布了Xiaomi Auto World Model框架,结合重建与生成技术,提升辅助驾驶的认知能力。该模型通过深度耦合,实现高稳定性和一致性,能够有效应对复杂场景,生成高质量合成数据,已在实际应用中落地,推动智能汽车的发展。

小米汽车世界模型全新框架:重建+生成一体化,主流基准测试全面 SOTA

小米云技术
小米云技术 · 2026-05-26T03:14:19Z
谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案

谷歌DeepMind推出的「AI联合数学家」成功解决了Kourovka Notebook第21.10号问题,标志着数学研究的新突破。该系统通过人机协作,提升了解决数学难题的效率,强调持续互动与反馈,记录失败假设,帮助数学家更好地研究。在FrontierMath基准测试中,该系统取得了48%的准确率,超越了其他AI模型,展示了AI与数学家合作的潜力。

谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案

量子位
量子位 · 2026-05-09T07:12:48Z

Google has unvelied a new generation of Tensor Processing Units (TPUs), featuring two specialized chips designed to accelerate model training and agent workflows, which require continuous,...

Google New TPU Generation is Specifically Designed for Agents and SOTA Model Training

InfoQ
InfoQ · 2026-05-06T10:00:00Z
SOTA是什么意思?AI、大模型、深度学习中SOTA完全解读

SOTA是“State Of The Art”的缩写,指当前最先进的技术水平。在机器学习和深度学习中,SOTA模型是指在特定任务上表现最佳的模型。理解SOTA有助于识别技术前沿和模型性能。

SOTA是什么意思?AI、大模型、深度学习中SOTA完全解读

人言兑
人言兑 · 2026-04-25T16:06:23Z
神秘模型「大象」:仅100B拿下SOTA,Token效率超高!

蚂蚁Inclusion AI团队推出了名为「大象」的AI模型,大小仅100B,具备高效的代码生成和修复能力。实测显示,「大象」在处理代码、会议纪要和数据分析等任务时,速度快、准确性高且节省Token。尽管在复杂任务和新知识处理上有所不足,但其高效性使其成为中小企业的理想选择。

神秘模型「大象」:仅100B拿下SOTA,Token效率超高!

量子位
量子位 · 2026-04-22T10:29:00Z
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token

浙江大学和上海人工智能实验室提出的IBISAgent框架,将医学图像分割重新定义为多步视觉决策过程,克服了现有方法的局限。通过冷启动和强化学习,IBISAgent在多个基准测试中显著提升了分割性能,展示了自主多轮交互推理的优势,为智能医学图像分析奠定了基础。

国产多模态Agent拿下医学分割SOTA!不用改模型、不加token

量子位
量子位 · 2026-04-22T07:17:04Z
横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开

高德推出了面向AGI的全栈具身技术体系ABot,利用地图数据构建物理优先的机器人操作系统。ABot-World通过重建物理世界生成高质量训练数据,解决机器人理解物理的难题。高德的创新在于系统工程和物理智能内核,使机器人在真实环境中持续进化。该平台的开源将推动行业生态发展。

横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开

量子位
量子位 · 2026-04-19T10:13:54Z
高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环

阿里巴巴旗下高德发布全球首款全自主具身机器人“高德途途”,成功协助视障人士完成复杂任务。该机器人基于高德新发布的ABot全栈具身技术体系,具备高效的数据驱动模型和持续自我进化能力,提升了在真实环境中的导航和操作能力。

高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环

量子位
量子位 · 2026-04-19T07:50:32Z
ERNIE-Image开源SOTA !消费级显卡搞定顶级渲染、高密度文本绘图

ERNIE-Image是百度文心团队开发的开源文生图模型,基于8B参数的Diffusion Transformer架构,支持多种视觉风格,适合海报和漫画等内容生产。该模型在Hugging Face上开源,支持多语言生成,降低了创作门槛,鼓励用户参与创作。

ERNIE-Image开源SOTA !消费级显卡搞定顶级渲染、高密度文本绘图

百度大脑
百度大脑 · 2026-04-15T09:16:28Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码