小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道
极道 · 2026-07-12T00:56:00Z
全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

蚂蚁灵波发布了LingBot-VA 2.0,这是全球首个具身原生的预训练VA模型。该模型通过预判能力提升机器人在复杂任务中的表现,如桌面整理和轻柔抓取。LingBot-VA 2.0采用新一代VAE、因果预训练和稀疏MoE架构,显著提高了推理速度和实时控制能力,标志着机器人技术进入新阶段。

全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

量子位
量子位 · 2026-07-10T08:01:00Z
50FPS、成本打掉70%,魔芯MoWorld把世界模型带进产业时代

魔芯科技与华为等合作推出MoWorld,这是首个基于国产NPU的实时交互世界模型,推理速度超过50FPS,成本仅为同规模GPU的30%。MoWorld支持用户实时交互,适用于机器人和自动驾驶等领域,推动世界模型的产业化应用。

50FPS、成本打掉70%,魔芯MoWorld把世界模型带进产业时代

量子位
量子位 · 2026-07-08T13:29:44Z

BGE-M3是一款全能型嵌入模型,支持密集、稀疏和多向量检索,覆盖100多种语言,最大输入长度为8192词元。其量化版bge-m3-q8_0在GPUNexus平台上线,显存占用减少,推理速度提升,适合RAG系统和多语言知识库。2026年第三季度可免费试用。

【免费用3月】BGE-M3 全能多粒度嵌入模型:三合一检索、百种语言、超长上下文,量化版上线算纽GPUNexus

Rust.cc
Rust.cc · 2026-07-07T05:50:31Z
梁文锋署名的DSpark,看懂这10个点就够了!

DeepSeek的新论文DSpark提出了一种通过系统工程和模型协同设计来提升大模型推理速度的方法。该方法利用GPU的特性进行连续批处理,结合小模型的快速猜测和大模型的验证,显著提高推理效率。DSpark通过优化草稿模型和动态调整验证长度,实现了端到端的性能提升,并已开源相关代码供开发者使用。

梁文锋署名的DSpark,看懂这10个点就够了!

量子位
量子位 · 2026-06-28T08:06:04Z
DeepSeek又变强了:发布DSpark框架 推理速度提升超60%

DeepSeek团队与北京大学联合发布了《DSpark》研究论文,提出了一种加速大模型推理的新方法。该技术在保持文本生成质量的同时,显著提升了推理速度,单用户生成速度提高85%。DSpark采用“半自回归生成”架构和置信度调度验证机制,优化了生成过程,减少了计算资源浪费,并已在DeepSeek-V4系统中应用,提升了推理效率。

DeepSeek又变强了:发布DSpark框架 推理速度提升超60%

TechWeb 全站精华
TechWeb 全站精华 · 2026-06-28T01:33:52Z
DeepSeek DSpark加速推理:猜词游戏中玩出创新

DeepSeek的研究表明,通过让AI模型先“猜测”后续内容,再进行验证,可以显著提高推理速度。这种“猜测-验证”机制减少了计算量,并提高了准确率。与美国公司的保密技术不同,中国公司通过开源技术降低了AI模型的成本,使其更为普及。这一变化可能导致AI服务价格大幅下降,影响投资者对AI公司的预期。

DeepSeek DSpark加速推理:猜词游戏中玩出创新

极道
极道 · 2026-06-27T23:04:00Z
论文周报 | DeepMind D4RT统一动态4D重建,推理速度飙升300倍;打破AGI通用幻想,哥大等提出SAI理论重塑AI演进目标...速览一周AI前沿论文

Google DeepMind与牛津大学及UCL的研究团队提出了D4RT模型,旨在高效重建动态视频中的4D场景。该模型通过单次视频输入,利用灵活的查询机制,独立获取任意点的三维状态,显著提高了推理速度和效率,刷新了多项基准测试记录,为未来的4D视觉感知提供了新的范式。

论文周报 | DeepMind D4RT统一动态4D重建,推理速度飙升300倍;打破AGI通用幻想,哥大等提出SAI理论重塑AI演进目标...速览一周AI前沿论文

HyperAI超神经
HyperAI超神经 · 2026-06-18T09:38:58Z
实测小米最快1T大模型:吞吐量每秒1000+ Tokens,Vibe Coding七秒交付

小米推出了MiMo-V2.5-Pro-UltraSpeed模型,具备1T参数和1000+ TPS的推理速度,突破了GPU的性能限制。该模型在全栈开发任务中表现优异,能够快速生成高质量的复杂应用,推动了大模型的商业化进程。

实测小米最快1T大模型:吞吐量每秒1000+ Tokens,Vibe Coding七秒交付

量子位
量子位 · 2026-06-11T01:18:16Z
小米MiMo-v2.5-Pro-UltraSpeed推理速度达每秒一千token

小米MiMo-v2.5-Pro-UltraSpeed模型的推理速度达到每秒1000词,改变了人机互动方式。快速的AI提升了用户的对话和协作效率,而慢速模型则会导致思维中断,影响体验。未来,速度将成为AI智能的重要维度。

小米MiMo-v2.5-Pro-UltraSpeed推理速度达每秒一千token

极道
极道 · 2026-06-08T22:37:00Z
阶跃Step 3.7 Flash登顶AA榜:速度、性价比、端到端三项第一

阶跃星辰推出的Step 3.7 Flash模型在速度和成本上表现优异,推理速度超过400 tokens/s,单任务成本仅为Claude Opus 4.6的1/9,适合企业级应用,推动AI商业化进程。

阶跃Step 3.7 Flash登顶AA榜:速度、性价比、端到端三项第一

量子位
量子位 · 2026-06-05T06:12:16Z
JetBrains开源Mellum2,以超越Claude Code的局限

JetBrains发布了Mellum2,这是一个开源的12B参数编码模型,专注于AI系统的基础设施层。Mellum2支持更广泛的任务,如模型协调和子代理工作负载,采用混合专家架构以提升推理速度。该模型在代码生成任务中表现优异,但在广泛推理和知识评估方面略逊于其他模型。目前已在Hugging Face上发布,企业可选择自我托管。

JetBrains开源Mellum2,以超越Claude Code的局限

The New Stack
The New Stack · 2026-06-01T20:47:26Z
大语言模型速度基准:指标与基础设施指南

本文讨论了大语言模型(LLM)推理速度的关键指标及其对用户体验的影响,强调选择合适模型和优化指标的重要性。介绍了TTFT、TTFAT、输出速度等六个性能指标,并提到语义缓存技术可以减少推理瓶颈,提高响应速度和降低成本。Redis作为实时数据平台,支持语义缓存和向量搜索,适合构建高效的GenAI应用。

大语言模型速度基准:指标与基础设施指南

Redis Blog
Redis Blog · 2026-05-10T00:00:00Z
一分钟读论文:《用扩散语言模型统一多模态理解与生成》

蚂蚁集团的论文《LLaDA2.0-Uni》提出了一种离散扩散语言模型,旨在统一视觉理解和图像生成。该模型通过将图像压缩为离散语义token,并利用混合专家架构实现文本和视觉token的并行处理,显著提升推理速度。LLaDA2.0-Uni在视觉理解和图像生成任务上表现优异,展现出理解与生成的连续交互能力。

一分钟读论文:《用扩散语言模型统一多模态理解与生成》

Micropaper
Micropaper · 2026-04-26T00:00:00Z
ERNIE-Image上线星河社区,无限生图,高效创作!一站式玩转指南来了

百度发布了ERNIE-Image和ERNIE-Image-Turbo开源模型,前者为完整版本,后者为高效蒸馏版,推理速度更快。用户可在星河社区免费体验,适用于海报制作等实际场景,模型使用简单,适合开发者快速上手。

ERNIE-Image上线星河社区,无限生图,高效创作!一站式玩转指南来了

百度大脑
百度大脑 · 2026-04-16T11:07:16Z
单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

硅心科技推出的aiX-apply-4B模型在代码变更应用中表现优异,准确率达到93.8%,推理速度提升15倍,且仅需一张显卡即可高效运行,解决了企业算力不足的问题。

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

量子位
量子位 · 2026-03-30T00:41:45Z

Mamba是一种新型选择性状态空间模型,优化了长序列数据处理,推理速度比Transformer快5倍,支持跨模态应用。Rust实现的Mamba-RS具备高效的推理和训练能力,并支持CUDA加速,适用于多种场景。

【Rust日报】2026-03-21 Mamba-RS: Rust实现的Mamba选择性状态空间模型

Rust.cc
Rust.cc · 2026-03-27T06:34:15Z
MambaJSCC:基于广义状态空间模型的自适应联合信源信道编码器

上海交通大学研究团队在语义通信架构方面取得进展,提出了MambaJSCC架构,该架构具有线性复杂度和内生信道自适应特性,显著提升了传输性能和推理速度,为6G网络提供了新方案。

MambaJSCC:基于广义状态空间模型的自适应联合信源信道编码器

实时互动网
实时互动网 · 2026-03-02T06:30:04Z
LLMs中的KV缓存:开发者指南

本文介绍了自回归变换器推理中键值(KV)缓存的作用,如何通过缓存已计算的键和值来消除冗余计算,从而显著提高生成速度,推理速度提升可达3-5倍。尽管内存使用增加,但在实际应用中,这种提升是值得的。理解KV缓存为进一步优化推理提供了基础。

LLMs中的KV缓存:开发者指南

MachineLearningMastery.com
MachineLearningMastery.com · 2026-02-26T14:43:49Z
AI 正在“矿机化”:成本降 10 倍,GPU 会被淘汰吗?

近日,一家公司推出了将大模型直接写入ASIC芯片的技术,推理速度达到17000 Token/s,耗电和成本比英伟达显卡低10倍。这种ASIC有望改变算力竞争格局,未来可能主导大模型推理,而GPU则回归训练和通用计算。

AI 正在“矿机化”:成本降 10 倍,GPU 会被淘汰吗?

小众软件
小众软件 · 2026-02-23T09:29:54Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码