小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
中国模型Engram/N-Gram记忆体引爆AI新竞赛

DeepSeek与阿里通义推出Engram/N-Gram记忆模块,为Transformer增加“记忆硬盘”,将固定知识查找从计算中分离,提升推理效率。实验显示性能提升,但社区测试发现其擅长短语补全而非事实回忆,且DeepSeek V4未采用Engram。该技术尚处探索阶段,可能改变AI竞赛格局。

中国模型Engram/N-Gram记忆体引爆AI新竞赛

极道 极道 · 2026-08-26T23:30:00Z
FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型

FlexiSLM是首个支持动态帧率的语音大模型,可在4-12.5Hz间运行,无需重训。它根据信息密度动态分配语音Token,输入输出端均支持可控帧率。在7B规模上超越Qwen2.5-Omni等基线,输出降至6.25Hz时推理时间近半,性能仅微降。目标帧率控制误差小于0.1Hz,并开源了最大语音问答数据集。

FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型

实时互动网 实时互动网 · 2026-08-25T03:36:00Z

MoE通过稀疏激活解耦参数量与计算量,但代价转移至路由稳定性、通信和推理效率。训练中需应对过载丢token、专家塌缩和路由抖动,All-to-All通信是主要成本。推理时小batch降低专家利用率。MoE并非免费容量,其优势在预训练FLOPs上成立,但微调和通信场景需权衡。

【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
谷歌押注推理未来:为单一模型打造的定制芯片

谷歌正研发代号“Frozen v2”的定制芯片,将Gemini模型架构部分硬编码于硅片,同时保留权重可更新,以提升推理效率。目标每瓦特令牌数提升6至10倍,缓解算力压力并降低成本。此举反映AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿的ASIC演进,但保留灵活性以适配模型迭代。

谷歌押注推理未来:为单一模型打造的定制芯片

The New Stack The New Stack · 2026-07-20T22:14:41Z

石科技在WAIC 2026发布拓元(Vectron),旨在解决中国算力浪费问题。通过统一调度10余种国产芯片、优化推理效率,提升算力利用率,降低企业AI成本。拓元具备KV Cache压缩、Token压缩等技术,推动AI基础设施从规模竞赛转向效率竞赛,释放万亿级算力价值。

清华系团队发布国产Token优化工厂:兼容10余种国产芯片,日吞吐千亿Token

量子位 量子位 · 2026-07-18T03:31:48Z
397B参数追平万亿模型,上海AI Lab发布科学智能体新基座 | WAIC 2026

上海人工智能实验室发布了基于新架构的Intern-S2-Preview-397B大模型,旨在解决科学智能领域的知识与推理分离问题。该模型通过Memory Decoder和Mobius架构实现专业知识的动态更新与推理效率提升,显著提高了生命科学和材料科学等领域的科研效率和准确性。

397B参数追平万亿模型,上海AI Lab发布科学智能体新基座 | WAIC 2026

量子位 量子位 · 2026-07-17T09:20:14Z
一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

百度推出的Unlimited OCR模型在长文档处理上刷新了SOTA,采用参考滑动窗口注意力机制,模拟人类阅读方式,解决了传统OCR的显存膨胀问题。该模型在OmniDocBench上表现优异,推理效率提升35%,并计划扩展到语音识别和机器翻译等任务。

一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

量子位 量子位 · 2026-06-28T06:04:17Z
在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。

在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

HyperAI超神经 HyperAI超神经 · 2026-06-18T06:45:41Z
一键调用!京东云率先上线MiniMax M3

今日,MiniMax M3正式上线,京东云JoyBuilder平台已接入该模型,提升推理效率。MiniMax M3支持1M超长上下文和多模态输入能力。京东云提供高性能推理服务,帮助企业快速应用大模型,提升运维效率,未来将深化合作,构建开放的AI生态。

一键调用!京东云率先上线MiniMax M3

京东科技开发者 京东科技开发者 · 2026-06-11T01:48:55Z
一分钟读论文:《通过自我调节模拟规划实现高效智能体推理》

卡内基梅隆大学与商汤实验室提出的SR^2AM模型通过三个独立系统优化智能体决策过程,显著提高推理效率。SR^2AM-30B在数学和科学任务中表现优异,Token消耗减少66.7%-95.3%。该模型结合模拟推理与自我调节,成功解决推理深度与效率的平衡问题,展现出更深层次的思考能力。

一分钟读论文:《通过自我调节模拟规划实现高效智能体推理》

Micropaper Micropaper · 2026-06-09T00:00:00Z
同时服务多个用户:连续批处理如何提高大语言模型推理效率

本文探讨了通过动态调度和不规则批处理提高大语言模型(LLM)推理效率的方法。动态调度允许在每个解码步骤后立即接收新请求,避免了静态批处理中短请求等待长请求的问题,从而减少GPU资源浪费。不规则批处理通过合并多个提示,减少填充令牌的浪费,进一步提升推理速度。最终,连续批处理显著提高了LLM的推理效率。

同时服务多个用户:连续批处理如何提高大语言模型推理效率

MachineLearningMastery.com MachineLearningMastery.com · 2026-05-30T02:54:17Z
Token使用量降低30%,以「阿凡达」为灵感的异构智能体框架Eywa,高效结合语言模型与领域专用基础模型

智能体 AI 正在从语言中心化系统转变为具备自主推理与协作能力的智能体。伊利诺伊大学的研究团队提出 Eywa 框架,结合语言模型与领域专用基础模型,提升科学研究中的推理效率。EywaAgent 在多个科学领域的任务中表现优异,效用提升约 7%,Token 消耗减少 30%。此外,EywaBench 评测框架也被提出,以评估多模态科学推理能力,推动 AI 在科学领域的应用。

Token使用量降低30%,以「阿凡达」为灵感的异构智能体框架Eywa,高效结合语言模型与领域专用基础模型

HyperAI超神经 HyperAI超神经 · 2026-05-11T11:01:11Z

易点天下在Agentic AI领域的工程化实践中,通过上下文工程和多云基础设施推动AI Agent的规模化应用。公司构建了多云架构,实现资源统一调度,并以“Context Engineering”为核心,形成六层上下文体系,提升推理效率和工具调用准确率,同时建立五层防御机制以降低风险。

易点天下分享Agentic AI工程化实践,推动规模化应用

全球TMT-美通国际 全球TMT-美通国际 · 2026-05-09T08:22:38Z
自适应并行推理:高效推理扩展的新范式

自适应并行推理(APR)是一种新兴的推理模型,能够动态决定何时并行化和分解任务。与传统顺序推理相比,APR通过并行处理多个线程,提高了推理效率,降低了延迟。研究表明,APR在复杂任务中表现出更高的准确性和更低的计算成本,但仍需解决训练稳定性和硬件适应性等问题。

自适应并行推理:高效推理扩展的新范式

The Berkeley Artificial Intelligence Research Blog The Berkeley Artificial Intelligence Research Blog · 2026-05-08T09:00:00Z
刚刚,GPT-5.5 发布!Claude Code 连夜治好降智,「奥特曼瘫倒」喜提续集

Anthropic 的估值已超过 1 万亿美元,OpenAI 面临压力。GPT-5.5 发布,提升了推理效率,能够更好地处理复杂任务,表现优于前代。评测显示其在多个领域取得显著进步,OpenAI 计划将其打造成“AI 超级应用”,整合多种功能以提升工作效率。

刚刚,GPT-5.5 发布!Claude Code 连夜治好降智,「奥特曼瘫倒」喜提续集

爱范儿 爱范儿 · 2026-04-24T03:50:01Z

Unweight是一种无损压缩系统,能够将大型语言模型(LLM)的权重缩小15-22%,而不影响输出质量。该系统通过在快速的片上内存中解压权重,避免了主内存的延迟,从而提高推理效率。在Llama-3.1-8B模型上实现了约30%的多层感知器权重压缩,节省了约3GB显存,降低了推理成本。Unweight专为数据中心的H100 GPU优化,支持多种执行策略以适应不同工作负载。

Unweight:如何在不牺牲质量的情况下将大型语言模型压缩22%

The Cloudflare Blog The Cloudflare Blog · 2026-04-17T13:00:00Z
KernelEvolve:Meta的排名工程师代理如何优化AI基础设施

Meta推出KernelEvolve,一个自主系统,优化AI基础设施,显著提升广告模型的推理和训练效率。该系统通过自动生成和优化硬件特定的内核,解决了性能瓶颈,能在数小时内完成原本需数周的内核优化工作,推理吞吐量提升超过60%。

KernelEvolve:Meta的排名工程师代理如何优化AI基础设施

Engineering at Meta Engineering at Meta · 2026-04-02T19:59:46Z
优化吞吐量的Redis用于L2 KV缓存重用

Redis在2026年被评为Fast Company最具创新的公司之一。通过与LMCache的优化,Redis提升了大规模语言模型的缓存性能,KV缓存读取速度达到9-10 GB/s,显著提高了推理效率,帮助加速推理过程并降低成本。

优化吞吐量的Redis用于L2 KV缓存重用

Redis Blog Redis Blog · 2026-03-30T00:00:00Z
阶跃星辰冲击百亿美金俱乐部,揭开下半场竞争核心逻辑

阶跃星辰的Step 3.5-Flash在推理效率上表现优异,推理速度达到350tokens/秒,标志着其从算法产品向可定制智能底座的转型。公司采取基础设施化路线,涉足AI服务、终端设备和底层芯片,吸引资本市场关注,估值接近100亿美元。

阶跃星辰冲击百亿美金俱乐部,揭开下半场竞争核心逻辑

全球TMT-美通国际 全球TMT-美通国际 · 2026-03-26T04:18:37Z

华为在MWC 2026推出AI数据平台,旨在解决AI智能体落地的挑战,提供知识生成、推理加速和记忆管理等功能,助力企业实现数字化转型,提高知识检索精度和推理效率。

华为在MWC 2026发布AI数据平台

全球TMT-美通国际 全球TMT-美通国际 · 2026-03-05T07:05:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码