小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
中国模型Engram/N-Gram记忆体引爆AI新竞赛

DeepSeek与阿里通义推出Engram/N-Gram记忆模块,为Transformer增加“记忆硬盘”,将固定知识查找从计算中分离,提升推理效率。实验显示性能提升,但社区测试发现其擅长短语补全而非事实回忆,且DeepSeek V4未采用Engram。该技术尚处探索阶段,可能改变AI竞赛格局。

中国模型Engram/N-Gram记忆体引爆AI新竞赛

极道 极道 · 2026-08-26T23:30:00Z
FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型

FlexiSLM是首个支持动态帧率的语音大模型,可在4-12.5Hz间运行,无需重训。它根据信息密度动态分配语音Token,输入输出端均支持可控帧率。在7B规模上超越Qwen2.5-Omni等基线,输出降至6.25Hz时推理时间近半,性能仅微降。目标帧率控制误差小于0.1Hz,并开源了最大语音问答数据集。

FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型

实时互动网 实时互动网 · 2026-08-25T03:36:00Z

MoE通过稀疏激活解耦参数量与计算量,但代价转移至路由稳定性、通信和推理效率。训练中需应对过载丢token、专家塌缩和路由抖动,All-to-All通信是主要成本。推理时小batch降低专家利用率。MoE并非免费容量,其优势在预训练FLOPs上成立,但微调和通信场景需权衡。

【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
谷歌押注推理未来:为单一模型打造的定制芯片

谷歌正研发代号“Frozen v2”的定制芯片,将Gemini模型架构部分硬编码于硅片,同时保留权重可更新,以提升推理效率。目标每瓦特令牌数提升6至10倍,缓解算力压力并降低成本。此举反映AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿的ASIC演进,但保留灵活性以适配模型迭代。

谷歌押注推理未来:为单一模型打造的定制芯片

The New Stack The New Stack · 2026-07-20T22:14:41Z

石科技在WAIC 2026发布拓元(Vectron),旨在解决中国算力浪费问题。通过统一调度10余种国产芯片、优化推理效率,提升算力利用率,降低企业AI成本。拓元具备KV Cache压缩、Token压缩等技术,推动AI基础设施从规模竞赛转向效率竞赛,释放万亿级算力价值。

清华系团队发布国产Token优化工厂:兼容10余种国产芯片,日吞吐千亿Token

量子位 量子位 · 2026-07-18T03:31:48Z
397B参数追平万亿模型,上海AI Lab发布科学智能体新基座 | WAIC 2026

上海人工智能实验室发布了基于新架构的Intern-S2-Preview-397B大模型,旨在解决科学智能领域的知识与推理分离问题。该模型通过Memory Decoder和Mobius架构实现专业知识的动态更新与推理效率提升,显著提高了生命科学和材料科学等领域的科研效率和准确性。

397B参数追平万亿模型,上海AI Lab发布科学智能体新基座 | WAIC 2026

量子位 量子位 · 2026-07-17T09:20:14Z
一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

百度推出的Unlimited OCR模型在长文档处理上刷新了SOTA,采用参考滑动窗口注意力机制,模拟人类阅读方式,解决了传统OCR的显存膨胀问题。该模型在OmniDocBench上表现优异,推理效率提升35%,并计划扩展到语音识别和机器翻译等任务。

一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

量子位 量子位 · 2026-06-28T06:04:17Z
在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。

在线教程丨香港科技大学团队开源首个确定性视频深度框架DVD,零样本刷新 SOTA

HyperAI超神经 HyperAI超神经 · 2026-06-18T06:45:41Z
一键调用!京东云率先上线MiniMax M3

今日,MiniMax M3正式上线,京东云JoyBuilder平台已接入该模型,提升推理效率。MiniMax M3支持1M超长上下文和多模态输入能力。京东云提供高性能推理服务,帮助企业快速应用大模型,提升运维效率,未来将深化合作,构建开放的AI生态。

一键调用!京东云率先上线MiniMax M3

京东科技开发者 京东科技开发者 · 2026-06-11T01:48:55Z
一分钟读论文:《通过自我调节模拟规划实现高效智能体推理》

卡内基梅隆大学与商汤实验室提出的SR^2AM模型通过三个独立系统优化智能体决策过程,显著提高推理效率。SR^2AM-30B在数学和科学任务中表现优异,Token消耗减少66.7%-95.3%。该模型结合模拟推理与自我调节,成功解决推理深度与效率的平衡问题,展现出更深层次的思考能力。

一分钟读论文:《通过自我调节模拟规划实现高效智能体推理》

Micropaper Micropaper · 2026-06-09T00:00:00Z
同时服务多个用户:连续批处理如何提高大语言模型推理效率

本文探讨了通过动态调度和不规则批处理提高大语言模型(LLM)推理效率的方法。动态调度允许在每个解码步骤后立即接收新请求,避免了静态批处理中短请求等待长请求的问题,从而减少GPU资源浪费。不规则批处理通过合并多个提示,减少填充令牌的浪费,进一步提升推理速度。最终,连续批处理显著提高了LLM的推理效率。

同时服务多个用户:连续批处理如何提高大语言模型推理效率

MachineLearningMastery.com MachineLearningMastery.com · 2026-05-30T02:54:17Z
Token使用量降低30%,以「阿凡达」为灵感的异构智能体框架Eywa,高效结合语言模型与领域专用基础模型

智能体 AI 正在从语言中心化系统转变为具备自主推理与协作能力的智能体。伊利诺伊大学的研究团队提出 Eywa 框架,结合语言模型与领域专用基础模型,提升科学研究中的推理效率。EywaAgent 在多个科学领域的任务中表现优异,效用提升约 7%,Token 消耗减少 30%。此外,EywaBench 评测框架也被提出,以评估多模态科学推理能力,推动 AI 在科学领域的应用。

Token使用量降低30%,以「阿凡达」为灵感的异构智能体框架Eywa,高效结合语言模型与领域专用基础模型

HyperAI超神经 HyperAI超神经 · 2026-05-11T11:01:11Z

易点天下在Agentic AI领域的工程化实践中,通过上下文工程和多云基础设施推动AI Agent的规模化应用。公司构建了多云架构,实现资源统一调度,并以“Context Engineering”为核心,形成六层上下文体系,提升推理效率和工具调用准确率,同时建立五层防御机制以降低风险。

易点天下分享Agentic AI工程化实践,推动规模化应用

全球TMT-美通国际 全球TMT-美通国际 · 2026-05-09T08:22:38Z
自适应并行推理:高效推理扩展的新范式

自适应并行推理(APR)是一种新兴的推理模型,能够动态决定何时并行化和分解任务。与传统顺序推理相比,APR通过并行处理多个线程,提高了推理效率,降低了延迟。研究表明,APR在复杂任务中表现出更高的准确性和更低的计算成本,但仍需解决训练稳定性和硬件适应性等问题。

自适应并行推理:高效推理扩展的新范式

The Berkeley Artificial Intelligence Research Blog The Berkeley Artificial Intelligence Research Blog · 2026-05-08T09:00:00Z
刚刚,GPT-5.5 发布!Claude Code 连夜治好降智,「奥特曼瘫倒」喜提续集

Anthropic 的估值已超过 1 万亿美元,OpenAI 面临压力。GPT-5.5 发布,提升了推理效率,能够更好地处理复杂任务,表现优于前代。评测显示其在多个领域取得显著进步,OpenAI 计划将其打造成“AI 超级应用”,整合多种功能以提升工作效率。

刚刚,GPT-5.5 发布!Claude Code 连夜治好降智,「奥特曼瘫倒」喜提续集

爱范儿 爱范儿 · 2026-04-24T03:50:01Z

Unweight是一种无损压缩系统,能够将大型语言模型(LLM)的权重缩小15-22%,而不影响输出质量。该系统通过在快速的片上内存中解压权重,避免了主内存的延迟,从而提高推理效率。在Llama-3.1-8B模型上实现了约30%的多层感知器权重压缩,节省了约3GB显存,降低了推理成本。Unweight专为数据中心的H100 GPU优化,支持多种执行策略以适应不同工作负载。

Unweight:如何在不牺牲质量的情况下将大型语言模型压缩22%

The Cloudflare Blog The Cloudflare Blog · 2026-04-17T13:00:00Z
KernelEvolve:Meta的排名工程师代理如何优化AI基础设施

Meta推出KernelEvolve,一个自主系统,优化AI基础设施,显著提升广告模型的推理和训练效率。该系统通过自动生成和优化硬件特定的内核,解决了性能瓶颈,能在数小时内完成原本需数周的内核优化工作,推理吞吐量提升超过60%。

KernelEvolve:Meta的排名工程师代理如何优化AI基础设施

Engineering at Meta Engineering at Meta · 2026-04-02T19:59:46Z
优化吞吐量的Redis用于L2 KV缓存重用

Redis在2026年被评为Fast Company最具创新的公司之一。通过与LMCache的优化,Redis提升了大规模语言模型的缓存性能,KV缓存读取速度达到9-10 GB/s,显著提高了推理效率,帮助加速推理过程并降低成本。

优化吞吐量的Redis用于L2 KV缓存重用

Redis Blog Redis Blog · 2026-03-30T00:00:00Z
阶跃星辰冲击百亿美金俱乐部,揭开下半场竞争核心逻辑

阶跃星辰的Step 3.5-Flash在推理效率上表现优异,推理速度达到350tokens/秒,标志着其从算法产品向可定制智能底座的转型。公司采取基础设施化路线,涉足AI服务、终端设备和底层芯片,吸引资本市场关注,估值接近100亿美元。

阶跃星辰冲击百亿美金俱乐部,揭开下半场竞争核心逻辑

全球TMT-美通国际 全球TMT-美通国际 · 2026-03-26T04:18:37Z

华为在MWC 2026推出AI数据平台,旨在解决AI智能体落地的挑战,提供知识生成、推理加速和记忆管理等功能,助力企业实现数字化转型,提高知识检索精度和推理效率。

华为在MWC 2026发布AI数据平台

全球TMT-美通国际 全球TMT-美通国际 · 2026-03-05T07:05:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码