小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
构建丰裕智能

本文探讨AI基础设施的经济价值,强调智能的“丰裕”在于降低成本、提升能力,形成良性循环。通过降价(如GPT-5.6 Luna降80%)、优化计算效率(节省20%成本)和全栈协同,实现更高效智能。投资基于证据和需求,目标不是建最大设施,而是让智能更普及、更有用,惠及更多用户。

构建丰裕智能

OpenAI OpenAI · 2026-07-31T15:00:00Z
Furiosa为何放弃矩阵乘法?张量收缩、TCP架构与新一代AI芯片设计全面解析

Furiosa提出了一种新型AI芯片设计,采用Tensor Contraction Processor(TCP),放弃传统的矩阵乘法,直接执行张量收缩。这一设计旨在简化计算过程,减少数据转换和内存管理的开销,提高AI计算效率,标志着AI芯片设计的范式转变。

Furiosa为何放弃矩阵乘法?张量收缩、TCP架构与新一代AI芯片设计全面解析

极道 极道 · 2026-07-15T04:46:00Z
六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

六家AI芯片公司放弃传统硬件缓存和线程模型,采用软件管理的SRAM和数据流架构,以优化计算效率和降低能耗。这种设计强调显式数据放置和顺序执行,推动了AI专用芯片的发展。

六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

极道 极道 · 2026-07-10T03:34:00Z
搜狐技术:未读消息数系统设计

在互联网信息快速传播的背景下,未读消息的计算与提醒成为关键问题。本文提出一种新系统,采用分治思想和用户状态差异化处理,提升计算效率,降低存储成本,确保实时性和准确性。系统通过哈希算法管理在线用户,优化缓存策略,适应大数据量和高频更新场景,显著改善用户体验。该方案为互联网平台的未读消息处理提供了新思路,未来可结合AI和边缘计算进一步优化。

搜狐技术:未读消息数系统设计

实时互动网 实时互动网 · 2026-07-10T02:05:02Z
Vulkan 为 OCP 的微扩展 MX 格式添加扩展,以帮助机器学习

2026年7月3日,Vulkan 1.4.356 发布,新增扩展 VK_EXT_shader_ocp_microscaling_types,支持微缩放数据类型,旨在提升机器学习效率。该扩展由NVIDIA、三星等公司共同开发,重点在于提高计算吞吐量和降低内存带宽需求。

Vulkan 为 OCP 的微扩展 MX 格式添加扩展,以帮助机器学习

实时互动网 实时互动网 · 2026-07-06T02:31:05Z
注意力机制之后是什么?这家初创公司表示它已经知道了。

Subquadratic推出了小型模型SubQ 1.1,采用稀疏注意机制,能够处理长达1200万标记的上下文,显著提高计算效率。该模型在长上下文检索方面表现优异,适合企业数据处理需求。公司计划逐步向公众开放模型,并探索更高效的架构。

注意力机制之后是什么?这家初创公司表示它已经知道了。

The New Stack The New Stack · 2026-07-02T17:00:00Z

本文讨论了在多卡训练中通过重叠通信与计算提高效率的方法。重叠分为三个层次:第一层使用cp.async在内核内实现异步加载,第二层通过CUDA流实现内核间的并发,第三层利用NCCL在分布式环境中实现通信与计算的重叠。重叠可以隐藏等待时间,但也会导致资源争抢和同步开销。

【GPU 算子工程】通信与计算重叠:NCCL collective 与 kernel overlap

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
Modular:零日:MiniMax M3在Modular云上的开放权重

MiniMax M3是最新的开源模型,优化了编码和多模态任务。其稀疏注意力机制显著提高了计算效率,减少了每个令牌的计算需求,提升了速度。该模型在Modular平台上可供企业客户使用,支持实时患者对话的灵活推理。

Modular:零日:MiniMax M3在Modular云上的开放权重

Modular Blog Modular Blog · 2026-06-11T00:00:00Z
让矩阵归模拟,让逻辑归数字!这家中国团队重新定义了计算机

安纳智芯专注于模拟计算,解决了传统模拟计算的精度问题,开发出高精度的模拟芯片。这些芯片能够直接求解矩阵方程,显著提高计算效率。模拟计算具有更高的并行度和更低的功耗,未来可能改变AI基础设施,推动智能系统的发展。

让矩阵归模拟,让逻辑归数字!这家中国团队重新定义了计算机

量子位 量子位 · 2026-06-08T04:36:03Z
为长时间运行的代理构建上下文修剪管道

本文介绍了为长时间运行的人工智能代理构建上下文修剪管道,以高效管理对话记忆。讨论了无界对话历史对大型语言模型的影响,并利用句子嵌入模型计算当前提示与历史对话的语义相似性。通过选择最近的对话和最相关的历史记录,构建精简的上下文窗口,从而节省计算资源和内存,提高效率。

为长时间运行的代理构建上下文修剪管道

MachineLearningMastery.com MachineLearningMastery.com · 2026-05-28T12:00:39Z
SilverTorch:索引即模型——推荐系统的新检索范式

SilverTorch是一种新型推荐系统,结合用户生成内容的检索组件,提升了吞吐量和计算效率。通过“索引即模型”方法,SilverTorch显著提高了推荐质量和响应速度,支持复杂模型和多任务评分,能够在低延迟下处理更多候选项,降低计算成本并加快工程迭代速度。

SilverTorch:索引即模型——推荐系统的新检索范式

Engineering at Meta Engineering at Meta · 2026-05-26T16:00:01Z
Google Axion实例现已在Elastic Cloud托管上可用

Elastic Cloud推出了基于Google Axion的CPU优化Arm硬件配置,性能提升达25%。该配置适用于搜索、监控和安全工作负载,用户可轻松创建或迁移部署,享受更高的计算效率和成本效益。

Google Axion实例现已在Elastic Cloud托管上可用

Elastic Blog - Elasticsearch, Kibana, and ELK Stack Elastic Blog - Elasticsearch, Kibana, and ELK Stack · 2026-04-23T00:00:00Z
推理速度提升3倍,多伦多大学等提出dnaHNet,基因组学习计算成本降低近4倍

dnaHNet模型是一种新型基因组学习模型,通过动态分块机制自我学习序列结构,显著提升了计算效率和表达能力。在变异效应预测和基因必需性分类等任务中表现优异,计算成本降低3.89倍,为基因组解析提供了新思路。

推理速度提升3倍,多伦多大学等提出dnaHNet,基因组学习计算成本降低近4倍

HyperAI超神经 HyperAI超神经 · 2026-04-20T07:12:26Z
英伟达最强B200算力浪费60%!普林斯顿团队出手,利用率升至71%

普林斯顿团队发现英伟达B200 GPU因软硬件不匹配导致60%算力浪费,利用率仅为20%-30%。经过FlashAttention-4算法优化后,利用率提升至71%。该算法通过改进指数运算和内存管理,显著提高计算效率,并将编译速度提升至30倍。

英伟达最强B200算力浪费60%!普林斯顿团队出手,利用率升至71%

量子位 量子位 · 2026-03-18T00:31:26Z
复盘AI芯片技术路线 专用芯片复刻矿机历程

Taalas公司推出了一种新型AI硬件,将Llama 3.1模型直接固化在芯片中,显著降低输出延迟并提升计算效率。这种“模型即硬件”的设计克服了传统GPU的内存瓶颈,适用于复杂决策和实时推理,展现出优越的能效和成本优势。

复盘AI芯片技术路线 专用芯片复刻矿机历程

dotNET跨平台 dotNET跨平台 · 2026-03-07T00:01:23Z
20秒完成15天预报,欧洲科研团队提出高分辨率区域海洋预报模型SeaCast

芬兰和意大利的研究团队开发了基于图神经网络的SeaCast模型,能够快速进行高分辨率海洋预报,显著提高计算效率和预报准确性,优于传统的MedFS模型。该模型通过历史数据训练,满足区域海洋预报需求,推动了人工智能在海洋预报中的应用。

20秒完成15天预报,欧洲科研团队提出高分辨率区域海洋预报模型SeaCast

HyperAI超神经 HyperAI超神经 · 2026-02-27T06:02:25Z
内存占用最高降低75%,美国能源部科学家提出跨通道分层聚合方法D-CHAG,实现极大规模模型多通道数据集运行

研究人员提出了一种分布式跨通道分层聚合方法(D-CHAG),有效解决了多通道数据集的内存瓶颈和计算效率问题。该方法在高光谱成像和天气预测任务中表现优异,内存占用降低75%,吞吐量提升超过2倍。

内存占用最高降低75%,美国能源部科学家提出跨通道分层聚合方法D-CHAG,实现极大规模模型多通道数据集运行

HyperAI超神经 HyperAI超神经 · 2026-02-11T08:16:45Z
推动vLLM WideEP和大规模服务在Blackwell平台上的成熟(第一部分)

vLLM团队在NVIDIA GB200平台上优化性能,实现26.2K预填TPGS和10.1K解码TPGS,较H200提升3-5倍。通过低精度操作、内核融合和权重卸载等技术,显著提升计算效率和带宽利用率。

推动vLLM WideEP和大规模服务在Blackwell平台上的成熟(第一部分)

vLLM Blog vLLM Blog · 2026-02-03T00:00:00Z
MoE比你想象的更强大:基于RoE的超并行推理扩展

本文介绍了一种名为RoE的超并行推理框架,旨在提升大语言模型(LLM)在标记级别的预测质量。RoE通过动态组合多个专家模型,利用受控随机性为每个标记采样多个专家,从而实现更准确的预测。此外,该方法在计算效率上进行了优化,使得7B MoE模型的性能可与10.5B MoE模型相媲美,同时减少了30%的计算需求。

MoE比你想象的更强大:基于RoE的超并行推理扩展

Apple Machine Learning Research Apple Machine Learning Research · 2026-01-12T00:00:00Z
谷歌的张量处理单元(TPU)是如何工作的?

TPU(张量处理单元)是谷歌为深度学习设计的专用芯片,采用脉动阵列结构,显著提升计算效率。通过减少数据移动和优化矩阵运算,TPU解决了计算瓶颈,支持大规模语言模型的训练与推理。

谷歌的张量处理单元(TPU)是如何工作的?

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-01-05T16:31:12Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码