小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
消费级显卡价格继续上涨:英伟达已通知AIC/AIB上调GDDR显存价格

#硬件设备 消费级显卡价格继续上涨:产业链消息称英伟达已经通知 AIC/AIB 上调 GDDR 显存价格,随后诸多厂商直接封仓等待调价政策 8 月落地。封仓停止出货导致 7 月末显卡供应继续缩减因此价格持续上涨,而 8 月份调价落地后显卡价格可能还会继续涨。价格方面,8GB 显存涨价 76 美元,12GB 显存涨价 114 美元,16GB 显存涨价 152...

消费级显卡价格继续上涨:英伟达已通知AIC/AIB上调GDDR显存价格

蓝点网
蓝点网 · 2026-07-25T06:34:13Z
AMD MI455X与Rubin显存容量带宽竞争解析

AMD MI455X与NVIDIA Rubin在AI芯片性能上存在显著差异。虽然AMD的显存容量为432GB,NVIDIA为288GB,但生成速度主要取决于内存带宽而非容量。AMD通过增加堆栈数量提升容量,而NVIDIA则提高每个堆栈的速度以增强带宽。最终,带宽对大模型推理速度的影响更为关键,AMD适合处理更大模型,而NVIDIA优化了数据搬运速度。

AMD MI455X与Rubin显存容量带宽竞争解析

极道
极道 · 2026-07-15T23:37:00Z
PyTorch性能优化必知:内核与显存读写到底咋回事

本文讨论了PyTorch中GPU性能优化的关键概念,特别是内核与显存读写的关系。内核是GPU执行的程序,性能主要受数据在显存中读写次数的影响。通过操作融合可以减少显存流量,提高运行速度。此外,使用torch.compile工具可以自动优化代码,减少内核数量,提升性能。

PyTorch性能优化必知:内核与显存读写到底咋回事

极道
极道 · 2026-07-15T06:33:00Z
Kueue + HAMi vGPU 实战:显存与算力配额管理

本文讨论了Kueue与HAMi vGPU的结合,重点在于GPU显存和算力配额的管理。通过环境准备、资源模型和演示,展示了在Kubernetes中有效切分和管理GPU资源的方法,确保多个任务合理使用GPU,避免资源冲突,实现GPU集群的多租户管理能力。

Kueue + HAMi vGPU 实战:显存与算力配额管理

探索云原生
探索云原生 · 2026-07-14T22:00:00Z

FlashAttention通过分块在线softmax优化Transformer的注意力机制,显著降低显存和计算速度瓶颈。它采用流式计算,避免物化整个分数矩阵,减少内存访问,提高效率。实测表明,FlashAttention在长序列处理上具有显著优势,并在反向传播时通过重算降低显存需求。

【GPU 算子工程】FlashAttention:在线 softmax 与 IO-aware 注意力

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
在线教程丨UC伯克利/英伟达等发布3DGS开源库gsplat,节省4倍显存,训练时间缩短10%

自2023年《3D Gaussian Splatting for Real-Time Rendering of Radiance Fields》发布以来,3DGS技术在三维重建领域迅速崛起。与传统NeRF相比,3DGS在渲染速度和视觉质量上有显著提升,但对显存和计算资源的要求较高。加州大学伯克利分校等机构开发的开源项目gsplat优化了训练框架,显著降低了资源需求,支持多种数据来源,并提供实时Web查看功能,便于快速验证模型。

在线教程丨UC伯克利/英伟达等发布3DGS开源库gsplat,节省4倍显存,训练时间缩短10%

HyperAI超神经
HyperAI超神经 · 2026-06-25T05:47:12Z

AMD计划在2026年第三季度对RX9000系列显卡涨价10%~15%,原因是显存价格上涨。尽管涨价在计划中,可能会影响销量。显卡价格普遍上涨,尤其是高性能显卡。英伟达暂时不打算涨价,但高价显卡仍让消费者困扰。制造商面临滞销风险,零售商可能需降价以回收成本。

有传闻称AMD计划再次提高RX9000系列显卡价格 原因是显存价格继续上涨

蓝点网
蓝点网 · 2026-06-22T04:12:34Z
智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

GLM-5.2是一个7530亿参数的开源大模型,具有百万token的上下文窗口和创新架构。其完整权重为1.51TB,普通硬件无法支持。最佳本地运行选择为256GB内存的Mac Studio,生成速度为每秒3-9个token。大多数用户应选择云GPU租用或API调用,以降低成本和技术门槛。

智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

极道
极道 · 2026-06-19T03:06:00Z
谷歌发布并开源Gemma 4 12B版多模态模型 可在16GB内存/显存上运行

谷歌发布了Gemma 4 12B多模态模型,支持文本、图片、视频和音频输入,能够在仅16GB内存的消费级设备上运行。该模型采用无编码器架构,降低延迟并简化输入处理,智能化程度接近Gemma 26B版。开发者可在多个平台体验和下载该模型。

谷歌发布并开源Gemma 4 12B版多模态模型 可在16GB内存/显存上运行

蓝点网
蓝点网 · 2026-06-04T04:00:42Z
理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

本文探讨了大语言模型中KV Cache的产生与管理及其在推理过程中的重要性。KV Cache通过缓存历史K/V向量,优化生成过程并减少计算复杂度。Prefill阶段处理所有输入,而Decode阶段逐步生成输出,二者需分离以提升性能。vLLM采用页式内存管理,解决内存碎片问题,提升存储效率,确保高效的推理系统。

理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

Steins;Lab
Steins;Lab · 2026-05-06T16:28:41Z

本文探讨了Transformer模型中注意力机制的复杂度问题,特别是O(n²)的计算和显存瓶颈。尽管已有多种降复杂度方案,如FlashAttention和Sparse Attention,但主流模型仍使用O(n²)的全注意力机制。FlashAttention优化了显存使用,提升了性能,但计算复杂度未变。长上下文的挑战涉及复杂度、质量、位置编码和训练数据等多个因素。

【Transformer 与注意力机制】18|注意力的复杂度问题

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

美光计划将游戏GPU的GDDR显存进行堆叠,以满足AI数据中心对高内存的需求。这可能导致显存供应紧张和价格上涨。尽管GDDR内存性能低于HBM3,但堆叠后容量更大,AI行业愿意采用。这一变化可能会推高游戏显卡的价格。

美光探索将游戏GPU的GDDR显存堆叠起来组成大容量内存供应给AI数据中心

蓝点网
蓝点网 · 2026-04-01T01:00:17Z
一篇论文引发存储芯片股暴跌,Google 的「DeepSeek 时刻」来了?

Google Research 发布的 TurboQuant AI 压缩算法能够在不损失性能的情况下,将 AI 的工作记忆压缩至少 6 倍,解决显存瓶颈问题。该技术引发市场反应,导致存储芯片股价下跌。尽管前景广阔,但仍需克服训练阶段的显存消耗问题。

一篇论文引发存储芯片股暴跌,Google 的「DeepSeek 时刻」来了?

爱范儿
爱范儿 · 2026-03-26T05:41:43Z

本文介绍了大模型并发推理的显存计算方法,指出KV Cache是显存增长的主要因素。通过7B、32B和70B模型的示例,分析了不同并发数下的显存需求及推荐的GPU配置。建议采用张量并行和专家并行来优化显存使用,以满足系统内存和CPU核心数的需求。

大模型并发场景GPU显存资源计算

安志合的学习博客
安志合的学习博客 · 2026-03-20T02:30:06Z
传闻称英伟达正在准备9GB显存版的RTX 5050显卡 采用3颗GDDR7 3GB显存颗粒

英伟达正在研发9GB显存的RTX 5050显卡,配备3颗GDDR7 3GB内存,显存带宽提升至28Gbps,性能有所提高,预计价格也会更高。同时,英伟达还在开发RTX 5060改进版,使用GB205核心,性能低于RTX 5070。

传闻称英伟达正在准备9GB显存版的RTX 5050显卡 采用3颗GDDR7 3GB显存颗粒

蓝点网
蓝点网 · 2026-03-06T08:53:29Z
阿里巴巴发布Qwen3.5中型系列模型 量化版可在24GB内存/显存的上本地运行

阿里巴巴通义千问团队发布了Qwen3.5中型系列模型,强调以更小的参数实现更高的智能。新模型在基准测试中超越了旧版,支持在24GB内存设备上运行,适合个人和企业使用。

阿里巴巴发布Qwen3.5中型系列模型 量化版可在24GB内存/显存的上本地运行

蓝点网
蓝点网 · 2026-02-25T06:13:02Z

文章讨论了HP战99 Ultra笔记本在AI推理中的表现,搭载AMD AI Max+ 395处理器。分析了显存与统一内存的区别,并测试了不同模型的推理性能,指出显存分配的局限性。尽管性能不及高端显卡,但在特定场景下仍能运行一些模型,适合小主机使用。

可划分显存 != 统一内存:AI Max+ 395 64G AI推理性能

ddadaal.me
ddadaal.me · 2026-02-02T12:34:00Z
博板堂消息称AMD和英伟达显卡最早可能从1月开始涨价 接下来几个月可能还要继续涨

博板堂消息称,AMD将于2026年1月起涨价,英伟达在2月涨价。涨价由下游AIC制造商决定,因显存价格上涨,成本增加,预计显卡价格将持续上调。

博板堂消息称AMD和英伟达显卡最早可能从1月开始涨价 接下来几个月可能还要继续涨

蓝点网
蓝点网 · 2025-12-29T03:38:46Z
不同显寸对应的可运行的模型大小 - 蝈蝈俊

在有限显存下,运行大型语言模型需平衡模型规模、量化精度和上下文长度。显存需求受模型参数、上下文缓存和系统开销影响,增加上下文长度会迅速消耗显存。选择合适的量化格式可提升性能。

不同显寸对应的可运行的模型大小 - 蝈蝈俊

蝈蝈俊
蝈蝈俊 · 2025-12-12T08:39:00Z
来看下我装备了5060TI显卡的gpt-oss模型表现

在3060笔记本上测试gpt-oss时,生成速度为4.66token/s。更换为5060TI后,速度提升至27.91token/s,效果更佳。显存加载显著影响性能,未来可尝试32B模型。

来看下我装备了5060TI显卡的gpt-oss模型表现

Nicksxs's Blog
Nicksxs's Blog · 2025-11-30T13:53:14Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码