小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
6GB显存能跑35B MoE吗:FreeToken极限配置、性能压榨与实操教程

6GB显存可运行Qwen3.6-35B-A3B-NVFP4,但需32GB以上内存,依赖CPU和PCIe。配置建议:Triton attention、memory-ratio 0.92、Prefill 2048、512专家槽。性能低于8GB的39.3 tok/s,适合短上下文和编码实验。需Ampere架构,逐步调优专家缓存和KV,实测不同后端。

6GB显存能跑35B MoE吗:FreeToken极限配置、性能压榨与实操教程

Nicksxs's Blog Nicksxs's Blog · 2026-09-05T02:00:00Z
32GB大显存加持,英特尔锐炫Pro B70搞定AI漫剧创作

英特尔在广州举办AIGC创作研讨会,推出基于锐炫Pro B70专业显卡的本地化AI视频制作方案。该显卡具备32GB显存和367 TOPS算力,支持“云端+本地”混合模式,降低算力门槛,实现从剧本到成片的全流程生成,助力中小团队高效创作。

32GB大显存加持,英特尔锐炫Pro B70搞定AI漫剧创作

量子位 量子位 · 2026-08-29T11:35:57Z
Qwen 3.8 27B YaRN 768K 上下文实测

文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。

Qwen 3.8 27B YaRN 768K 上下文实测

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

FreeToken通过专家缓存与CPU-GPU协同,在8GB显存上运行35B MoE模型。它将完整专家池存于内存,显存作为LRU缓存,按q*策略动态分配未命中专家至GPU或CPU,Prefill用双缓冲隐藏传输,并优化Agent状态缓存。相比llama.cpp静态卸载,FreeToken更高效,但仅适用于MoE模型。

8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

Nicksxs's Blog Nicksxs's Blog · 2026-08-23T12:41:00Z
有传闻称英伟达正在开发新技术 将用户的SSD当额外的显存使用 减少游戏卡顿

传闻英伟达正开发新技术,利用高速SSD作为额外显存,结合RTX IO和微软DirectStorage,让GPU直接处理SSD数据,缓解显存不足时的卡顿。此举或为应对内存价格高企,但消息尚未证实。

有传闻称英伟达正在开发新技术 将用户的SSD当额外的显存使用 减少游戏卡顿

蓝点网 蓝点网 · 2026-08-06T03:47:30Z
8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南

2026年本地部署大模型趋势显示,万亿参数模型如Kimi K3可通过流式加载在8GB内存CPU上运行,但速度极慢。部署关键取决于显存容量和内存带宽,8GB适合小模型,80GB以上可运行120B模型。DeepSeek V4 Flash经量化可在128GB内存设备运行。工具选择上,LM Studio适合新手,Ollama适合开发者,llama.cpp提供精细控制。本地部署需权衡成本、速度与隐私。

8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南

爱范儿 爱范儿 · 2026-08-05T06:23:46Z
消费级显卡价格继续上涨:英伟达已通知AIC/AIB上调GDDR显存价格

英伟达通知显卡厂商上调GDDR显存价格,8月生效,导致AIC厂商封仓停售,显卡供应缩减、价格上涨。8GB显存涨76美元,12GB涨114美元,16GB涨152美元,影响RTX50系及部分中低端显卡,RTX 50 SUPER系列或暂缓发售。

消费级显卡价格继续上涨:英伟达已通知AIC/AIB上调GDDR显存价格

蓝点网 蓝点网 · 2026-07-25T06:34:13Z
AMD MI455X与Rubin显存容量带宽竞争解析

AMD MI455X与NVIDIA Rubin在AI芯片性能上存在显著差异。虽然AMD的显存容量为432GB,NVIDIA为288GB,但生成速度主要取决于内存带宽而非容量。AMD通过增加堆栈数量提升容量,而NVIDIA则提高每个堆栈的速度以增强带宽。最终,带宽对大模型推理速度的影响更为关键,AMD适合处理更大模型,而NVIDIA优化了数据搬运速度。

AMD MI455X与Rubin显存容量带宽竞争解析

极道 极道 · 2026-07-15T23:37:00Z
PyTorch性能优化必知:内核与显存读写到底咋回事

本文讨论了PyTorch中GPU性能优化的关键概念,特别是内核与显存读写的关系。内核是GPU执行的程序,性能主要受数据在显存中读写次数的影响。通过操作融合可以减少显存流量,提高运行速度。此外,使用torch.compile工具可以自动优化代码,减少内核数量,提升性能。

PyTorch性能优化必知:内核与显存读写到底咋回事

极道 极道 · 2026-07-15T06:33:00Z
Kueue + HAMi vGPU 实战:显存与算力配额管理

本文讨论了Kueue与HAMi vGPU的结合,重点在于GPU显存和算力配额的管理。通过环境准备、资源模型和演示,展示了在Kubernetes中有效切分和管理GPU资源的方法,确保多个任务合理使用GPU,避免资源冲突,实现GPU集群的多租户管理能力。

Kueue + HAMi vGPU 实战:显存与算力配额管理

探索云原生 探索云原生 · 2026-07-14T22:00:00Z

FlashAttention通过分块在线softmax优化Transformer的注意力机制,显著降低显存和计算速度瓶颈。它采用流式计算,避免物化整个分数矩阵,减少内存访问,提高效率。实测表明,FlashAttention在长序列处理上具有显著优势,并在反向传播时通过重算降低显存需求。

【GPU 算子工程】FlashAttention:在线 softmax 与 IO-aware 注意力

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
在线教程丨UC伯克利/英伟达等发布3DGS开源库gsplat,节省4倍显存,训练时间缩短10%

自2023年《3D Gaussian Splatting for Real-Time Rendering of Radiance Fields》发布以来,3DGS技术在三维重建领域迅速崛起。与传统NeRF相比,3DGS在渲染速度和视觉质量上有显著提升,但对显存和计算资源的要求较高。加州大学伯克利分校等机构开发的开源项目gsplat优化了训练框架,显著降低了资源需求,支持多种数据来源,并提供实时Web查看功能,便于快速验证模型。

在线教程丨UC伯克利/英伟达等发布3DGS开源库gsplat,节省4倍显存,训练时间缩短10%

HyperAI超神经 HyperAI超神经 · 2026-06-25T05:47:12Z

AMD计划在2026年第三季度对RX9000系列显卡涨价10%~15%,原因是显存价格上涨。尽管涨价在计划中,可能会影响销量。显卡价格普遍上涨,尤其是高性能显卡。英伟达暂时不打算涨价,但高价显卡仍让消费者困扰。制造商面临滞销风险,零售商可能需降价以回收成本。

有传闻称AMD计划再次提高RX9000系列显卡价格 原因是显存价格继续上涨

蓝点网 蓝点网 · 2026-06-22T04:12:34Z
智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

GLM-5.2是一个7530亿参数的开源大模型,具有百万token的上下文窗口和创新架构。其完整权重为1.51TB,普通硬件无法支持。最佳本地运行选择为256GB内存的Mac Studio,生成速度为每秒3-9个token。大多数用户应选择云GPU租用或API调用,以降低成本和技术门槛。

智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

极道 极道 · 2026-06-19T03:06:00Z
谷歌发布并开源Gemma 4 12B版多模态模型 可在16GB内存/显存上运行

谷歌发布了Gemma 4 12B多模态模型,支持文本、图片、视频和音频输入,能够在仅16GB内存的消费级设备上运行。该模型采用无编码器架构,降低延迟并简化输入处理,智能化程度接近Gemma 26B版。开发者可在多个平台体验和下载该模型。

谷歌发布并开源Gemma 4 12B版多模态模型 可在16GB内存/显存上运行

蓝点网 蓝点网 · 2026-06-04T04:00:42Z
6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

文章讨论了在本地运行小型开源模型的可行性,特别是使用llama.cpp项目。作者分享了在Windows上使用3060显卡运行Qwen3.6 9B模型的设置,包括CUDA版本和参数配置。尽管显存有限,这些模型在简单任务中仍能有效使用。

6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

Nicksxs's Blog Nicksxs's Blog · 2026-05-31T14:07:14Z
理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

本文探讨了大语言模型中KV Cache的产生与管理及其在推理过程中的重要性。KV Cache通过缓存历史K/V向量,优化生成过程并减少计算复杂度。Prefill阶段处理所有输入,而Decode阶段逐步生成输出,二者需分离以提升性能。vLLM采用页式内存管理,解决内存碎片问题,提升存储效率,确保高效的推理系统。

理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

Steins;Lab Steins;Lab · 2026-05-06T16:28:41Z

本文探讨了Transformer模型中注意力机制的复杂度问题,特别是O(n²)的计算和显存瓶颈。尽管已有多种降复杂度方案,如FlashAttention和Sparse Attention,但主流模型仍使用O(n²)的全注意力机制。FlashAttention优化了显存使用,提升了性能,但计算复杂度未变。长上下文的挑战涉及复杂度、质量、位置编码和训练数据等多个因素。

【Transformer 与注意力机制】18|注意力的复杂度问题

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

美光计划将游戏GPU的GDDR显存进行堆叠,以满足AI数据中心对高内存的需求。这可能导致显存供应紧张和价格上涨。尽管GDDR内存性能低于HBM3,但堆叠后容量更大,AI行业愿意采用。这一变化可能会推高游戏显卡的价格。

美光探索将游戏GPU的GDDR显存堆叠起来组成大容量内存供应给AI数据中心

蓝点网 蓝点网 · 2026-04-01T01:00:17Z
一篇论文引发存储芯片股暴跌,Google 的「DeepSeek 时刻」来了?

Google Research 发布的 TurboQuant AI 压缩算法能够在不损失性能的情况下,将 AI 的工作记忆压缩至少 6 倍,解决显存瓶颈问题。该技术引发市场反应,导致存储芯片股价下跌。尽管前景广阔,但仍需克服训练阶段的显存消耗问题。

一篇论文引发存储芯片股暴跌,Google 的「DeepSeek 时刻」来了?

爱范儿 爱范儿 · 2026-03-26T05:41:43Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码