小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
8GB显存就够,Strata 让普通电脑也能运行千亿参数大模型

开源项目 Strata 支持在普通电脑本地运行千亿参数大模型 Qwen3.8-Flash-Next,通过将部分模型放入内存和固态硬盘,8GB 显存即可运行,但内存需 32GB 起步、推荐 64GB。生成速度约 20 至 70 tok/s,40 以上可用,无需 API 费用,AMD 用户可用 gufo。

8GB显存就够,Strata 让普通电脑也能运行千亿参数大模型

小众软件 小众软件 · 2026-10-10T08:44:15Z

作者在RTX 4090 24GB上以Strata替代Ollama推理Qwen3.8-Flash-Next(512专家MoE),专家权重驻留内存、GPU仅缓存热专家,配256K上下文与int8 KV。解码中位约100–110 tok/s,冷预填充约2500–2800 tok/s。官方GSQ-RCO IQ3_S量化优于Unsloth,整体探索时间从12分钟降至8分钟。服务单请求串行,两三人使用尚可。

在4090 24GB上运行Qwen3.8-Flash-Next:用Strata替代Ollama

https://blog.ferstar.org/en/index.xml https://blog.ferstar.org/en/index.xml · 2026-10-04T05:24:00Z
在线教程丨Qwen4架构抢先体验,Qwen3.8-Flash-Next开源,训练成本仅为前代1/9

阿里通义千问发布Qwen3.8-Flash-Next,作为Qwen4架构预览,采用多模态MoE设计,通过混合注意力、门控残差和N-gram嵌入提升效率,主模型125B参数,激活仅6B,训练成本降至1/9,支持262K上下文,可扩展至百万Token,并已上线HyperAI教程供一键部署体验。

在线教程丨Qwen4架构抢先体验,Qwen3.8-Flash-Next开源,训练成本仅为前代1/9

HyperAI超神经 HyperAI超神经 · 2026-09-01T09:47:22Z
纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。

纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

张善友 张善友 · 2026-08-28T23:54:00Z
Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

阿里通义千问发布Qwen3.8-Flash-Next开源模型,采用MoE、GDN、QSA、Gated Residual和N-gram Embedding等创新架构,125B参数仅激活6B,成本为前代九分之一,性能超越397B旗舰。训练中发现Muon优化器下Batch Size Warmup无效,可节省18.8%算力,引发行业反思。

Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

极道 极道 · 2026-08-26T22:39:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码