小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek MLA+MoE+FP8三招破局:系统级优化六个狠招

DeepSeek通过系统级创新,用2048块H800和557.6万美元完成训练,成本仅为GPT-4o的二十分之一。它未发明新技术,但优化了MLA压缩KV缓存、MoE专家激活、FP8混合精度训练、DualPipe计算通信重叠等六项技术,显著降低内存和算力消耗,提升效率,突破芯片限制。

DeepSeek MLA+MoE+FP8三招破局:系统级优化六个狠招

极道 极道 · 2026-08-27T10:02:00Z
KTransformers v0.7.0发布:原生FP8 LoRA、AVX512 CPU与全量微调

KTransformers v0.7.0发布,聚焦微调优化。支持直接加载原生FP8权重进行LoRA训练,将专家权重内存减半;新增AVX512 CPU后端,使AMD/x86平台可参与超大规模MoE微调;提供LoRA与全量微调选择,支持检查点保存恢复及CPU激活复用。附完整Cookbook指南,安装命令为pip install "ktransformers[sft]==0.7.0"。

KTransformers v0.7.0发布:原生FP8 LoRA、AVX512 CPU与全量微调

Home | KVCache.ai Home | KVCache.ai · 2026-08-25T00:00:00Z
从代码开发到自动化执行,Muse-Glimmer-30B让本地Agent更强大;Qwen3.8-27B-FP8发布,270亿参数挑战高效推理极限

Muse-Glimmer-30B是Meta推出的300亿参数多模态智能体模型,支持本地运行,融合推理、工具调用和多模态理解,性能优异。文章还介绍了HyperAI平台更新的数据集、教程及社区内容,涵盖人物画像、车辆检测、分子处理、语音识别等AI资源。

从代码开发到自动化执行,Muse-Glimmer-30B让本地Agent更强大;Qwen3.8-27B-FP8发布,270亿参数挑战高效推理极限

HyperAI超神经 HyperAI超神经 · 2026-08-22T09:16:25Z

低精度算子(如INT8/FP8)在大模型推理和训练中至关重要,能够显著减少访存和提高算力。量化通过将浮点值映射到低位宽整数,采用对称或非对称量化方式。粒度选择影响精度,per-channel量化能更好保留精度。反量化应尽量晚进行,以减少精度损失。设计时需注意累加精度、舍入方式一致性和离群值处理等问题,以确保数值正确性。

【GPU 算子工程】量化与多精度算子:INT8 / FP8、反量化与 per-channel

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
摩尔线程S5000 + 智源FlagOS:基于原生FP8引擎,Day-0适配DeepSeek-V4

摩尔线程与智源众智FlagOS社区合作,在MTT S5000 GPU上快速适配DeepSeek-V4-Flash模型。该模型采用混合专家架构,参数量达到284B,支持百万token上下文。MTT S5000原生支持FP8精度,提升计算效率。双方通过编译优化和自动调优,提升了FP8和Sparse Attention算子的性能,降低延迟并提高吞吐量。未来将继续推进DeepSeek-V4-Pro的适配工作。

摩尔线程S5000 + 智源FlagOS:基于原生FP8引擎,Day-0适配DeepSeek-V4

实时互动网 实时互动网 · 2026-04-24T08:03:31Z

本文探讨了量化在大模型推理中的重要性,强调通过将模型权重和激活从高精度压缩到低精度,显著降低显存和带宽需求。量化提高了推理效率,降低了成本,使得在有限硬件上运行大型模型成为可能。文章介绍了不同数据类型的特点、量化算法及其应用,强调了量化在长上下文和大批量推理中的优势。

【大模型基础设施工程】14:量化工程 —— INT8 / FP8 / FP4 / AWQ / GPTQ

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z

Ling 2.0 采用 FP8 混合精度训练,显著提升了训练效率和显存利用率。细粒度量化减少了量化误差,确保模型效果接近 BF16。与 LLaMA 3.1 和 Qwen3 比较,Ling-mini-2.0 在多 GPU 环境下吞吐量提升达 30-120%。该方案为低精度训练提供了有效路径,解决了计算资源和能耗挑战。

聊一聊我们最近开源的 Ling 2.0 原生 FP8 混合精度训练

千千 千千 · 2025-09-15T17:26:29Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化爬取流程。

DeepSeek刚提到FP8,英伟达就把FP4精度推向预训练,更快、更便宜

机器之心 机器之心 · 2025-08-27T12:52:49Z

DeepSeek-V3.1采用UE8MO FP8精度,显著提升AI模型训练效率,优化动态范围,降低显存和功耗,适应国产芯片需求,推动国产AI芯片技术进步。

DeepSeek采用的UE8M0 FP8 为什么引爆了A股的芯片板块

dotNET跨平台 dotNET跨平台 · 2025-08-25T00:03:17Z

DeepSeek-V3.1采用UE8MO FP8参数精度,显著提升AI模型训练效率,降低显存占用,支持国产芯片发展,助力应对技术封锁。

DeepSeek采用的UE8M0 FP8 为什么引爆了A股的芯片板块 - 张善友

张善友 张善友 · 2025-08-24T10:55:00Z
Deepseek V3.1 引爆A股!神秘代码 UE8M0 揭秘,华为升腾背后的“国运”豪赌

DeepSeek V3.1的发布引发市场关注,尽管性能提升不明显,但因UE8M0和FP8的参数精度适配国产芯片而受到重视。文章分析了UE8M0的计算精度演变及其对大模型的影响,强调国产算力芯片与国际技术的关系,并警示未来发展需谨慎。

Deepseek V3.1 引爆A股!神秘代码 UE8M0 揭秘,华为升腾背后的“国运”豪赌

硕鼠的博客站 硕鼠的博客站 · 2025-08-24T00:41:25Z

DeepSeek V3.1发布后,UE8M0 FP8概念推动国产芯片股价大涨,标志着国产AI向软硬协同发展。UE8M0 FP8通过优化数据处理提升芯片性能,减少对外部算力依赖,增强国产芯片竞争力。

DeepSeek一句话让国产芯片集体暴涨!背后的UE8M0 FP8到底是个啥

量子位 量子位 · 2025-08-22T06:24:47Z

DeepSeek是一个国产大模型,采用FP8混合精度训练和MoE架构,显著降低了算力需求,但在医疗影像等任务中存在精度问题。其半开放式开源策略吸引了开发者,但对英伟达架构的依赖可能导致技术脆弱。整体而言,DeepSeek体现了中国AI的创新与挑战。

解剖DeepSeek四把刀,一场深到源码,大到行业,细到人心的手术盛宴

京东科技开发者 京东科技开发者 · 2025-06-03T08:54:32Z

本研究解决了深度搜索模型量化后的性能问题,评估了多位宽量化的效果。结果显示,4位量化与FP8相比性能下降极小,并提出了DQ3_K_M动态3位量化方法,优于传统方法。

Quantitative Analysis of Performance Degradation in Deep Search Model Quantization

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-05T00:00:00Z

DeepSeek发布了开源矩阵乘法库DeepGEMM,专为英伟达Hopper GPU设计,支持FP8格式,提升AI训练效率。核心代码仅300行,简单易用,适用于多种AI架构,性能优于专家优化库。开发者可在GitHub获取代码。

DeepSeek AI开源周3/5:开源DeepGEMM通用矩阵乘法库提高效率

蓝点网 蓝点网 · 2025-03-21T16:42:05Z
FP8模型不再挑卡!DeepSeek推理成本减半速度翻番,清华团队开源「赤兔」推理引擎

国产大模型推理引擎「赤兔」已开源,支持多种GPU和国产芯片,显著降低部署成本并提升速度,旨在解决大模型落地的技术瓶颈,推动国内AI生态发展。

FP8模型不再挑卡!DeepSeek推理成本减半速度翻番,清华团队开源「赤兔」推理引擎

机器之心 机器之心 · 2025-03-14T04:06:13Z
FP8训练新范式:减少40%显存占用,训练速度提高1.4倍

DeepSeek V3 通过 FP8 精度显著降低 GPU 内存和计算开销,提出 COAT 方法,优化内存利用率和训练速度,实现内存减少 1.54 倍,速度提升 1.43 倍,同时保持模型精度,支持大规模模型训练。

FP8训练新范式:减少40%显存占用,训练速度提高1.4倍

机器之心 机器之心 · 2025-03-07T02:30:28Z
关于DeepSeek我是怎么研究的(4)

DeepSeek-V3模型基于Transformer架构,采用MLA和DeepSeekMoE设计,优化了专家划分和负载均衡策略。使用FP8混合精度框架进行训练,提高了效率和性能。DeepSeek的开源特性使中小企业和学术机构能够以低成本使用大模型,推动AI领域发展。

关于DeepSeek我是怎么研究的(4)

Shadow Walker 松烟阁 Shadow Walker 松烟阁 · 2025-03-02T03:30:04Z
DeepSeek开源通用矩阵乘法库,300行代码加速V3、R1,R2被曝五月前问世

DeepGEMM 是一款开源的 FP8 GEMM 库,支持密集型和专家混合计算,在 Hopper GPU 上可实现超过 1350 TFLOPS 的性能。该库代码简洁,仅有 300 行,适合学习 FP8 矩阵乘法。DeepSeek 计划在 5 月前发布新一代 R2 模型,以提升代码生成能力。

DeepSeek开源通用矩阵乘法库,300行代码加速V3、R1,R2被曝五月前问世

机器之心 机器之心 · 2025-02-26T03:25:20Z
一文看懂 DeepSeek 开源项目第三弹,300 行代码揭示 V3/R1 推理效率背后的关键

DeepGEMM 是一个针对 FP8 通用矩阵乘法优化的库,支持普通和混合专家(MoE)分组 GEMM。它采用即时编译(JIT),无需预编译,能够根据设备动态调整代码,提高计算效率。DeepGEMM 设计简洁,核心代码约 300 行,特别适合现代 AI 计算,尤其在高效推理和低功耗场景中表现突出。

一文看懂 DeepSeek 开源项目第三弹,300 行代码揭示 V3/R1 推理效率背后的关键

爱范儿 爱范儿 · 2025-02-26T02:58:08Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码