小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
通过 CUDA 缓存技术实现 AI 模型部署加速

AI模型部署耗时主要来自加载权重、KV Cache初始化和CUDA内核编译。作者在T5000芯片上预编译CUDA内核,将cache、triton、nv等目录打包为缓存包,用户下载后无需重复编译,部署时间从40分钟缩短至16分钟。

通过 CUDA 缓存技术实现 AI 模型部署加速

Andy Stewart Andy Stewart · 2026-09-10T16:00:00Z

FireDucks是一个兼容pandas API的编译器加速库,通过惰性执行和多线程优化提升大数据处理性能。基准测试显示,在1000万行数据集上,FireDucks在排序、分组、过滤等七项任务中均快于pandas,速度提升2.66倍至20.77倍,平均7.28倍。安装后仅需替换import语句即可使用,适合大规模数据处理场景。

这个Python库能让Pandas工作负载提速高达20倍

KDnuggets KDnuggets · 2026-09-02T14:00:11Z
Andrew Atkinson:PostgreSQL 18 使用 UUID V7 实现 23 倍插入加速

PostgreSQL 18 采用 UUID v7 主键后,插入性能显著提升,最高达 23 倍。相比 v4 的随机性,v7 的时间顺序性减少了索引页分裂和磁盘读取。切换需执行 ALTER TABLE,但会锁表,通过设置短锁超时和重试机制解决。尽管 v7 会暴露创建时间,但整体收益高,已成为新默认选择。

Andrew Atkinson:PostgreSQL 18 使用 UUID V7 实现 23 倍插入加速

Planet PostgreSQL Planet PostgreSQL · 2026-08-26T11:50:00Z
99CDN:自建 CDN、智能调度与商业化运营的边缘加速平台

99CDN是EasyLink推出的自建CDN平台,支持多节点缓存、多级回源、DNS/GTM智能调度、统一监控、HTTPS证书管理及WAF/CC/DDoS防护。提供免费版至定制版五档套餐,适合网站加速、文件下载、音视频、海外业务及IDC商业化运营,支持私有化部署,成本可控,运维有技术支持。

99CDN:自建 CDN、智能调度与商业化运营的边缘加速平台

小众软件 小众软件 · 2026-08-20T09:33:30Z
智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

8月1日北京举办AI编译器技术沙龙,BAAI团队介绍FlagTree项目,通过Triton语言扩展TLE(分Lite、Struct、Raw三层)平衡抽象与性能,覆盖算子优化、架构调优及原生代码。编译优化包括TileIR后端、自动调优(FlagOSTune加速120倍)、数据布局转换消除及指令重排,显著提升DeepSeek等模型性能,未来聚焦NUMA和MegaKernel。

智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

HyperAI超神经 HyperAI超神经 · 2026-08-08T09:27:09Z
进化生物学新解:发育生长加速程序在晚年变成失控代码

衰老并非零件磨损,而是发育程序在生命后期未关闭的副作用。进化只重早期繁殖,mTOR信号持续过度运转致老化,雷帕霉素抑制可延寿。细胞重编程能逆转表观遗传时钟,证明代码可重写。未来抗衰应重写生命代码,而非修复损伤。

进化生物学新解:发育生长加速程序在晚年变成失控代码

极道 极道 · 2026-08-07T11:17:00Z
资本重仓端侧物理AI:前海母基金数亿元押注,Om AI联汇加速端侧AI商业化落地

杭州联汇科技完成数亿元融资,由前海母基金领投,杭州政府基金参投。公司开源VLX-Seek 1.5多模态模型,性能超越英伟达同级产品,无人机场景准确率提升62.9%。资金将用于技术迭代和物理AI商业化,已落地AIPC、具身智能及视障辅助应用。

资本重仓端侧物理AI:前海母基金数亿元押注,Om AI联汇加速端侧AI商业化落地

量子位 量子位 · 2026-08-04T06:47:06Z
FFmpeg 9.0 发布,增强了 Vulkan 加速、动画 WebP 和更多 AMD AMF 支持

FFmpeg 9.0发布,新增多项Vulkan加速功能,如APV视频解码、ProRes RAW加速、v360滤镜,以及HE-AAC 960解码、CUDA转置、动画WebP支持等。更新还涉及AMF增强、AVX-512优化,并移除旧功能。用户可从源码编译获取最新特性。

FFmpeg 9.0 发布,增强了 Vulkan 加速、动画 WebP 和更多 AMD AMF 支持

实时互动网 实时互动网 · 2026-08-04T02:01:30Z
利用校准稀疏注意力加速文本到视频生成

本文介绍CalibAtt,一种无需训练的加速文本到视频生成方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算。实验表明,在Wan 2.1等模型上,CalibAtt可提升端到端速度达1.58倍,同时保持视频质量和文本对齐。

利用校准稀疏注意力加速文本到视频生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-21T00:00:00Z
燧原科技在WAIC展出基于自研加速模组打造的高性能超节点

燧原科技在WAIC 2026展出高性能AI算力产品,包括基于自研加速模组的超节点(云燧ESL64-O/C)及光互连方案,支持万卡级集群,并展示工业AI、智慧公文等应用,其推理产品已用于大模型及互联网核心业务。

燧原科技在WAIC展出基于自研加速模组打造的高性能超节点

全球TMT-美通国际 全球TMT-美通国际 · 2026-07-20T07:12:36Z

GitHub Copilot为Windows推出了新的迭代构建工具,旨在优化C++项目的构建时间。该工具允许开发者测量每个更改对迭代构建的影响,提供快速反馈,提升工作效率。用户可在Visual Studio 2026中使用此工具。

使用GitHub Copilot加速C++迭代构建

C++ Team Blog C++ Team Blog · 2026-07-17T14:22:57Z
可观察性中的自主AI:加速根本原因分析

生成式AI和自主AI正在改变全球企业的IT运营和可观察性。它们加速数据分析,帮助工程师深入调查系统问题,提高效率。自主AI自动处理重复性任务,支持IT团队管理复杂的微服务架构,实时监控数据,提升云环境的运营。未来,这些工具将更强大,减少人工干预,推动可观察性数据的民主化。

可观察性中的自主AI:加速根本原因分析

The New Stack The New Stack · 2026-07-09T13:00:00Z
Vulkan 光线追踪:逐步弃用主机端加速结构构建

Vulkan 正在逐步淘汰主机端光线追踪加速结构构建命令,转向基于设备地址的路径。主机端命令被标记为弃用,未来将不再添加新功能,开发者应计划迁移到设备端命令。此举旨在简化 API 发展,符合现代引擎架构和硬件趋势。

Vulkan 光线追踪:逐步弃用主机端加速结构构建

实时互动网 实时互动网 · 2026-07-09T03:06:57Z
PEP 836:JIT加速:CPython支持的JIT编译器之路

Python 3.13引入了实验性即时编译器(JIT),在3.15版本中实现了4-12%的性能提升。PEP 744提出了JIT的设计和未来发展路径,目标是在3.17版本前实现至少20%的性能改进。JIT旨在提高CPython性能,同时保持与现有生态系统的兼容性。未来2.5年内,JIT将专注于优化和社区参与,以确保其成为CPython的非实验性特性。

PEP 836:JIT加速:CPython支持的JIT编译器之路

Newest Python PEPs Newest Python PEPs · 2026-07-02T00:00:00Z
NVIDIA BioNeMo代理工具包为Claude Science中的生命科学研究人员带来加速AI

NVIDIA推出BioNeMo代理工具包,旨在支持生命科学研究。科学家可以通过Claude Science与AI代理进行自然语言互动,从而简化研究流程。该工具包加速了基因组分析和蛋白质结构预测等任务的效率,目前已有18家顶级制药公司在使用BioNeMo,推动AI在药物发现领域的应用。

NVIDIA BioNeMo代理工具包为Claude Science中的生命科学研究人员带来加速AI

NVIDIA Blog NVIDIA Blog · 2026-06-30T17:00:38Z
Qt Canvas Painter:通过路径实现加速性能

Qt Canvas Painter引入了QCanvasPath类和路径组,以提高渲染性能。通过优化路径管理,减少每帧更新需求,提升效率。路径组可将相关路径分组,优化GPU缓存,适用于动态和静态图形。使用QCanvasPath可实现渐进式渲染,降低CPU和GPU负担,适合嵌入式设备。

Qt Canvas Painter:通过路径实现加速性能

Qt Blog Qt Blog · 2026-06-24T05:54:24Z

iOS 27的索引过程可能持续7天或更久,用户无法干预,但可以通过Mac控制台查看进度。索引速度与数据量和使用习惯有关,连接电源和WiFi可能加速进程。

iOS 27持续显示索引中?这个方法可以让你知道当前的真实索引进度

蓝点网 蓝点网 · 2026-06-16T07:30:02Z
为Claude Fable被封杀叫好:引发加速与减速的争论

本文探讨了AI发展中加速主义者与减速主义者的根本分歧。加速主义者追求快速进步,担心停滞带来的风险;而减速主义者则强调谨慎,忧虑潜在的灾难。两者的核心恐惧不同,前者害怕错失机会,后者则担心毁灭。最终,加速与减速是互斥的,选择安全或速度的态度反映了各自的世界观。

为Claude Fable被封杀叫好:引发加速与减速的争论

极道 极道 · 2026-06-14T23:27:00Z
关于github拉取下载加速的另一个方式

本文讨论了在Mac上使用llama.cpp时下载GitHub仓库速度慢的问题,建议使用gh-proxy服务加速下载,并通过转换链接提高效率。直接下载压缩包比使用git clone更快,因为压缩包减少了小文件传输时间。此外,作者提到在本地运行27B模型时遇到性能问题,考虑购买更高配置的Mac Studio。

关于github拉取下载加速的另一个方式

Nicksxs's Blog Nicksxs's Blog · 2026-06-14T13:45:35Z
Verda部署Supermicro最新液冷式NVIDIA Blackwell加速型系统

Verda选择Supermicro的NVIDIA GPU加速型系统,以提升其在欧洲的AI云基础设施。该平台支持大语言模型训练和企业级AI,满足市场对NVIDIA AI基础设施的需求。同时,Verda采用可再生能源运营,利用数据中心余热为1.5万户家庭供暖,推动可持续发展。

Verda部署Supermicro最新液冷式NVIDIA Blackwell加速型系统

全球TMT-美通国际 全球TMT-美通国际 · 2026-06-10T06:49:36Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码