小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
通过专用GPU内核生成实现极致效率

Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。

通过专用GPU内核生成实现极致效率

Databricks Databricks · 2026-09-04T20:00:00Z
利用Java软件和内建函数加速Curve25519字段运算

Oracle在JDK 27和28中显著提升了Curve25519字段运算性能,优化了X25519、Ed25519及X25519MLKEM768算法。软件改进使吞吐量增加27-54%,新增的x86_64和AArch64架构内建函数进一步带来7-20%提升。这些改进通过JCE和JSSE API惠及密钥生成、签名及TLS 1.3混合密钥交换,鼓励用户试用早期版本并提供反馈。

利用Java软件和内建函数加速Curve25519字段运算

insidejava insidejava · 2026-09-03T00:00:00Z
《Fluent Python》作者深度解读:Go 集合类型家族要“大改版”了

Go语言长期缺乏内建集合类型,开发者需用map手写。提案#80590计划在Go 1.28引入container/set等集合家族,支持子集、差集等运算,提升代码简洁性。新设计含Hasher接口,兼容不可比较类型,并优化性能,将复杂度从O(M×N)降至O(M+N),适应AI编程时代需求。

《Fluent Python》作者深度解读:Go 集合类型家族要“大改版”了

Tony Bai Tony Bai · 2026-09-01T21:00:00Z
为什么一个40岁的数据库在AI时代仍然胜出

文章探讨了时间序列数据中基数(cardinality)问题,指出增加索引维度(如添加firmware_ver列)会显著提升基数,导致存储和查询成本剧增,其影响远超增加行数。通过测量展示了曲线拐点,并提出了在PostgreSQL中优化基数、避免性能下降的解决方案。

为什么一个40岁的数据库在AI时代仍然胜出

Timescale Blog Timescale Blog · 2026-09-01T17:00:25Z
AI聊天机器人在按下回车与输出首个词之间发生了什么?

AI聊天机器人从按下回车到输出首个词之间,经历约十几个阶段:组装包含系统提示、工具定义、记忆和对话历史的文档,进行输入安全检查,将文本分词,排队与其他请求共享硬件,然后分预填充和解码两阶段生成。长对话因重新处理全部历史而变慢变贵,缓存和流式技术优化了性能,工具调用则形成循环。

AI聊天机器人在按下回车与输出首个词之间发生了什么?

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-31T15:31:20Z
从纯 CSS 到 StyleX:AI 加持下的一万行 CSS 迁移实践

StyleX 因性能优势引发热议,作者从 Tailwind 转向 StyleX,因其原子化编译减少 CSS 体积并提升可读性。作者用 AI 工具将一万多行 CSS 项目迁移至 StyleX,通过多代理并行工作,产出 300 多条提交,CSS 从 215.7 kB 降至 102.3 kB,验证了迁移方案的可行性。

从纯 CSS 到 StyleX:AI 加持下的一万行 CSS 迁移实践

静かな森 静かな森 · 2026-08-30T08:45:43Z

Rustdoc通过先过滤再构建trait impl,并限制primitive和synthetic impl,平均提速约33%,部分crate提升40%。该优化已进入nightly,计划随Rust 1.99发布。

【Rust日报】2026-08-30 Rustdoc 一周提速 33%

Rust.cc Rust.cc · 2026-08-30T01:04:58Z

Rustdoc 通过一系列 PR 优化,平均提速约33%,部分 crate 最高达40%。改进源于先过滤再构建 trait impl,并限制 primitive 和 synthetic impl 处理,已进入 nightly,计划随 Rust 1.99 发布。

【Rust日报】2026-08-30 Rustdoc 一周提速 33%

Rust.cc Rust.cc · 2026-08-30T01:03:36Z

本文分析Kubernetes中`kubectl get pods -A`在大集群下变慢的原因,指出常见误判为etcd慢,实际可能是cacher或etcd3的List路径问题。文章详解了`resourceVersion`语义(`rv=""`走etcd强一致,`rv="0"`走缓存)、continue token的编码结构、分页成本模型,以及label selector在etcd侧无索引导致的全量扫描放大问题,并给出优化建议。

【kube-apiserver】List、Pagination 与一致性 List:continue token 与 etcd Range 成本

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-28T00:00:00Z
通过示例学习Python中的向量化思维

本文介绍如何用NumPy向量化操作替代Python循环处理数值数据,通过数组运算、布尔掩码、广播和轴聚合等方法提升计算效率,强调将数组视为计算单元的向量化思维,并提供实践检查清单。

通过示例学习Python中的向量化思维

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-26T12:00:16Z
Yac 2.4.0发布 - 小值读取性能提升64%

Yac 2.4.0发布,主要改进包括:内嵌小值到指针槽位,避免占用values内存,提升读取性能64%;用LZ4替换FastLZ压缩,解压更快;get()支持$default参数区分未命中与假值;dump()支持分页及元信息。实际测试中内存占用从23.5M降至12.4M,吞吐显著提升,适合WordPress缓存场景。

Yac 2.4.0发布 - 小值读取性能提升64%

风雪之隅 风雪之隅 · 2026-08-26T04:43:10Z
音视频性能优化:启动速度 / 内存 / 功耗 / 编码延迟全链路调优

本文介绍音视频性能优化方法论,涵盖启动速度、内存、功耗及CPU/GPU四个维度。通过测量定位瓶颈,采用预热Session、异步启动、低分辨率渐进提升、Buffer复用、低电量降级、静态场景降帧率等策略,并利用Claude Code工具辅助诊断,实现首帧<300ms、内存<120MB等优化目标。

音视频性能优化:启动速度 / 内存 / 功耗 / 编码延迟全链路调优

实时互动网 实时互动网 · 2026-08-25T03:49:22Z
如何科学调优向量搜索,而非盲目猜测

本文基于五个数据集,系统分析了向量搜索中七个关键设置、检索深度、融合参数、重排序器及量化重打分的影响,指出默认参数常导致性能下降,如RRF的k值调整可显著影响结果。建议先检查基础设置,再针对检索不足、排名错误或延迟增加等问题,采取数据驱动的调优策略,以科学提升搜索质量。

如何科学调优向量搜索,而非盲目猜测

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-24T00:00:00Z
如何判断慢查询是规划问题还是执行问题

PostgreSQL中,小型元数据表的过期统计信息会悄然拖慢大型查询。通过EXPLAIN可识别此问题,无需迁移schema即可修复。文章强调,忽视这些统计信息会导致性能瓶颈,及时更新统计信息是优化关键。

如何判断慢查询是规划问题还是执行问题

Timescale Blog Timescale Blog · 2026-08-21T15:47:50Z
如何利用OpenTelemetry将慢查询转化为可操作的可靠性指标

本文介绍如何利用OpenTelemetry追踪数据,通过构建三个渐进式仪表盘(按耗时、按流量加权影响、异常检测)来识别慢SQL查询。该方法将原始追踪转化为可操作的指标,帮助优化查询优先级并快速响应异常,同时讨论了生产环境中的基数、隐私和基线建立等注意事项。

如何利用OpenTelemetry将慢查询转化为可操作的可靠性指标

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-21T11:00:00Z
Andrei Lepikhov:全局哈希表在PostgreSQL中卷土重来?

PostgreSQL并行聚合测试显示,共享哈希表方案在均匀分布下可提速至4.82倍,但受数据倾斜影响,重击组占比超10%时性能下降。实现需处理锁竞争、内存限制和表达式解释器问题,且进程模型增加开销。建议采用分区策略,或限制于固定宽度状态以优化。

Andrei Lepikhov:全局哈希表在PostgreSQL中卷土重来?

Planet PostgreSQL Planet PostgreSQL · 2026-08-20T17:50:37Z
被吐槽多年的 Win11 右键菜单,终于变快了?

微软更新Windows 11右键菜单,宣称更快、更简洁、可定制,并优化文件资源管理器性能,减少卡顿和闪烁。测试显示新菜单比Windows 10快,但实际体验提升有限。该版本需加入预览体验计划,不建议普通用户使用。

被吐槽多年的 Win11 右键菜单,终于变快了?

小众软件 小众软件 · 2026-08-20T07:04:26Z

CUDA Graph在多流执行中效果有限,仅能消除CPU开销导致的GPU气泡,无法解决其他流中阻塞内核引起的气泡。若GPU利用率已高,启用CUDA Graph收益甚微,不应过度投入。仅当气泡主要由CPU开销造成时,启用才可能有益,但需验证分析痕迹的准确性。

多流执行上下文中的CUDA Graph

Lei Mao's Log Book Lei Mao's Log Book · 2026-08-20T07:00:00Z
数据约束下混合预训练的缩放定律

该研究探讨了在数据受限条件下,语言模型预训练中混合稀缺目标数据与通用数据的权衡。通过2000多次实验,发现重复使用目标数据15-20次可提升性能,并提出了考虑重复价值递减的缩放定律,以优化混合配置。

数据约束下混合预训练的缩放定律

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-20T00:00:00Z

作者优化博客缓存与性能:合并四个GraphQL请求,耗时从1100ms降至446ms;发现WPGraphQL默认限制100条数据,改用分页拉取;开发LruLink缓存机制,实现SWR自动补货、分级TTL和用户隔离。最后并行开发三个功能分支,并预告下篇关于MC皮肤吉祥物的故事。

我的缓存会自己补货:LruLink 与三个并行功能分支

九仞之行 九仞之行 · 2026-08-19T08:03:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码