Neki平台预览版发布后,团队通过简单单分片主键查询测试扩展性。从5分片扩展到512分片,实现每秒1.185亿次查询,处理1.22 PiB数据,吞吐量随分片数线性增长。每分片约23万QPS,路由器p99延迟6.06毫秒,错误率约180万分之一。该测试为只读、无副本、无故障切换。
CUDA时间切片是GPU默认共享机制,但低利用率进程会拖慢其他进程。NVIDIA MPS允许多进程并发执行内核,提升GPU利用率。文章通过Triton内核测试展示,启用MPS后8个单SM工作负载的吞吐量从3.02提升至17.09请求/秒,约6倍改进,并提供了启用/禁用MPS及Docker配置方法。
NVIDIA Vera Rubin NVL72在代理式AI工作负载中,每兆瓦吞吐量比GB300 NVL72高30倍,每百万token成本低35倍。该平台通过软硬件协同设计,支持分离式服务、专家并行、KV缓存等优化,提升推理效率,适合大规模AI工厂部署。
VictoriaMetrics 发布日志采集器基准测试报告,其新品 vlagent 在 1 核 1GB 限制下吞吐量达 14.3 万条/秒,是 Fluent Bit 的 4.5 倍、Fluentd 的 28 倍,且资源消耗最低。测试还发现 Fluent Bit 和 Vector 存在日志轮转丢字段、默认配置漏日志等正确性问题。vlagent 目前不支持多行日志合并和非 JSON 解析,适合 JSON 结构化日志场景。
数据库并发与吞吐量并非线性关系。文章通过MySQL故障案例说明,高并发会因锁竞争和快照版本链重建导致吞吐量骤降。解决方案是降低事务池大小并引入排队机制,模拟线程池行为,以控制并发、吸收突发流量。核心原则是:面对共享资源竞争,限制并发反而能提升总吞吐量,需根据工作负载特性谨慎应用。
本文比较了自回归语言模型(ARMs)与扩散语言模型(DLMs)的性能。DLMs通过并行生成令牌提高算术强度,但长上下文扩展不佳;块状解码可改善此问题。批处理推理中,ARMs因序列并行优势吞吐量更高。减少采样步数是DLMs降低延迟的关键。
本文介绍如何测量Transformer模型推理性能,核心指标包括延迟、首令牌时间(TTFT)、每输出令牌时间(TPOT)、吞吐量、内存使用和每令牌成本。测量需区分预填充和解码阶段,使用墙钟计时或CUDA事件,并注意GPU同步和预热。并发请求测试可评估吞吐量,多GPU可复制或分区模型。最终需结合成本与质量评估系统效率。
静态批处理等待批次满后才运行,延迟高;动态批处理通过超时窗口改善等待,但批次内仍受最慢请求影响;连续批处理以解码步骤为单位调度,序列完成即释放槽位,吞吐量高,适合生产级LLM服务。
AMD MI355X在运行Kimi K3模型时,凭借更低价格和更高每美元吞吐量,性能超越英伟达B300。通过修复投机解码和预填充内核的软件缺陷,MI355X单节点速度达到B200的3.8倍,首字延迟大幅降低。文章认为,CUDA生态并非不可撼动,硬件性价比和工程师修bug能力正成为新护城河。
谷歌研发Frozen v2芯片,将Gemini模型部分决策蚀刻于硅晶片,吞吐量较现有TPU提升6至10倍,计划2028年量产。此举应对算力短缺,但全蚀刻限制模型更新,故采用冻结架构、允许权重更新的方案,以延长寿命并支持多版本模型,与TPU并行发展。
本文通过vLLM在单GPU上的基准测试,对比了吞吐量与“有效吞吐量”(goodput,即满足延迟目标的请求数)。结果显示,仅优化吞吐量会牺牲TPOT延迟,导致服务体验变差。作者强调,应设定TTFT和TPOT目标,通过自动化搜索寻找最佳配置,而非盲目追求高吞吐量,并指出配置需随流量和模型变化持续调整。
Mooncake架构通过分布式KV Cache缓存池,将Kimi请求吞吐量提升115%,获存储顶会最佳论文。它分离预填充与解码节点,全局共享缓存,解决长上下文瓶颈。该架构拉动DRAM、光模块、SSD需求,开源生态正跟进,成为行业标准。
Qdrant在基准测试中表现优于Elastic的DiskBBQ,吞吐量提高了2倍,延迟降低了50%。在相同的召回率下,Qdrant使用更少的CPU和内存资源,显示出更高的效率。Elastic的测试方法未能充分利用Qdrant的特性,导致结果偏差。Qdrant的两阶段检索和异步评分技术显著提升了性能。
Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。
GLM 5.2 Fast现已在AI Gateway上线,提供比其他服务商高2倍的吞吐量,适用于小、大上下文场景。使用时需在AI SDK中设置模型为zai/glm-5.2-fast。AI Gateway提供统一API,支持用量跟踪、成本管理及性能优化,无平台费用。
本文介绍了gordma,一个用Go语言封装的RDMA网络库,旨在简化高性能网络编程。RDMA技术通过直接内存访问实现低延迟和高吞吐量,适用于AI训练和金融交易等场景。gordma提供易用的API,支持不同性能需求,用户可选择简单的net风格接口或底层API以获得更高性能。实测数据显示,gordma在400G网络环境下的吞吐量可达392 Gb/s,展示了其强大的性能和灵活性。
小米推出了MiMo-V2.5-Pro-UltraSpeed模型,具备1T参数和1000+ TPS的推理速度,突破了GPU的性能限制。该模型在全栈开发任务中表现优异,能够快速生成高质量的复杂应用,推动了大模型的商业化进程。
文章讨论了延迟、吞吐量和带宽的区别。延迟是数据包从发送者到接收者的时间,吞吐量是每秒成功传输的数据量,而带宽是连接的最大容量。低延迟不一定意味着高吞吐量,三者各自解决不同的问题。此外,文章介绍了谷歌的TPU芯片,专为深度学习设计,具有不同的训练和推理模式。
在新加坡的 PyTorch 会议上,Bugen Zhao 介绍了 vLLM 团队用 Rust 重写 Python 前端的工作,以解决高并发下的性能瓶颈。Rust 前端的吞吐量提升约 5.16 倍,CPU 占用降低,长尾延迟收敛,用户无需额外操作,Rust 二进制文件已打包进 Python Wheel,支持主要 API。
DEKRA德凯近日为联想消费笔记本授予Wi-Fi吞吐量3D场型暨路由环境自适应认证。该认证基于联想的Smart Antenna技术,首次将3D T-PUT均匀性测试与动态路由环境模拟纳入认证体系,测试结果显示联想笔记本在三维均匀性和动态适配方面表现优异,核心性能指标显著高于行业标准。
完成下面两步后,将自动完成登录并继续当前操作。