小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
AI Gateway新增统一快速模式支持

AI Gateway推出统一的快速模式测试版,用户可通过设置speed为fast请求所有模型的快速服务,若不可用则回退至标准速度。快速模式以更高token成本换取更低延迟或更高吞吐量,无需绑定特定提供商。支持在Claude Code中用/fast切换,其他代理可选fast slug。快速模式适用于部分模型,无快速层时请求无影响。

AI Gateway新增统一快速模式支持

Vercel News Vercel News · 2026-07-31T00:00:00Z

本文比较了 Linux 中的两种 I/O 处理机制:epoll 和 io_uring。epoll 适用于高并发场景,但需要多次系统调用;io_uring 通过共享环形队列减少系统调用次数,适合高吞吐量需求。尽管 io_uring 有优势,但在低版本内核或现有生态系统中,epoll 仍然是更合适的选择。选择应基于具体需求和环境。

Linux 异步 I/O:epoll 与 io_uring 对比

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-21T00:00:00Z
摄取银河系:使用Zerobus Ingest实现PB级数据处理

Zerobus Ingest是Databricks推出的无服务器流式数据接收服务,支持每秒12GB的吞吐量。它通过推送API直接将数据写入Delta表,简化了传统Kafka架构的复杂性。Zerobus的动态分区设计和零拷贝解析器Zeroparser提升了性能,支持高吞吐量和低延迟的数据传输。该服务已在NASA的NEOWISE数据集上进行基准测试,展示了其强大的数据处理能力。

摄取银河系:使用Zerobus Ingest实现PB级数据处理

Databricks Databricks · 2026-06-11T19:45:26Z
顺序UUIDv7如何提升数据摄取性能

选择主键对高增长数据库至关重要。UUIDv7通过时间顺序保持索引效率,减少页面分裂,提升写入速度,适用于高吞吐量环境。

顺序UUIDv7如何提升数据摄取性能

Timescale Blog Timescale Blog · 2026-05-01T14:56:08Z
如何在Go和PostgreSQL中实现Outbox模式

在事件驱动系统中,Outbox模式通过在同一事务中保存数据和写入事件,确保数据库与消息代理的一致性,避免系统处于不一致状态。消息中继进程定期查询待处理消息并发布,确保至少一次交付,适用于高吞吐量场景。

如何在Go和PostgreSQL中实现Outbox模式

freeCodeCamp.org freeCodeCamp.org · 2026-03-19T17:26:11Z
融资34亿!谷歌前TPU员工创业新型芯片,卡帕西也投了

MatX公司由前谷歌TPU员工创办,获得5亿美元融资,计划于2027年推出新型AI芯片,旨在实现高吞吐量和低延迟,挑战英伟达的市场地位。创始人Reiner Pope和Mike Gunter拥有丰富的软硬件经验,MatX将融合两种主流芯片设计理念。

融资34亿!谷歌前TPU员工创业新型芯片,卡帕西也投了

量子位 量子位 · 2026-02-25T07:08:40Z
uForwarder:Uber高效事件驱动微服务的可扩展Kafka消费者代理

Uber工程团队推出了uForwarder,这是一个开源的Apache Kafka推送代理,旨在提升高吞吐量事件流的可扩展性和效率。uForwarder简化了消费者逻辑,集中管理偏移量,隔离工作负载,并提供内置延迟处理,解决了Uber内部Kafka部署的多个挑战,成为主要的Kafka消费者选项,提升了资源利用率和性能一致性。

uForwarder:Uber高效事件驱动微服务的可扩展Kafka消费者代理

InfoQ InfoQ · 2026-02-23T15:00:00Z
DigitalOcean Gradient™ AI平台现已与LlamaIndex集成

DigitalOcean Gradient™ AI平台已与LlamaIndex集成,简化了RAG应用的构建。用户只需安装两个包即可连接知识库和LLM,支持文档处理、检索和高吞吐量应用,适用于助手和研究工具等多种场景。

DigitalOcean Gradient™ AI平台现已与LlamaIndex集成

The DigitalOcean Blog The DigitalOcean Blog · 2026-02-18T20:23:52Z
Pinecone在公开预览中推出专用读取节点,以实现可预测的向量工作负载

Pinecone推出了专用读取节点(DRN),为其向量数据库提供可预测的性能和成本,适用于高吞吐量应用。DRN通过专用硬件确保查询稳定性,消除基础定价波动,支持快速查询和低延迟,适合严格服务水平的应用。与按需模式相比,DRN在成本可预测性和扩展性上表现更佳。

Pinecone在公开预览中推出专用读取节点,以实现可预测的向量工作负载

InfoQ InfoQ · 2025-12-23T12:00:00Z
人工智能时代批处理的变革

批处理是一种持续的工作流编排,旨在优化正确性、完整性和吞吐量。现代批处理可事件驱动,支持复杂的多步骤依赖,并可实现24/7运行。它与流处理互补,适用于需要时间关联和高吞吐量的业务场景。成功实施需关注平台工程与自助服务的平衡,以及人机协作。

人工智能时代批处理的变革

BMC Software | Blogs BMC Software | Blogs · 2025-12-15T00:00:37Z
Umair Shahid:PostgreSQL、MongoDB及其“无法扩展”的真正含义

PostgreSQL在垂直和水平扩展方面表现优异,适合高吞吐量和大数据量的工作负载。通过合理的架构设计和优化,PostgreSQL能够满足包括AI在内的多种需求。选择数据库时应关注工作负载、团队能力和实际需求,而非品牌。

Umair Shahid:PostgreSQL、MongoDB及其“无法扩展”的真正含义

Planet PostgreSQL Planet PostgreSQL · 2025-12-08T15:58:36Z
在Spring for Apache Kafka中引入共享消费者支持(Kafka队列)

Apache Kafka 4.0.0引入了共享组,提供按记录分配的消息消费模型,适用于高吞吐量的独立事件处理,增强了并发性和灵活性。同时,Spring for Apache Kafka 4.0.0全面支持共享组,简化了配置和使用。

在Spring for Apache Kafka中引入共享消费者支持(Kafka队列)

Spring Spring · 2025-10-14T00:00:00Z
我们为何创建了Turso,一个基于Rust的SQLite重写版本

SQLite广泛应用于数十亿设备,但其架构限制了现代应用的需求。为满足高吞吐量应用的性能和可靠性需求,Turso项目在Rust中重写SQLite,支持异步I/O、加密、向量搜索和并发写入。

我们为何创建了Turso,一个基于Rust的SQLite重写版本

The New Stack The New Stack · 2025-10-06T15:00:03Z
Intuit的Numaflow为机器学习工程师抽象化基础设施

Numaflow是一个基于Kubernetes的开源流处理引擎,旨在简化数据处理管道的构建,支持Kafka、Pulsar和SQS,适合高吞吐量工作负载。它隐藏基础设施细节,使机器学习工程师专注于流处理逻辑,并能自动扩展以应对流量变化。

Intuit的Numaflow为机器学习工程师抽象化基础设施

The New Stack The New Stack · 2025-10-06T14:00:54Z
六种高效的大型语言模型推理框架

大型语言模型推理迅速发展,出现了vLLM、Hugging Face TGI、SGLang、NVIDIA Dynamo、AIBrix和llm-d等多种框架。这些框架各具特色,优化了低延迟、高吞吐量和灵活部署,适用于多种实际应用场景。

六种高效的大型语言模型推理框架

The New Stack The New Stack · 2025-09-19T13:00:38Z

Go语言的runtime.free提案旨在优化内存管理,允许在安全情况下绕过垃圾收集器直接释放内存。该提案通过自动化内存跟踪和手动优化,显著提升高吞吐量场景下的性能,为Go的性能优化提供了新的思路。

从arena、memory region到runtime.free:Go内存管理探索的务实转向

Tony Bai Tony Bai · 2025-09-17T16:00:00Z
Tektronix发布MP5000系列模块化精密测试系统

Tektronix发布MP5000系列模块化精密测试系统,集成源测量单元和可编程电源,满足现代验证与生产的灵活性需求,支持多达32个大型机连接,适用于高吞吐量测试。未来将推出200伏高脉冲能力的SMU模块。

Tektronix发布MP5000系列模块化精密测试系统

全球TMT-美通国际 全球TMT-美通国际 · 2025-09-17T04:29:12Z
MBZUAI与G42联合推出高级AI推理开源系统K2 Think

Mohamed bin Zayed人工智能大学与G42联合推出K2 Think,这是一个320亿参数的开源AI推理系统,其性能超过20倍的大模型。K2 Think通过长链路思维和强化学习提高了解题精度,具备智能体规划和测试时间扩展技术,预计在Cerebras平台上实现每秒2000个令牌的高吞吐量。

MBZUAI与G42联合推出高级AI推理开源系统K2 Think

全球TMT-美通国际 全球TMT-美通国际 · 2025-09-11T04:55:44Z
深入vLLM:高吞吐量LLM推理系统的结构

vLLM是一个高吞吐量的LLM推理系统,采用分页注意力、连续批处理和前缀缓存等技术。文章介绍了vLLM的核心组件和高级特性,包括模型执行、调度和KV缓存管理。通过多GPU和多节点的动态服务,vLLM能够高效处理请求,优化延迟和吞吐量,并探讨了基准测试和自动调优的方法以提升系统性能。

深入vLLM:高吞吐量LLM推理系统的结构

vLLM Blog vLLM Blog · 2025-09-05T00:00:00Z

KCP协议是一种基于UDP的可靠传输协议,旨在克服TCP和UDP的不足,提供低延迟和高吞吐量。它通过确认应答、超时重传和流量控制等机制,确保数据的可靠传输,广泛应用于网络游戏、视频会议和物联网等实时场景。

KCP协议应用详解:为速度而生的可靠传输协议

京东科技开发者 京东科技开发者 · 2025-09-02T02:49:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码