小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

1. 磁盘处理 1.1 查看磁盘 查看新磁盘 1 fdisk -l Disk /dev/nvme1n1: 3.91 TiB, 4294967296000 bytes, 8388608000 sectors 1.2 组建 RAID0 如果有多块小盘,更好的方式是组建一个 RAID0,这样不仅能获得更大的存储目录,还能获得更快的速度。 创建 RAID 1 mdadm --create...

如何添加 Huawei NPU 节点到 Kubernetes 集群

陈少文的博客
陈少文的博客 · 2026-07-22T00:00:00Z
华为韬定律干翻NVL72?五千芯片组网性能炸裂,AI集群不再看单颗算力

五千块芯片干翻英伟达?华为的AI数据中心正在改写物理规则。 华为用落后两代的制造工艺,硬是靠系统级设计把AI集群性能拉到了超算天花板。当英伟达还在铜线传输的物理极限里死磕机柜密度时,华为直接用光互联拆掉了“机内”和“机外”的墙。这场关于传输速度的暗战,可能让整个AI硬件赛道换玩法。 没有EUV光刻机反而逼出更狠的招...

华为韬定律干翻NVL72?五千芯片组网性能炸裂,AI集群不再看单颗算力

极道
极道 · 2026-07-20T22:34:00Z
商汤大装置联合近20家生态伙伴发起“银河计划”,将共建5个万卡级国产智算集群

加速国产算力从落地可用到规模化盈利

商汤大装置联合近20家生态伙伴发起“银河计划”,将共建5个万卡级国产智算集群

量子位
量子位 · 2026-07-18T06:56:10Z

本文讨论了FoundationDB中Coordinators和Cluster Controller的角色与功能。Coordinators通过集群文件提供配置权威,持久化事务系统配置;而Cluster Controller负责角色招募和系统状态维护。Paxos协议用于确保配置一致性,但用户数据不存储在Coordinators上。文章强调了Coordinators与数据存储的区别及系统故障时的恢复机制。

【FoundationDB 内核】Coordinator 与集群配置:Paxos 边界、招募与恢复入口

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-17T00:00:00Z

本文讨论了Milvus 2.6.x的架构,重点在于无状态Proxy和单活跃Coordinator的设计。Proxy负责请求校验和结果处理,Coordinator维护拓扑和任务调度。文章还提到时间戳管理和查询视图的路由,强调无状态Worker的优势与挑战,以及单活跃Coordinator在一致性和故障处理中的重要性。

【向量检索引擎】Proxy 与 Coordinator:接入面、TSO 与集群大脑

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-12T00:00:00Z
中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

中科曙光宣布曙光8000超集群正式落成,配备十万张国产加速卡,支持科学计算与大模型训练。该集群通过“超智融合”架构优化算力资源配置,提升利用率,降低成本。曙光8000已完成300余项应用适配,覆盖多个领域,并与北京科学智能研究院合作,推动国产算力系统建设。

中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

量子位
量子位 · 2026-07-11T10:07:17Z
中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

中科曙光宣布全国产AI超集群曙光8000正式落成,具备十万张加速卡,支持FP64和大模型训练。该集群通过“超智融合”架构优化算力资源,提升利用率,降低成本,已接入国家超算互联网,服务科研和产业,覆盖20多个领域,推动算力网络建设。

中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

量子位
量子位 · 2026-07-11T06:26:46Z
在数百万个集群中运行Kubernetes教会了AWS关于区域故障的知识

亚马逊EKS通过构建区域弹性来应对区域故障,确保在可用区出现问题时系统保持稳定,避免大规模停机。其关键原则是静态稳定性,系统在故障时停止反应,保持现有容量,绕过故障区。EKS的控制平面和数据平面设计确保流量迅速转移到健康区,避免影响应用性能。

在数百万个集群中运行Kubernetes教会了AWS关于区域故障的知识

The New Stack
The New Stack · 2026-07-10T15:00:00Z
像部署一样开发:缩小Kubernetes本地与集群之间的差距

Krumware的Epinio是一个开源应用开发引擎,旨在简化Kubernetes的使用,帮助开发者高效部署应用而无需深入了解Kubernetes。Epinio支持快速原型开发,提升开发速度,并确保安全合规。Krumware还计划通过Epinio MCP服务器增强与AI的集成,进一步优化开发流程。

像部署一样开发:缩小Kubernetes本地与集群之间的差距

The New Stack
The New Stack · 2026-07-09T15:00:00Z
技嘉科技发布AI TOP ATOM四机串联集群架构

技嘉科技发布了AI TOP ATOM四机串联集群架构,突破了单机限制,支持更大规模的AI与科学运算。每台设备具备1 PFLOPS算力和128 GB记忆体,通过200GbE高速网络连接,提供更大的运算资源。与NVIDIA合作,展示了AI驱动的科学运算流程,支持先进半导体封装材料的开发,模拟规模可达3000万颗原子。

技嘉科技发布AI TOP ATOM四机串联集群架构

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-09T09:28:43Z
肖恩·托马斯:期待Postgres 19:面向所有用户的数据校验和

Postgres 19引入了在线启用数据校验和的功能,简化了数据库的完整性保护。校验和可以防止硬件故障导致的数据损坏,确保数据在写入和读取时的准确性。DBA可以通过简单的函数调用在运行中的集群中启用校验和,避免了长时间停机的麻烦。这一改进使旧版本集群也能轻松实现数据完整性保护。

肖恩·托马斯:期待Postgres 19:面向所有用户的数据校验和

Planet PostgreSQL
Planet PostgreSQL · 2026-07-03T13:42:31Z
Etched集群规模内存CSM解析:铜缆如何解决AI芯片延迟死穴

Etched公司通过创新的铜缆架构解决了AI芯片的延迟问题,创建了共享低延迟内存池,提升了MoE模型的性能。尽管面临制造和散热挑战,该方案在成本和效率上具有优势,可能改变AI基础设施的未来。

Etched集群规模内存CSM解析:铜缆如何解决AI芯片延迟死穴

极道
极道 · 2026-07-02T12:09:00Z
使用Kubernetes、Argo CD和GitOps构建集群感知的AI代理

本文介绍了如何在Kubernetes集群中运行自托管的只读AI代理,利用GitHub Actions和Argo CD进行CI/CD。该代理通过Kubernetes API观察实时状态,确保数据不离开集群,允许在集群内部进行推理,提供具体的可操作建议。文章还讨论了代理的架构、CI/CD链及其只读设计的重要性,强调安全性和可审计性。

使用Kubernetes、Argo CD和GitOps构建集群感知的AI代理

Cloud Native Computing Foundation
Cloud Native Computing Foundation · 2026-06-25T11:25:00Z
一个Postgres集群,多种应用

本文讨论了如何在单个Postgres集群中管理多个逻辑数据库,以支持不同应用程序(如博客和待办事项列表)。通过创建逻辑数据库和角色,实现应用程序的权限隔离。使用基础设施即代码(IaC)工具(如Pulumi)可以自动化数据库和角色的创建与管理,简化操作流程,使开发者能够专注于应用程序开发。

一个Postgres集群,多种应用

PlanetScale - Blog
PlanetScale - Blog · 2026-06-25T00:00:00Z
750B MoE 模型从自建 RoCE 集群迁移至 AWS EFA:Prefill-Decode 分离推理的通信架构验证

本文探讨了750B MoE模型从自建RoCE集群迁移至AWS EFA的过程,验证了Prefill-Decode分离推理的通信架构。客户希望利用AWS的弹性算力扩展本地GPU资源,降低硬件风险。通过理论分析和实际测试,比较了AWS EFA与自建RoCE集群的性能,发现EFA在复杂通信负载下表现良好,尽管在某些延迟指标上略逊一筹,但在尾延迟稳定性上有显著优势。整体来看,EFA已可替代RoCE,尤其在对尾延迟敏感的场景中表现出色。

750B MoE 模型从自建 RoCE 集群迁移至 AWS EFA:Prefill-Decode 分离推理的通信架构验证

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-18T01:33:28Z
如何构建小型语言模型集群的生产架构

本文讨论了小型语言模型(SLM)架构设计,以避免“模型衰退”。重点包括建立模型注册表以跟踪模型来源和性能,实施版本控制的网关模式,以及开发基于清单的交付系统,以确保模型在边缘设备上的高效部署。这些方法提高了模型的可维护性和可追溯性,确保在生产环境中有效管理多个SLM。

如何构建小型语言模型集群的生产架构

freeCodeCamp.org
freeCodeCamp.org · 2026-06-17T19:21:38Z
组复制与Percona XtraDB集群:一致性的真实成本

文章讨论了MySQL组复制中的高可用性问题,提出了“故障转移棕色化”的概念,强调在系统设计中重新思考高可用性的重要性。同时,介绍了如何将pt-query-digest风格的慢查询分析应用于PostgreSQL,并利用pg_enhanced_query_logging工具进行优化。

组复制与Percona XtraDB集群:一致性的真实成本

Percona Database Performance Blog
Percona Database Performance Blog · 2026-06-15T06:58:17Z
AI光子学瓶颈:AI集群可能先卡在光纤接口上

随着AI集群规模扩大,数据传输成为瓶颈。铜线在高速下表现不佳,光纤虽然解决了信号衰减问题,但面临激光器短缺、封装难度和测试问题。共封装光学技术提高了效率,但维修复杂。整体瓶颈在于材料到集成的供应链,需关注各环节的产能与维护。

AI光子学瓶颈:AI集群可能先卡在光纤接口上

极道
极道 · 2026-06-05T00:17:00Z
Floor Drees:如何在Kubernetes集群中测试PostgreSQL 19 Beta

PostgreSQL 19 Beta 1已发布,包含所有即将推出的新功能。CloudNativePG社区提供了该版本的容器镜像,用户可以在Kubernetes集群中部署PostgreSQL 19集群并验证版本。欢迎大家参与测试并反馈问题。

Floor Drees:如何在Kubernetes集群中测试PostgreSQL 19 Beta

Planet PostgreSQL
Planet PostgreSQL · 2026-06-05T00:00:00Z
从Crunchy Data PostgreSQL操作员迁移到Percona PostgreSQL操作员:备用集群方法

在选择适合Kubernetes的PostgreSQL操作员时,需考虑不同开源解决方案的质量和特性。用户应仔细评估,以确保选择的可靠性和支持。

从Crunchy Data PostgreSQL操作员迁移到Percona PostgreSQL操作员:备用集群方法

Percona Database Performance Blog
Percona Database Performance Blog · 2026-05-25T07:49:01Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码