小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
清华教室的音视频路由

清华教室原用导播台切换投影、音响等设备。作者为方便切换Mac、鸿蒙电脑及便携摄像头,改用Mac上的OBS做软件导播:鸿蒙电脑经采集卡输入Mac,摄像头USB接入,Mac再经HDMI接讲台输出,实现多源切换、录像与直播。

清华教室的音视频路由

杰哥的小笔记 杰哥的小笔记 · 2026-09-11T00:00:00Z
智能模型路由如何将LLM成本降低10倍

智能模型路由通过将简单请求分配给低成本小模型、复杂请求分配给高性能大模型,可显著降低LLM应用成本,最高达10倍。实现方式包括小模型分类、级联尝试、语义路由及学习路由。需注意避免路由错误、用户操纵及模型更新影响,并确保验证机制轻量高效。

智能模型路由如何将LLM成本降低10倍

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-09-09T15:30:26Z
[价格公布] DS V4 Pro将被自动路由到V4.1 Flash模型 性能/费用/速度均超过V4 Pro

深度求索将于9月10日发布DS V4.1 Flash模型,性能、费用和速度全面超越V4 Pro。发布后,V4 Pro请求将自动路由至V4.1 Flash,并按新价格计费,成本更低。用户可提前测试中间版本,正式版上线后价格更优。

[价格公布] DS V4 Pro将被自动路由到V4.1 Flash模型 性能/费用/速度均超过V4 Pro

蓝点网 蓝点网 · 2026-09-09T13:43:55Z
Vercel Sandbox 路由现已在全球范围内提速 18 倍

Vercel Sandbox公共域名请求路由速度提升18倍,通过sandbox.domain()创建的域名现从最近区域副本解析,延迟从62ms降至3.4ms,远距离地区查询速度提升显著,自动应用于所有沙箱域名请求,无价格变动。

Vercel Sandbox 路由现已在全球范围内提速 18 倍

Vercel News Vercel News · 2026-09-08T20:00:00Z
推理服务的缓存与调度:前缀、多级存储、集群路由

本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用write-back策略在GPU、DRAM、SSD间分层存储;集群层面用一致性哈希实现缓存亲和,并按请求类别分配预算以应对长请求突发。

推理服务的缓存与调度:前缀、多级存储、集群路由

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T23:30:00Z
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。

DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:40:00Z

NVIDIA NeMo Switchyard是一个开源路由层,位于AI代理和模型之间,按请求智能选择模型以降低成本。教程演示了从随机路由到内容感知路由的升级,包括配置YAML、启动服务器、测试简单与复杂请求,以及基于进度或升级的路由策略。最后强调通过指标测量路由效果,优化质量与成本平衡。

Switchyard:NVIDIA的开源路由库

KDnuggets KDnuggets · 2026-09-04T14:00:07Z

本文拆解kube-apiserver请求路径,从TLS终止到etcd写入,需经过APF流控、认证、授权、Admission等拦截点。APF在认证前,Admission在REST handler内。请求失败时需区分是Webhook拒绝、APF排队还是etcd问题,不能简单归因于etcd慢。GVR路由将请求映射到对应storage实现。

【kube-apiserver】进程与请求路径:generic apiserver、HandlerChain 与 REST 路由

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-28T00:00:00Z
Python项目现已支持路由规则

Python项目现可通过路由规则设置响应头或重写请求路径,适用于FastAPI、Django和Flask应用。规则在CDN层生效,无需重新部署。支持通过仪表盘、CLI、Python SDK或vercel.json定义,发布后立即生效,可回滚。项目级规则优先于部署级配置,适合不同工作流。

Python项目现已支持路由规则

Vercel News Vercel News · 2026-08-26T00:00:00Z

etcd集群采用单一Raft组管理所有键值数据,与TiKV的Multi-Raft形成对比。EtcdServer负责状态机,raftNode适配Raft库。Leader处理写请求,Follower转发,Learner不参与投票。写路径经Raft提交,读路径可本地或ReadIndex,Watch和Lease各有独立机制。

【etcd】单 Raft 组与服务器角色:Leader、Follower、Learner 与 request 路由

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-26T00:00:00Z

本文介绍Linkerd 2.20中ServiceProfile的L7流量管理机制。ServiceProfile CRD定义路由、重试和超时,由destination控制器通过GetProfile流推送至数据面。sp-validator webhook负责写入前校验,失败时直接拒绝。与Gateway API分工:SP用于网格内路由,GAPI用于南北向。排障时需区分写入失败(validator)、行为失败(Get vs GetProfile)和策略拒绝(403)。

【Linkerd】ServiceProfile:L7 路由、重试与 sp-validator

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-23T00:00:00Z
AI 智创简报:《路由有专利,账单有水分:API 中间层省钱活》

该文聚焦2026年大模型API中间层专利趋势,涉及NVIDIA、IBM等公司的路由、缓存与成本预测技术。核心机会在于为开发者构建中间件,通过语义缓存、智能路由和成本护栏降低API费用。建议提供成本审计服务和垂直优化代理,月费99-299元,但需警惕大厂内置风险,应垂直化积累经验。

AI 智创简报:《路由有专利,账单有水分:API 中间层省钱活》

Micropaper Micropaper · 2026-08-20T00:00:00Z
uzair aslam:在HubSpot中建模多品牌订阅路由

本文介绍了一种HubSpot多站点架构的配置层设计,旨在将网站业务意图映射到HubSpot目标(如品牌、订阅类型、细分和属性)。核心是使用稳定内部品牌ID、版本化映射表、动态或手动细分,并确保同意与细分成员分离。文章强调通过验证、快照和纯函数规划来避免冲突,实现可测试、可审计的配置管理,使路由数据像代码一样受控。

uzair aslam:在HubSpot中建模多品牌订阅路由

Planet PostgreSQL Planet PostgreSQL · 2026-08-19T22:07:27Z

Envoy Gateway v1.9.0 升级后,若未安装 Gateway API v1.6 CRDs,TCPRoute/UDPRoute 会被静默跳过,不返回错误提示。v1.6 起这些路由为 Standard v1,standard channel 中 v1alpha2 不再服务,清单需改用 v1。失败表现为无流量或连接失败,应先检查 CRD 版本与 channel。

【Envoy Gateway】L4 路由:不升 v1.6 CRDs,TCP/UDP 会静默消失

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-19T00:00:00Z
爱快路由系统(iKuai)发布安全公告:持续遭到攻击 用户需立即升级固件

爱快路由系统近期遭受持续攻击,导致DNS被篡改,用户访问网站被劫持至非法网站,并在凌晨3至6点出现断网现象。官方已发布安全公告,推出新版固件修复漏洞,建议用户升级至4.0.307及以上版本,旧版可升级至3.7.24。攻击细节仍在调查中。

爱快路由系统(iKuai)发布安全公告:持续遭到攻击 用户需立即升级固件

蓝点网 蓝点网 · 2026-08-17T03:25:33Z

该项目需在Spring Cloud Gateway公网网关配置入口,经Nginx代理转发至后端服务,支持HTTP和WebSocket请求。文章详细说明了Gateway和Nginx的路由配置方法,包括WebSocket握手头处理、路径前缀剥离、SSL证书配置及超时设置,并提供了验证步骤和常见错误排查表,如协议错误、SSL握手失败等问题的解决方案。

Spring Cloud Gateway 和 Nginx 网关代理 WebSocket 路由配置

安志合的学习博客 安志合的学习博客 · 2026-08-16T09:39:13Z
AI路由放网关还是Harness,实测成本差两倍

企业架构中,模型路由应置于Harness层而非网关。实测表明,网关路由导致成本增加237%、延迟增加65%,而Harness路由节省58%成本,91%的会话成本减半。网关缺乏任务上下文和缓存信息,无法优化决策;Harness能感知会话状态、失败信号和缓存代价,实现高效路由,同时保持质量不降。

AI路由放网关还是Harness,实测成本差两倍

极道 极道 · 2026-08-15T11:14:00Z
Unity AI Gateway中的智能路由:以降低30%以上的每任务成本实现前沿质量

Databricks推出Unity AI Gateway的Smart Routing功能,根据任务复杂度自动选择合适模型,在内部编码任务中节省35%成本,公共基准测试中节省56%。该功能支持Claude Code和Codex,并通过Omnigent跨模型和编码工具优化,兼顾成本与开发者生产力,避免默认使用最贵模型。

Unity AI Gateway中的智能路由:以降低30%以上的每任务成本实现前沿质量

Databricks Databricks · 2026-08-13T17:52:04Z

本文探讨Envoy代理中连接池、熔断和异常检测机制如何导致路由正确时仍出现503错误。连接池按线程/协议分池,熔断限额跨Worker共享但最终一致,溢出是503首要嫌疑。异常检测被动摘除异常主机,可与主动健康检查叠加。排障需检查熔断计数、驱逐事件和优先级分流,调参须按优先级独立阈值理解。

【Envoy 数据面】连接池、熔断与 Outlier:路由正确为何仍 503

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-10T00:00:00Z
开源模型+动态路由+AI网关:大厂三招管住AI账单疯涨

企业AI编程成本飙升,核心对策是优先选择性价比高的开源模型,通过动态路由和AI网关统一管理,按任务难度分配模型,压缩上下文并利用缓存,同时温和提醒而非断网限制。Databricks等公司的实践表明,这些方法可降低成本三成以上,同时保持效率。

开源模型+动态路由+AI网关:大厂三招管住AI账单疯涨

极道 极道 · 2026-08-07T22:14:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码