小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

Microsoft has outlined an AI governance architecture spanning nine governance domains and four functions: policy, control, visibility, and proof. The approach connects policies with runtime...

Microsoft Moves AI Governance from Policy to Runtime Enforcement

InfoQ InfoQ · 2026-08-24T13:49:00Z

本文介绍Linkerd 2.20策略模型,核心是三类CRD:Server声明端口入站策略,AuthorizationPolicy定义访问授权,MeshTLSAuthentication指定认证身份。policy容器负责入站策略推送,destination控制器处理出站发现。排障时需区分403拒绝、TLS错误、无端点等不同故障域,避免混淆策略与发现问题。

【Linkerd】策略模型:Server、AuthorizationPolicy 与 policy 容器

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-23T00:00:00Z

Envoy Gateway v1.9.0中五类策略(Security、BackendTraffic、ClientTraffic、EnvoyExtension、EnvoyPatch)的生效机制与常见失效原因。重点:mergeType仅允许在xRoute上声明,挂父资源会被拒绝;Lua默认关闭需显式启用;JWT稳定名、限流布局等xDS变更会使旧补丁失效。策略未生效时需先定位是admission拒绝、IR覆盖还是补丁错位。

【Envoy Gateway】Policy attachment:五类策略编译到哪一层,mergeType 挂错父资源会发生什么

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-19T00:00:00Z

本文介绍Cilium v1.20的BPF Map状态轴,涵盖Policy、Service、CT/NAT等核心表职责、默认上限及满表故障表象。强调排障先定位具体表,注意动态容量调整与NAT/CT约束,并指出升级世代切换和容量规划纪律的重要性。

【Cilium / eBPF】关键 BPF Map:policy、service、CT 的职责与失败表象

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-16T00:00:00Z

本文介绍Cilium v1.20网络排障的五轴坐标系:通用丢包、策略拒绝、身份漂移、服务黑洞和加密失败。每轴按症状、排查顺序和禁忌操作展开,强调先分型再行动,避免盲目重启或改策略。通过Hubble、BPF map和状态检查定位根因,并保留最小证据包用于复盘。

【Cilium / eBPF】排障坐标系:丢包、policy deny、identity 漂移、Service 黑洞与加密失败

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-16T00:00:00Z

The AI policies across the Linux ecosystem are very heterogeneous, ranging from the GCC’s restrictiveness, the Linux kernel’s pragmatism, to the more open disclosure-based utility model of...

Beyond Consensus: the Fragmentation of AI Policy across the Linux Ecosystem

InfoQ InfoQ · 2026-08-10T04:04:00Z

HashiCorp has introduced tfpolicy, a new HCL-based policy-as-code framework for Terraform, now available in public beta within HCP Terraform. It is designed to simplify and modernize...

Terraform Introduces tfpolicy, an HCL-based Policy-as-Code Framework

InfoQ InfoQ · 2026-07-31T18:00:00Z

Instead of immediately opening pull requests when newer dependency versions are released, Dependabot now waits three days before suggesting upgrades, thus increasing the likelihood that malicious...

GitHub Introduces Default "Cooldown" Policy for Dependabot Version Updates

InfoQ InfoQ · 2026-07-28T19:00:00Z
Diffusion Policy笔记

本文讨论了Diffusion Policy在机器人动作规划中的应用。通过神经网络预测噪声并逐步去噪,机器人能够生成精准的动作轨迹。尽管面临视觉遮挡和物理干扰,机器人依然能重新规划路径,展现出强大的适应能力。研究表明,该模型在学习物理系统动力学方面表现出色。

Diffusion Policy笔记

plus studio plus studio · 2026-04-10T00:00:00Z
GigaWorld-Policy——以动作为中心的世界动作模型:为降低推理延迟,训练用视频,推理能可选性的去视频(类似τ0​-WM)

GigaWorld-Policy是一种高效的以动作为中心的世界-动作模型,旨在提升机器人策略学习。该模型结合未来视觉动态与动作预测,优化学习效率并减少推理延迟。通过课程式训练和多样化视频源注入物理先验,在机器人数据上进行预训练,以增强对交互动力学的鲁棒性。

GigaWorld-Policy——以动作为中心的世界动作模型:为降低推理延迟,训练用视频,推理能可选性的去视频(类似τ0​-WM)

结构之法 算法之道 结构之法 算法之道 · 2026-03-23T15:52:37Z

The Most Important Foreign Policy Speech in Years

The Most Important Foreign Policy Speech in Years

Josherich的博客 Josherich的博客 · 2026-01-27T00:00:01Z
CHIP——基于事后扰动的「人形自适应柔顺力控制」:不动reward或参考轨迹,把“受力后的位姿偏移”解释成policy本来就该跟的目标,以兼顾追踪模仿和受力后的柔顺性

CHIP是一种自适应柔顺控制方法,通过事后干扰提升人形机器人在外力作用下的稳定性和灵活性。该方法简化了运动编辑问题,改善了机器人在擦拭、开门和多机器人协作等任务中的表现,并可无缝集成到现有系统中,具有广泛应用潜力。

CHIP——基于事后扰动的「人形自适应柔顺力控制」:不动reward或参考轨迹,把“受力后的位姿偏移”解释成policy本来就该跟的目标,以兼顾追踪模仿和受力后的柔顺性

结构之法 算法之道 结构之法 算法之道 · 2025-12-20T14:37:03Z
使用面向构建者的全新开源 MCP 服务器 IAM Policy Autopilot 简化 IAM 策略创建

IAM Policy Autopilot是一款开源工具,能够分析应用代码并自动生成AWS IAM策略,帮助开发者加速开发流程。它支持Python、TypeScript和Go,并与多种AI编程助手集成,提供专业的IAM知识。

使用面向构建者的全新开源 MCP 服务器 IAM Policy Autopilot 简化 IAM 策略创建

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2025-12-03T02:16:01Z

开源是用户和社区的集合,依赖法律管理源代码,具有经济价值。其起源、自由软件主张及法律保障值得探讨。开源促进创新,经历了从个人合作到商业模式的发展,已成为社会的一部分。

开源的制度拼图:推荐《Open Source Law, Policy and Practice》

「开源之道」 「开源之道」 · 2025-09-10T04:31:29Z

本文介绍了一种结合强化学习与视觉-语言-动作模型的微调方法ConRFT,旨在提升机器人任务的样本效率和安全性。ConRFT通过离线和在线两个阶段,利用人类示范数据和一致性策略,解决了传统方法在真实环境中的挑战,增强了智能机械臂的精准性和泛化能力。

ConRFT——Consistency Policy下RL微调VLA的方法:离线通过演示数据微调(结合Q损失和BC损失),后在线RL微调,且引入人工干预

结构之法 算法之道 结构之法 算法之道 · 2025-09-09T16:32:23Z

本文介绍了一种新型强化学习算法——群体序列策略优化(GSPO),旨在提升大型语言模型的训练稳定性和效率。GSPO通过基于序列概率定义重要性比率,解决了GRPO算法的稳定性问题,显著提高了Qwen3模型的性能。

一文通透GSPO——Qwen3所用的“群体序列策略优化”:摒弃token级别的off-policy校正,而在序列级别利用重要性权重进行优化

结构之法 算法之道 结构之法 算法之道 · 2025-08-25T04:42:10Z

本文研究了近端策略优化(PPO)中的优势估计不稳定性,提出了动态非线性缩放自适应调制优势估计方法AM-PPO,显著改善了奖励轨迹,促进了学习过程,减少了剪裁需求,具有广泛的应用潜力。

AM-PPO: Advantage-Based Alpha Modulation and Proximal Policy Optimization

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究提出了一种引导策略优化(GPO)框架,旨在解决部分可观察环境中强化学习的不确定性问题。该方法通过引导者与学习者的共同训练,理论上达到了与直接强化学习相当的最优性,并在多项任务中显著优于现有方法。

Guided Policy Optimization under Partial Observability

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究提出了LLM-Explorer,利用大型语言模型分析学习状态,生成特定任务的探索策略并动态调整。实验结果显示,该方法在Atari和MuJoCo基准测试中平均提升表现37.27%。

LLM-Explorer: A Large Language Model-Driven Plugin for Enhanced Reinforcement Learning Policy Exploration

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究提出了Pass@K策略优化(PKPO)方法,解决了传统强化学习算法在样本独立优化中多样性不足的问题。该方法通过优化pass@k性能,提升了复杂任务中的学习能力。

Pass@K Policy Optimization: Addressing More Challenging Reinforcement Learning Problems

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码