小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应)

本文提出Robo-ValueRL框架,旨在通过可靠的价值函数提升离线到在线强化学习在机器人操作任务中的性能。该框架包含三个关键组件:历史条件化价值估计器、质量条件化视觉-语言-动作(VLA)策略预训练和在线残差自适应模块。...

Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应)

结构之法 算法之道
结构之法 算法之道 · 2026-07-28T06:52:35Z
视频问诊上线后的持续优化:监控哪些指标、如何定位问题、多久迭代一次策略

视频问诊系统上线不是终点。上线之后,问诊量的增长、网络环境的变化、新设备和系统的适配、以及用户反馈中暴露的问题,都要求持续地监控和优化。这篇把上线后该监控什么、问题怎么定位、优化节...

视频问诊上线后的持续优化:监控哪些指标、如何定位问题、多久迭代一次策略

实时互动网
实时互动网 · 2026-07-24T03:09:33Z
一分钟读论文:《软件智能体的修复策略探索》

中山大学、浙江大学、华中科技大学和华为合作的论文《PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents》,提出了一种多智能体框架来系统性探索软件修复策略,在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 成绩。

一分钟读论文:《软件智能体的修复策略探索》

Micropaper
Micropaper · 2026-07-23T00:00:00Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结...

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道
结构之法 算法之道 · 2026-07-21T15:49:12Z

把 RFC 4301 的 SPD/SAD 映射到 Linux 6.6 的 xfrm policy/state:查看出站 xfrm_lookup、入站策略检查与 ip xfrm 观测面,并给出本机 netns 下手工安装 ESP 的对照实验入口。

【IPSec】Linux xfrm:从策略查找到加解密

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-21T00:00:00Z

大家好,我是 Lucifer,又来聊聊 Web3 的那些有趣事儿了。今天咱们来聊聊 Freqtrade。 上一篇我们从零搭好了 Freqtrade,写了个最简单的 SMA 交叉策略。很多人跑完回测后跟我说:“这策略也太简单了,实盘根本扛不住。” 说得对。那篇是入门用的“Hello...

Freqtrade 进阶:把多个弱信号拧成一根绳——多信号评分策略实战

lucifer的网络博客
lucifer的网络博客 · 2026-07-19T16:00:00Z
在AWS上部署Eclipse Dataspace Components的成本优化策略

在AWS上部署Eclipse Dataspace Components(EDC)时,合理配置和使用AWS服务可以显著降低成本,尤其是在关键和非关键工作负载下。通过调整计算资源和使用AWS Fargate Spot,非关键工作负载的成本可降低58%。同时,优化数据传输和存储策略也能有效减少开支。理解这些成本驱动因素有助于实现高效的资源利用和可持续发展。

在AWS上部署Eclipse Dataspace Components的成本优化策略

AWS Architecture Blog
AWS Architecture Blog · 2026-07-17T16:03:47Z
乐信圣文游戏 DynamoDB 最佳实践:支撑千万日活游戏上线的数据库设计与运维策略

乐信圣文分享了在Amazon DynamoDB上实施云端存档的最佳实践,包括表结构设计、容量模式选择和监控策略。通过“预置预热→按需上线→稳定转预置”的三阶段策略,确保高并发下的用户体验与成本优化,提升用户留存与广告变现能力,为游戏团队提供了参考。

乐信圣文游戏 DynamoDB 最佳实践:支撑千万日活游戏上线的数据库设计与运维策略

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-17T02:00:46Z

OPPO 宣布调整子品牌策略,realme 暂停在中国市场推出新品,专注海外市场;一加则转向中国市场,暂停欧美新品发布。realme 的售后服务将由 OPPO 负责,OPPO 还将整合软件系统,支持 realme 和一加 设备升级至 ColorOS。

派早报:OPPO 宣布调整旗下子品牌的全球产品策略等

少数派
少数派 · 2026-07-17T00:45:30Z
[MAF预定义的AIContextProvider-05]CompactionProvider——采用多种策略压缩对话历史 - Artech

为了解决LLM调用的无状态问题,需要将消息历史作为上下文发送给LLM。随着对话的进行,消息历史不断增长,可能超出LLM的上下文窗口限制,导致响应质量下降。因此,压缩对话历史是必要的。MAF提供了多种压缩策略,CompactionProvider支持摘要、折叠、删除和替换等策略,有效压缩消息历史,保留核心信息。

[MAF预定义的AIContextProvider-05]CompactionProvider——采用多种策略压缩对话历史 - Artech

Artech
Artech · 2026-07-13T01:34:00Z

本文讨论了Redis在内存达到上限时如何驱逐有效的key,重点分析了maxmemory和maxmemory-policy的作用。Redis采用近似LRU策略,通过随机采样和淘汰池来决定驱逐对象,避免了全局链表的复杂性。文章还介绍了不同的驱逐策略及其适用场景,以及内存管理中的常见误解和注意事项。

【Redis / 缓存内核】maxmemory 策略:近似 LRU/LFU 与 MEMORY DOCTOR

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-13T00:00:00Z
frp v0.70:开源内网穿透工具教程,完善 API、规定兼容性策略

frp 是一款跨平台的内网穿透工具,支持 Windows、macOS 和 Linux。它需要一台固定公网 IP 的电脑或 VPS,支持 HTTPS 和小程序开发。v0.64.0 更新了 tokenSource 支持,提升了安全性和稳定性。用户需配置服务器和客户端以远程访问内网资源,详细配置可参考官网。

frp v0.70:开源内网穿透工具教程,完善 API、规定兼容性策略

小众软件
小众软件 · 2026-07-12T08:50:38Z

Cloudflare 自 9 月 15 日起更新了 AI 爬虫策略,混合用途爬虫将纳入 AI 训练拦截管理。这一调整帮助网站管理员更好地控制内容使用权限,增强内容保护,确保原创内容不被 AI 模型训练。网站管理员需重新检查配置,关注 AI 爬虫访问情况,以确保内容授权与访问控制的有效性。

Cloudflare 更新 AI 爬虫策略:9 月 15 日起混合用途爬虫将纳入 AI 训练拦截

付杰博客
付杰博客 · 2026-07-11T04:50:18Z
选择合适的AI代理记忆策略:决策树方法

选择合适的AI代理记忆策略至关重要。文章介绍了四种记忆类型:工作记忆、语义记忆、情节记忆和程序记忆,并提供了一个决策树,帮助确定信息的存储需求。正确分类信息可以避免设计错误,确保代理有效使用记忆,提升用户体验。

选择合适的AI代理记忆策略:决策树方法

MachineLearningMastery.com
MachineLearningMastery.com · 2026-07-10T20:26:21Z

Rust 1.97.0 发布,默认启用 v0 符号改名,改善调试和工具链处理。Cargo 现可控制警告导致构建失败,优化大型项目工作流。linker 输出不再隐藏,增强平台兼容性。RustCrypto 性能分析指出,AES-GCM 速度差距需关注 SIMD 和硬件加速。NASA 开源 SpaceWasm,专为航天器设计的 WebAssembly 解释器,确保内存分配可预测。Garmin Tracker 是一款跨平台桌面应用,支持本地数据管理,强调用户数据掌控。

【Rust日报】2026-07-10 Rust 1.97.0 发布:v0 符号改名默认开启,Cargo 原生接管 warnings 失败策略

Rust.cc
Rust.cc · 2026-07-10T01:08:05Z
自主谈判中的行为隐私泄露:通过随机策略形式化和缓解推断攻击

本文探讨了自主谈判代理中的行为隐私泄露问题,提出了一种自适应随机谈判策略,确保差分隐私和高谈判效用。通过对3000次双边谈判的评估,该机制将对手推断准确率降低了43-50%,同时保持90%以上的成功率,证明了在不显著损失性能的情况下可以实现强隐私保障。

自主谈判中的行为隐私泄露:通过随机策略形式化和缓解推断攻击

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-10T00:00:00Z
S&P Global利用Amazon FSx和NetApp ONTAP快照的创新灾难恢复策略

S&P Global利用Amazon FSx和NetApp ONTAP实施了一种创新的灾难恢复解决方案,确保在区域故障时15分钟内实现只读模式的快速切换。该方案通过SnapMirror复制和FlexClone技术保持数据一致性,支持金融服务的业务连续性,降低基础设施成本,并满足合规要求。

S&P Global利用Amazon FSx和NetApp ONTAP快照的创新灾难恢复策略

AWS Architecture Blog
AWS Architecture Blog · 2026-07-07T16:32:21Z
微策略MSTR出售3,588枚比特币套现2.16亿美元 用于支付优先股股息和补充现金储备

微策略公司出售了3,588个比特币,套现2.16亿美元,用于支付优先股股息和补充现金储备。尽管优先股价格下跌,投资者信心不足,微策略仍是比特币市场最大净买家,但在熊市中面临融资困难。公司可能继续筹集资金购买比特币。

微策略MSTR出售3,588枚比特币套现2.16亿美元 用于支付优先股股息和补充现金储备

蓝点网
蓝点网 · 2026-07-07T01:30:03Z

阿里巴巴达摩院的论文《EvoPolicyGym》首次将自主策略演化形式化为独立评估设定,提出在固定交互预算内评估Agent的策略改进能力。研究表明,强自主策略演化依赖于任务适配机制的发现和策略的精炼。EvoPolicyGym框架提供轨迹级诊断,分析预算分配、反馈转化和策略精炼能力,强调自我进化能力在复杂任务中的重要性。

一分钟读论文:《当Agent学会自我进化——自主策略演化评估框架EvoPolicyGym》

Micropaper
Micropaper · 2026-07-07T00:00:00Z

阿里巴巴达摩院提出了“自主策略演化”评估新范式EvoPolicyGym,关注在固定预算内Agent如何迭代改进策略。该方法通过轨迹级诊断框架分析预算分配、反馈转化和策略精炼能力,揭示不同模型的演化模式。实验结果显示GPT-5.5表现优异,强调了Agent从反馈中学习的重要性。

一分钟读论文:《Agent能否从失败中进化——自主策略演化评估基准EvoPolicyGym》

Micropaper
Micropaper · 2026-07-07T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码