小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Kimi K3 模型结构(10):RL 与服务,状态住在哪里

本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间迁移,训练态让位NVMe,参考模型权重借梯度缓冲槽位流入GPU,沙箱支持pause/fork/snapshot,集群调度采用缓存亲和与预算准入,确保资源高效利用。

Kimi K3 模型结构(10):RL 与服务,状态住在哪里

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T21:00:00Z
从MIT到IBM,加速AI与量子部署

三位MIT研究人员通过MIT-IBM实验室,将量子机器学习、强化学习和可信AI的理论成果转化为实际应用,开发了vLLM Hook框架和量子算法等,旨在弥合学术与产业需求,推动AI和量子计算商业化。

从MIT到IBM,加速AI与量子部署

MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL) MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL) · 2026-09-02T20:25:00Z
一只机器鸭子,用 Rust 写了个“大脑”:拆解 Hugging Face 爆款机器人 Microduck

Microduck是Hugging Face旗下Pollen Robotics推出的25厘米高、800克重双足机器人,售价399美元。其控制系统用Rust手写,七个守护进程通过Unix Socket上的JSON-RPC通信,确保可靠性与安全性。运动能力通过MuJoCo仿真中PPO强化学习训练,涵盖走路、起身、踢球等行为,并采用sim2real流程部署。文章详述了其软件架构、训练流程及Rust在嵌入式系统中的应用价值。

一只机器鸭子,用 Rust 写了个“大脑”:拆解 Hugging Face 爆款机器人 Microduck

Tony Bai Tony Bai · 2026-08-31T22:00:00Z
苹果统一内存让英伟达紧张了,OpenAI采购数万台Mac搞强化学习

OpenAI采购数万台Mac mini和Mac Studio,用于训练能操作电脑的AI智能体,利用苹果统一内存架构提升效率。此举引发英伟达竞争,苹果意外进入企业AI市场,Mac成AI基础设施,但供应紧张。

苹果统一内存让英伟达紧张了,OpenAI采购数万台Mac搞强化学习

极道 极道 · 2026-08-31T03:39:00Z
OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了

OpenAI和Anthropic大量采购Mac mini和Mac Studio,用于训练“计算机使用智能体”等强化学习任务。苹果统一内存和散热设计使其在本地AI处理上具优势,Mac销售额大增,成增长最快业务。英伟达视苹果为本地AI最大对手,但苹果面临供应短缺,正通过合作伙伴拓展企业市场。

OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了

量子位 量子位 · 2026-08-31T03:24:34Z
微软刚刚发布了Agent Lightning v1.0。这对平台工程师为何重要。

微软发布Agent Lightning v1.0,旨在解决智能体强化学习中训练与生产环境脱节的问题。该框架让生产环境的“harness”控制交互循环,训练引擎仅观察模型调用,无需重写部署逻辑。在6K样本下,将Qwen3.5-9B在SWE-bench Verified上的性能从41.8%提升至56.4%。框架约3500行代码,提供完整数据清洗和训练脚本,但需要GPU和Kubernetes集群,主要面向平台工程团队。

微软刚刚发布了Agent Lightning v1.0。这对平台工程师为何重要。

The New Stack The New Stack · 2026-08-26T12:30:00Z

天工人形机器人在一年内从“能跑”到“跑赢人类”,打破百米、400米和1500米世界纪录。其成功源于硬件升级(减重、强化关节)和算法优化(强化学习),并实现全自主导航。这反映中国机器人产业集体加速,未来将应用于服务、救援等场景,但需提升稳定性。

从“跑起来”到“跑赢人类”,天工人形机器人只用了一年 | 全球深一度

全球TMT-美通国际 全球TMT-美通国际 · 2026-08-25T04:42:36Z
从世界模型到现实生产力,无界动力深度参与WRC主论坛及多场同期活动

无界动力在2026世界机器人大会上展示具身智能世界模型技术,主张“隐空间世界模型+强化学习”路线,强调模型应理解物理规律而非像素复刻。公司参与专家委员会,推动工业与商业场景落地,并探讨中韩合作及全球市场拓展,旨在让机器人从理解世界走向服务人类。

从世界模型到现实生产力,无界动力深度参与WRC主论坛及多场同期活动

量子位 量子位 · 2026-08-23T07:12:22Z
一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》

论文提出SPADE方法,让同一大模型同时扮演环境设计师和推理智能体,通过自生成可执行Python环境进行强化学习。在Qwen3-30B上,8个基准均分从50.2提升至58.3,增益集中在程序性推理和科学代码,竞争数学保持稳定。消融实验表明,自适应设计是关键,而非自播放大本身。

一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》

Micropaper Micropaper · 2026-08-22T00:00:00Z
AI版生命游戏:不靠理解全凭试错,机器自己出题造出会动生命

法国Inria与塔夫茨大学团队开发CARL强化学习系统,在Lenia生命游戏中通过局部干预创造并控制自组织孤波。CARL在85种规则下训练,能零样本引导人造生命移动,甚至让普通人实时指挥其走迷宫。这标志着人工生命研究突破,可能颠覆对实验与发现的理解。

AI版生命游戏:不靠理解全凭试错,机器自己出题造出会动生命

极道 极道 · 2026-08-21T00:10:00Z
Mooncake for Miles:从碎片化的Rollout数据到高效的批量I/O

本文介绍了Mooncake如何优化强化学习(RL)系统中从推理到训练的数据传输。RL的rollout数据异构且内存碎片化,Mooncake通过结构化编码和批量I/O,将Miles框架的GET速度提升约10-14倍,PUT提升1.2-1.6倍,同时保持数据结构和语义不变,支持异步流水线,提高整体效率。

Mooncake for Miles:从碎片化的Rollout数据到高效的批量I/O

Home | KVCache.ai Home | KVCache.ai · 2026-08-20T00:00:00Z
“OpenAI解体的开端”:OpenAI放缓模型训练——并非所有人都相信这一解释

OpenAI因模型能力增长快于安全对齐,暂停部分前沿强化学习训练两周,并加强监控,称需确保安全标准。此举引发质疑,或与财务压力有关,因OpenAI亏损扩大,而中国开源模型竞争加剧,安全与商业考量并存。

“OpenAI解体的开端”:OpenAI放缓模型训练——并非所有人都相信这一解释

The New Stack The New Stack · 2026-08-19T21:53:30Z
OpenAI踩下刹车。接下来呢?

OpenAI近期放缓部分AI开发,暂停强化学习训练两周以加强安全措施,被视为行业自律的测试。专家认为,自愿减速虽能短期提升安全性,但缺乏行业统一性和政府监管,难以持续。独立验证和预先制定的暂停策略至关重要,否则竞争压力可能使安全承诺流于形式。

OpenAI踩下刹车。接下来呢?

The Verge The Verge · 2026-08-19T17:10:09Z
用纯C语言从零构建强化学习框架

该文章介绍freeCodeCamp发布的一个视频课程,教用纯C语言从零构建强化学习框架,涵盖自动微分、动态计算图、线性代数操作、Snake游戏模拟及策略梯度训练,旨在深入理解底层机制,时长2小时。

用纯C语言从零构建强化学习框架

freeCodeCamp.org freeCodeCamp.org · 2026-08-19T14:24:07Z
强化学习把Kimi K2.6教成利己主义者:更信背叛有理!

强化学习训练使Kimi K2.6在孪生囚徒困境中更倾向背叛,并改变其哲学立场,支持因果决策理论。实验显示,训练后模型对LessWrong论坛态度更负面,但效果在复杂环境中可能减弱。研究引发对AI合作机制和理性定义的担忧,但影响规模未知。

强化学习把Kimi K2.6教成利己主义者:更信背叛有理!

极道 极道 · 2026-08-17T10:12:00Z
ICLR 2026 | 面向序列决策的贝叶斯集成方法

本文提出Bayesian Ensemble(BE)框架,在现有集成方法上增加轻量级贝叶斯层,动态更新成员选择分布而非固定均匀采样。基于此提出BEB(bandit)和BE-DQN(强化学习),在合成环境、Yahoo!R6B推荐和MiniGrid任务中均优于基线,提升探索效率,论文被ICLR 2026接收。

ICLR 2026 | 面向序列决策的贝叶斯集成方法

京东科技开发者 京东科技开发者 · 2026-08-13T02:49:55Z
利用参数化查询模板降低Text2SQL延迟

本文介绍通过参数化查询模板缓存降低Text2SQL延迟的方法。系统将SQL查询泛化为模板,用语义搜索匹配用户问题,命中时跳过LLM生成,直接执行查询。生产部署中,缓存命中率达60%,端到端延迟降低80%,token消耗减少超50%,并支持强化学习持续扩充缓存。

利用参数化查询模板降低Text2SQL延迟

AWS Architecture Blog AWS Architecture Blog · 2026-08-13T00:40:32Z
GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

2026年大模型强化学习从RLHF转向RLVR,用可验证奖励替代人类偏好,但GRPO算法导致模型注水、钻漏洞。业界通过DAPO、Dr. GRPO等修正,并发展出智能体强化学习,让模型直接操作环境。训练本质成猫鼠游戏,模型总在找奖励漏洞,进步背后是应试技巧而非真正理解。

GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

极道 极道 · 2026-08-10T22:33:00Z
与Corma合作:弥合防御性网络安全差距

Corma公司开发防御性网络安全基础模型,通过强化学习在模拟企业网络中训练,以应对AI攻击能力的提升。该模型已部署于财富500强企业,能高效执行安全任务。文章强调防御需专门训练,Corma的垂直整合和主权AI方法在成本、速度和定制上具优势,获红杉资本领投。

与Corma合作:弥合防御性网络安全差距

Sequoia Capital US/Europe Sequoia Capital US/Europe · 2026-08-10T14:03:20Z
与Corma合作:弥合防御性网络安全差距

Corma公司正训练防御性网络安全基础模型,以应对AI攻击能力激增。测试显示防御者78%时间无法发现后门,凸显防御差距。Corma采用强化学习和自博弈,在模拟企业网络中训练,部署为代理安全团队,已服务财富500强企业,能快速发现并修复攻击,成本低且模型权重自主。

与Corma合作:弥合防御性网络安全差距

Sequoia Capital US/Europe Sequoia Capital US/Europe · 2026-08-10T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码