SIMA 2是一款能在虚拟3D世界中与用户共同游玩、推理和学习的AI代理,具备高级交互能力,可理解环境并辅助任务,推动AI在沉浸式场景中的发展。
Atari推出了复古游戏机Intellivision Sprint,结合了80年代的外观与现代技术。新机型配备无线充电手柄、HDMI接口和45款内置游戏,预售价格为149.99美元,预计于2025年12月5日发货。
Atari Gamestation Go掌机将于2025年10月发售,预售价为180美元,预装超过200款复古游戏,配备多种控制选项,适合怀旧玩家。屏幕为7英寸,电池续航约4至5小时。
本研究提出了一种新颖的Hadamax编码器架构,解决了强化学习中简单网络架构性能提升有限的问题。该架构在Atari-57基准测试中表现优异,Hadamax-PQN模型相比传统PQN性能提升达80%。
本研究提出了LLM-Explorer,利用大型语言模型分析学习状态,生成特定任务的探索策略并动态调整。实验结果显示,该方法在Atari和MuJoCo基准测试中平均提升表现37.27%。
Atari推出了一款名为Atari 2600 My Play Watch的智能手表,售价79.99美元,主打娱乐,支持经典游戏,界面可定制,适合怀旧玩家。预购已开放,预计2025年6月10日发货。手表功能有限,但屏幕更大,外观坚固,配有可更换的复古表带。
本研究提出了一种新颖的随机重排列方法,旨在提高强化学习中经验重放的采样效率,增强学习的稳定性和样本效率。在Atari基准测试中,该方法优于传统技术。
本研究提出了SPRIG框架,以解决深度强化学习代理在高维感知环境中协调感知与决策的难题。实验结果显示,SPRIG在Atari BeamRider环境中的表现优于标准PPO,回报率提升约30%。
本研究探讨了强化学习在游戏中的应用,特别是Atari和策略游戏中的重要性。通过回顾谷歌DeepMind的创新成果,如AlphaGo、AlphaGo Zero和MuZero,文章展示了这些模型在学习效率和适应性方面的突破。最显著的发现是MuZero在没有具体规则知识的情况下,能够学习游戏环境的底层动态,从而在多种游戏中表现出更高的灵活性。
Atari推出了一款庆祝《小行星》45周年的限量手表,设计独特,时针和分针由UFO代替,售价499美元。手表具备夜光、防水功能,采用日本自动机芯,灵感来自1977年Atari游戏机,限量125个。
本研究通过单人游戏知识转移提升双人游戏的训练效率,有效解决了环境复杂性和训练不稳定性的问题。在十种Atari 2600环境中验证,结果显示训练时间和平均总奖励显著改善,为双人游戏强化学习提供了新方法。
本文介绍了一种基于卷积神经网络和增强学习的深度学习模型,应用于Atari 2600游戏,取得了优于以往方法的成果。研究探讨了人类示范数据对强化学习的影响,并提出了多种算法以解决深度强化学习中的关键问题,提升了模型的性能和数据效率。最新的DART方法通过离散表示建模世界,在样本效率基准测试中表现优越。
Atari将于2024年冬季推出7800 Plus游戏主机,售价129.99美元,支持2600和7800游戏卡带,配备HDMI接口,玩家可选择宽屏或4:3模式。同时推出的新无线手柄CX78 Plus和CX40 Plus兼容PC及其他Atari主机。主机附带一款新游戏,另有10款可单独购买。
Atari 400 Mini是该品牌首款家用游戏机的复制品,附带25款经典游戏,并支持额外游戏。该游戏机可连接到现代显示器,具有倒带游戏和快照保存等功能。它是复古游戏收藏中独特而鲜为人知的补充。
通过引入可控的新奇性,我们在 Atari Learning Environment 这一最常见的强化学习基准中提出了 HackAtari 框架,以增强强化学习算法的鲁棒性和行为一致性。
基于模型的增强学习代理利用变换器已经显示出更好的样本效率,因为它们能够对扩展的上下文进行建模,从而得到更准确的世界模型。然而,对于复杂的推理和规划任务,这些方法主要依赖于连续表示,这使得对实际世界的离散属性,例如不可插值的不相交对象类的建模变得复杂。在这项工作中,我们引入了基于变换器学习的离散抽象表示(DART),一种利用离散表示对世界和学习行为进行建模的样本高效方法。我们通过包含变换器...
Atari发布了Atari 400 Mini,这是一款迷你游戏机,探索了特定的视频游戏历史领域。这款游戏机采用复古设计,有着米色塑料外壳,配备键盘和插卡槽,用于装饰目的。它配备了经典的Atari手柄,并内置了25款来自Atari 8位时代的游戏。该游戏机通过USB接口可以扩展,可以连接额外的手柄和键盘,并支持侧载游戏。尽管面临其他Atari游戏选项的竞争,但Atari 400 Mini独特的设计和灵活性可能会吸引爱好者。
本文介绍了一种新的离线强化学习方法——图决策Transformer(GDT),使用因果图建模输入序列,处理细粒度空间信息。实验表明,GDT在基于图像的Atari和OpenAI Gym上的性能可以与最先进的离线强化学习方法相媲美或超越。
完成下面两步后,将自动完成登录并继续当前操作。