本文研究了在给定独立同分布样本的情况下,如何估计未知离散分布,重点在于最小化真实分布与算法估计之间的KL散度。我们提出了实例最优的算法,能够在有无差分隐私约束的情况下实现最优性能,并利用Good-Turing估计器的变体建立上界。
清华大学段然团队突破Dijkstra算法速度限制,提出新算法解决“排序障碍”,实现更快的最短路径计算,标志着算法研究的重要里程碑。
本研究提出了一种引导策略优化(GPO)框架,旨在解决部分可观察环境中强化学习的不确定性问题。该方法通过引导者与学习者的共同训练,理论上达到了与直接强化学习相当的最优性,并在多项任务中显著优于现有方法。
本研究针对进化算法中普遍认为的停滞问题进行了深入探讨,指出停滞并不必然妨碍收敛,同时收敛也不一定表示最优。研究首次揭示,个体的停滞可以促进整个种群的收敛,且收敛不足以保障进化算法的有效性。这些发现对进化算法的理解与应用具有重要影响。
本研究解决了推理时间计算对语言模型性能扩展的影响,特别是最佳之N采样可能导致的性能下降问题。通过引入新的算法“推理时间悲观主义”,该研究展示了如何在不确定性面前通过拒绝采样来减轻奖励劫持的影响,从而实现理想的性能扩展。实验结果表明,该算法在多种任务和模型中具有显著的优势。
本文解决了学习增强的一次性最大搜索中现有方法缺乏平滑性或未能实现最佳最坏情况保证的问题。提出的算法首次同时满足一致性和鲁棒性的最佳权衡,且利用获得的平滑性对包含随机性的学习增强环境中的一次性最大搜索进行了分析。该研究的主要发现为算法在不确定环境下的有效性提供了新的保证。
我们研究了重尾梯度下的差分隐私随机凸优化问题,提出了一种新的约简方法,首次在重尾环境中实现最优速率,满足(ε,δ)近似差分隐私。
Dijkstra算法经过近70年的发展,已被证明具备普遍最优性,并能在最坏情况下实现最佳性能。多所顶尖高校的合作研究提升了该算法的效率,广泛应用于地图和网络路由等领域。
对数据驱动的新闻供应商问题应用样本平均逼近(SAA)的后悔性能进行研究,通过分析 SAA 后悔的界限,证明了其性能受到 α 而不是 β 的长期影响,同时提出了新的梯度逼近技术和具有独立利益的难题实例。
本研究探讨了强化学习中Actor-Critic算法的全局收敛性和最优性,证明了在使用神经网络时,算法以亚线性速率收敛于全局最优策略,并分析了共享神经结构和随机初始化对收敛性的影响,为神经策略梯度方法的优化提供了理论支持。
本文提出了一种新的Mean Actor-Critic(MAC)算法,旨在优化离散动作连续状态的强化学习。该算法通过显式表示所有动作值来减少策略梯度估计的方差,并在多个控制领域和Atari游戏中表现出竞争力。此外,研究探讨了Actor-Critic算法的全局收敛性和最优性,提出了改进的性能界限,并在交通信号控制等应用中展示了其实用性。
人流移动模拟是模拟人员移动的技术,可应用于游戏、城市规划、建筑设计和交通组织等领域。清华大学研究人员提出了一种新的条件去噪扩散模型,通过社会力引导的扩散过程来模拟人群行为。该模型集成了等变性的强归纳偏差,并开发了适用于扩散模型的长程训练算法。实验证明该模型相对于基线方法有显著性能提升。
本文研究了在对抗性和随机的 K 臂赌博机中,随机扰动策略(Follow-the-Perturbed-Leader)的最优性。我们建立了对于扰动实现 O (√KT) 遗憾的充分条件,并展示了随机扰动策略在具有特定尾部分布的情况下实现的最佳两者能力。
本文探讨了通过对角线和全方差提升DPM模型表现力的方法,提出了最优协方差估计及其校正,实验结果表明该方法在样本质量和效率上优于传统设计。此外,介绍了新型去噪扩散概率模型及其在无线通信中的应用,有效解决了硬件损伤和信道失真问题,显著提高了重建性能。
本研究探讨了多头softmax注意力模型在上下文学习多任务线性回归中的渐变流动动力学,并发现了有趣的“任务分配”现象。研究证明了梯度流在优化上的最佳性,为多头softmax注意力模型提供了第一个收敛结果。
本论文提出了一种验证自动驾驶系统安全特性的实用方法,通过建立代理模型描述交通场景下的行为,并评估多个模拟交通场景的安全特性。
存在一种函数或度量,可以最小化给定的凸泛函或风险,并满足一种由可靠的变换组指定的对称性质。通过利用 Stein 和 Le Cam 的旧思想以及出现在可靠的定理中的近似群平均,我们得出了结果。在凸分析中被称为 orbitopes 的一类凸集变得至关重要,并且我们在非参数设定中建立了这些 orbitopes 的属性。我们还展示了一个称为 cocycle 的简单装置,可用于将不同形式的对称性化简为一个问题。作为应用,我们在对称性约束下获得了关于不变核均值嵌入和 Monge-Kantorovich 定理的结果。我们还解释了与关于不变测试的 Hunt-Stein 定理的关联。
研究了离散时间无限远平均回报的不安静赌博机问题,提出了一种新的策略类别,证明了在 N 臂问题中,如果单臂松弛问题是单连通和非周期的,我们的策略是渐近最优的,具有 O (1/√N) 的最优性差距。与目前大多数关注索引或优先级策略,依靠统一全球吸引子属性(UGAP)以保证收敛到最优解的已有工作,或者最近开发的基于模拟的策略不同,我们的方法不需要同步假设(SA)。
本篇论文研究了核分类器的统计性能,考虑了核回归理论的最新进展,在一些条件概率的基础上得出了核分类器分类超额风险的上界,并获得了对 Sobolev 空间的极小下界,表明所提出的分类器的最优性,同时将理论结果推广到超参数化神经网络分类器的泛化误差,并提出了一种估计插值平滑性的简单方法并应用于真实数据集。
研究人员探讨了均值估计的问题,发现没有合理的估计器能够在渐近情况下超过次高斯的误差率。他们引入了一个新的定义框架来分析算法的最优性,称之为'邻域最优性'。文章提供了解决重尾均值估计问题的方法,并介绍了相关的研究成果。
完成下面两步后,将自动完成登录并继续当前操作。