82岁的肯·汤普森回忆了Unix操作系统的早期发展。他与同事们在贝尔实验室的开放环境中合作,创造了Unix和C语言,推动了技术进步,并分享了许多趣事,展现了那个时代的创新与友谊。
本研究针对联邦学习中高计算和通信需求对资源有限设备的挑战,提出了一种新颖的联邦鲁棒剪枝框架(FedRTS)。该方法通过基于汤普森采样的调整机制,利用稳定和前瞻性的信息作出决策,从而提高鲁棒性和性能。实验结果表明,FedRTS在计算机视觉和自然语言处理任务上表现出色,同时降低了通信成本,特别是在数据分布异构和部分客户端参与的场景中。
纽约警方正在追踪一辆在曼哈顿酒店外被用来杀害联合健康公司首席执行官布莱恩·汤普森的Citi Bike。汤普森在周三早上遭枪击,凶手骑车逃离。警方呼吁公众提供线索,Lyft表示愿意协助调查。汤普森的妻子提到曾收到威胁。
本文介绍了一种名为BOSS的贝叶斯模型不确定性模块化强化学习方法,该方法通过乐观选择行动来促进探索。该算法在样本复杂度和收益方面表现优异,适用于高维状态-动作空间。研究强调了乐观探索和模型不确定性在提高学习效率和策略优化中的重要性。
本文探讨了Thompson Sampling算法在序贯决策中的应用,尤其是在多臂赌博机问题中的表现。该算法通过贝叶斯方法实现了对数级别的预期遗憾,并在不同环境下进行了多种改进和扩展,展示了其在探索与开发权衡中的有效性和鲁棒性。
在大型语言模型中,我们提出了一种新的方法,即具有无损加速的早期退出推理(EESD),通过在前 N 层后引入早期退出结构,利用语言模型的一部分生成初步令牌,并通过自蒸馏方法提高初步令牌的质量。我们还引入了一种新的采样机制,利用汤普森采样调节生成过程,自动确定每一轮的初步令牌数量。实验结果表明,与先前的方法相比,我们的方法在解码令牌时具有明显的加速效果。
本文探讨了基于贝叶斯方法的Thompson Sampling算法在多臂赌博问题中的应用,提出了新的悔恨分析方法,并证明了其在期望后悔上的界限。研究表明,该算法在强化学习和Markov决策过程中表现优异,尤其在处理未知环境和奖励分布时,具有重要的理论和实际应用价值。
本文提出了一种改进的汤普森抽样策略,旨在解决探索不足的问题,并提供了理论证明。研究涵盖了基于在线最小二乘回归的频率分析、贝叶斯思想的算法泛化以及新型深度神经网络算法,展示了在多臂老虎机和上下文赌博问题中的有效性和优越性。
改良的 Thompson 抽样方法(TS)在贝叶斯优化(BO)中解决了利用 - 探索困境问题,在通过随机生成和最大化高斯过程(GP)后验样本路径来优先进行探索的同时,引入了 epsilon-greedy 策略来管理其利用,该策略随机在两种极端之间切换,从而平衡了两者的需求,并通过实验证明了该方法的有效性。
本文对应用于凸体上的对数凸概率分布的Langevin Monte Carlo采样算法进行了理论分析,建立了收敛界限和算法复杂度证明,并进行了数值实验比较。
通过将四种常见的离线计数数据模型(泊松、负二项、零膨胀泊松和零膨胀负二项回归)与汤普森抽样(Thompson sampling)结合起来,本研究提出了一种新的算法来改善 mHealth 系统用户参与度,并在真实数据和模拟数据上取得了好的结果。
本研究提出了基于Thompson抽样的并行贝叶斯优化方法,称为STS-PBO,用于解决时间敏感的黑盒优化问题。该方法引入了速率失真理论构建平衡学习所需信息量和次优性的损失函数,并采用Blahut-Arimoto算法计算目标解。实验证明,STS-PBO方法在同步和异步设置中均优于串行方法和传统Thompson抽样的并行贝叶斯优化方法。
本文介绍了 Thompson sampling 方法(MP-TS)及其改进版本,证明其具有最优后悔上界。
完成下面两步后,将自动完成登录并继续当前操作。