大型语言模型(LLM)在自主解决现实任务中越来越重要,尤其是在函数调用方面。错误的函数调用可能导致严重后果,因此评估LLM对函数调用正确性的信心至关重要。本文首次探讨了不确定性量化(UQ)方法在LLM函数调用中的应用,结果显示多样本UQ方法在此场景中并未显著优于单样本方法。通过聚类输出和选择语义相关的标记,可以提升现有UQ方法的性能。
本文介绍了如何利用scipy.stats进行高效的概率建模和不确定性量化。通过冻结分布、蒙特卡罗模拟、参数扫描、重尾分布建模和自助法置信区间,数据科学家能够更好地应对业务风险和决策不确定性,简化模型设计,提高模拟效率,并准确评估极端事件。
本文探讨了推理模型中推理轨迹长度作为置信度估计器的作用。研究表明,推理后训练改变了轨迹长度与准确性之间的关系,且在多种模型和数据集上,轨迹长度与其他置信度估计器相辅相成。此外,高熵或“分叉”标记在这一机制中起着关键作用,证明推理后训练增强了不确定性量化能力。
语言模型中的不确定性量化(UQ)对安全性和可靠性至关重要。研究表明,UQ方法与任务正确性函数之间的偏差会系统性扭曲评估结果,影响AUROC排名。分析显示,正确性函数的长度偏差与UQ方法的长度偏差相互作用,导致评估失真。使用LM作为评判者的方法被认为是最不受长度偏差影响的,提供了更公平的UQ评估路径。
本文研究了支持向量机(SVM)在预测中的不确定性量化,提出了稀疏支持向量分位回归(SSVQR)模型,以提高预测区间的质量,并通过特征选择减少高维数据集中的特征数量。实验结果表明,SVM在概率预测任务中优于现代深度学习模型。
本研究通过引入不确定性量化模块,显著提升了大语言模型对不确定性的捕捉能力,增强了幻觉检测性能和可靠性评估。
本研究提出了一种公平不确定性量化(FUQ)方法,以解决抑郁预测中的公平性问题。通过群体分析和优化策略,验证了该方法在视觉和音频数据集中的有效性。
台湾大学研究人员结合不确定性量化、定向信息传递神经网络和遗传算法,优化分子设计,提高化学空间探索的成功率。研究表明,概率改进优化在多目标任务中表现优越,为计算辅助分子设计提供实用指导。
本研究提出了一种蒙特卡洛时间丢失(MC-TD)方法,旨在解决深度学习模型在回归任务中处理时间序列数据缺失的问题,尤其是由于卫星故障或云遮挡造成的缺失。该方法提升了预测性能和不确定性校准能力,增强了地球观测中的不确定性量化。
本研究提出了一种综合框架,旨在解决大型语言模型在医疗应用中的不确定性量化问题,结合贝叶斯推断和深度集成方法,以增强用户信任。
本研究提出了一种基于图注意力的贝叶斯深度展开算法,旨在解决单光子激光成像在嘈杂环境中多目标处理的困难。该方法结合分层贝叶斯模型和神经网络,提升了成像的准确性和不确定性量化能力,实验结果表明其在复杂场景中的表现优越。
本研究针对大型语言模型在高风险领域应用中的不可靠性,提出了一种新的不确定性量化分类法,以提升模型的可信度,并揭示了不确定性的来源及提升可靠性的挑战。
本文研究了缺失链接预测方法,提出了新的加权矩阵分解、布尔矩阵分解和推荐矩阵分解,结合自动模型选择和不确定性量化技术,以提高链接预测的可靠性和准确性。实验结果表明,该方法在蛋白质相互作用网络中显著提升了预测性能。
本文探讨了人工智能透明性研究中缺失的基础概念,强调不确定性量化的重要性。研究表明,不确定性与反事实可解释性相辅相成,能够通过统一框架增强模型的可靠性和可理解性。
本文探讨了大语言模型(LLMs)响应的可靠性,提出了一种多维不确定性量化框架,结合语义和知识感知的相似性分析,通过生成多个响应和张量分解,提高了不确定性量化的准确性。
该研究提出了一种新方法,利用生成模型和序列采样技术,通过序贯蒙特卡洛法在潜在空间中高效解决逆问题,效率是传统方法的三倍,适用于图像重建和不确定性量化等领域。
本研究提出了一种基于证据深度学习的新模型,旨在克服传统物理知情神经网络在不确定性量化方面的不足,提高对数据噪声的敏感性,并改善边界条件和预测不确定性的覆盖概率。
本研究探讨了单目深度估计中的不确定性量化问题,提出将五种不确定性量化方法与DepthAnythingV2模型结合。通过高斯负对数似然损失微调,研究实现了在保持预测性能的同时,提供可靠的不确定性估计,为机器视觉系统的安全应用奠定基础。
本研究探讨了地球观测产品不确定性量化的可靠性,提出了三个专门设计的基准数据集,以比较不同的不确定性量化方法。这些数据集涵盖回归、图像分割和场景分类等问题,促进了机器学习模型输出质量的准确评估。
本研究提出了一种基于符号回归的方法,成功识别出12种用于电催化的酸稳定氧化物,仅需30次迭代。该方法通过精确预测和不确定性量化,降低了遗漏潜力材料的风险。
完成下面两步后,将自动完成登录并继续当前操作。