Voyage AI发布新一代代码嵌入模型voyage-code-4,专为编码代理优化,提升检索性能并降低成本。在代理代码检索基准上,其性能平均超越Cohere Embed v4和Gemini Embedding 2达28.25%和31.03%,在传统代码检索上也显著领先。该模型支持多种维度嵌入和量化,价格比前代低三分之一,现可通过Voyage API等获取。
阿里云百炼推出「记忆库」功能,赋予Agent长期记忆能力,提升个性化体验。用户可通过API或OpenClaw快速安装,解决对话中的上下文丢失问题,优化检索性能,适用于教育和客服等场景。
基础代理在企业应用中至关重要,但传统的检索增强生成(RAG)常常无法准确理解用户意图。为此,提出了“指令检索器”架构,能更有效地处理复杂查询,提升检索性能超过70%。该架构通过系统规范的传播,改善了指令遵循能力,适用于多步骤搜索代理,显著提高响应质量和任务完成效率。
向量搜索是增强生成系统的首要步骤。通过降维,可以显著降低存储和计算成本。采用Matroyshka表示学习(MRL)可以在不损失准确性的前提下优化检索性能,研究表明512维向量在存储和计算上更具优势,同时保持高准确率。
本文介绍了如何在Redis中定义自定义数据处理和搜索功能,以有效索引特定格式的数据。通过使用查询元数据和自定义搜索方法,用户可以提高检索性能。示例中使用汽车手册的数据,展示了如何利用查询相关性判断(qrels)评估检索模型的效果。
今天发布的jina-embeddings-v4是一个包含38亿参数的通用嵌入模型,支持文本和图像处理,特别在视觉内容检索方面表现优异,超越了主要竞争对手的闭源模型。该模型支持单向量和多向量嵌入,提升了检索性能。
快手与东北大学联合推出UNITE框架,旨在解决多模态检索中的跨模态干扰问题。该框架能够处理文本、图像和视频等多种输入,采用模态感知对比学习机制,显著提升检索性能。在多个评测中,UNITE表现优异,超越现有模型,展现出良好的通用性和综合性能。
本研究指出视觉语言模型在抽象语言处理上的不足,提出了一种无训练的方法——抽象到具体翻译器(ACT),显著提升了文本到图像的检索性能。
本研究提出了一种新框架,优化多向量数据库的索引选择,解决了现有多向量搜索索引的不足。该框架在满足存储和召回限制的同时,延迟减少了2.1到8.3倍,显著提升了检索性能。
FreshStack利用StackExchange数据建立技术文档检索基准,评估复杂技术问答的检索性能,并提出衡量搜索准确性和用户满意度的指标。
本研究提出了一种新的生成式跨模态检索框架SemCORE,解决了现有方法在语义信息方面的不足。通过结构化自然语言标识符和生成语义验证策略,SemCORE提升了语义理解能力,并在多个数据集上显著提高了检索性能。
本文讨论了增强检索生成(RAG)如何通过外部知识源提升大型语言模型(LLM)的响应准确性。RAG系统依赖向量数据库,涉及内容分块、向量化和索引等步骤。分块在数据检索中至关重要,优化了存储和处理效率。文章还分析了常见的分块策略及其对检索性能的影响。
智源发布的BGE-VL模型在多模态检索中表现优异,仅需1/70的数据量即可实现更好的效果。该模型通过MegaPairs合成数据,训练出2600万条样本,显著提升了检索性能,并在多个基准测试中超越传统方法,展现出高效性和可扩展性。
ReTreever是一种基于树的文档检索方法,旨在解决传统高维嵌入编码的内存和计算负担。该方法通过不同粒度组织参考文档,优化检索性能,评估结果显示其在准确度、检索精度和延迟方面表现优异,为实际应用提供了有效解决方案。
本文提出了一种新方法GeAR,解决了传统文档检索中对语义相似度和细粒度语义关系的忽视。GeAR通过融合与解码模块生成相关文本,专注于细粒度信息,且无额外计算负担,展现出优越的检索性能。
本研究提出了一种新的分布一致性引导的多模态哈希(DCGMH)方法,旨在解决多模态哈希中的噪声标签问题。该方法通过识别分布一致性模式,有效过滤和重构噪声标签,从而提升检索性能。实验结果表明,DCGMH在多模态检索任务中优于现有方法。
该研究探讨了双编码器在信息检索中的应用,提出结合双编码器与注意力结构的神经模型,以提高检索精度。同时,介绍了无监督训练的密集感知器和稀疏表达的SPLADE检索器,证明其在效率和效果上的优势。此外,提出了新颖的稀疏技术和学习稀疏检索方法,显著提升了检索性能。
该研究提出了MoTaDual框架,旨在解决复合图像检索中的高成本和零-shot能力不足的问题。通过模态-任务双重对齐,显著提升了检索性能,降低了训练时间和计算成本。实验结果表明,该框架在多个基准测试中表现优异。
本研究提出了一种名为推理调优的方法,旨在改善稠密段落检索中的相关性评分模糊性问题。实验结果表明,该方法能有效提升检索性能,并与现有方法高效结合。
本文提出了一种多语言嵌入框架,通过将图像和文本嵌入到统一的向量空间中,实现高效的图像文本检索。研究表明,稀疏表示和多模态大型语言模型(MLLMs)能够提升检索性能,改善推理速度和准确性,鼓励对MLLMs的进一步研究。
完成下面两步后,将自动完成登录并继续当前操作。