小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
在代理式RAG中建立信任始于证据

Agentic RAG通过代理重写查询、选择数据源和搜索方式,提升检索覆盖率,但需记录决策链以建立信任。系统应保留查询、来源、拒绝原因等痕迹,验证引用支持,并实施范围过滤和权限控制。检索内容视为数据而非策略,需定期评估,确保准确性和合规性。

在代理式RAG中建立信任始于证据

The New Stack The New Stack · 2026-09-05T15:00:00Z
语言模型中管理小上下文窗口的策略

本文介绍管理大语言模型小上下文窗口的三种实用策略:滑动窗口截断法,通过FIFO队列保留最近对话,控制token使用;令牌预算结合检索增强生成,按比例分配上下文空间,确保只纳入最相关信息;以及滚动摘要、提示压缩和观察掩蔽等进阶方法。文章强调小上下文窗口能降低成本、减少延迟,并避免“迷失在中间”问题。

语言模型中管理小上下文窗口的策略

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-18T12:00:20Z

该论文评估了不同检索增强生成范式在企业级语料规模扩展下的性能。实验发现,当语料超过约1000万token时,BM25检索器优于密集向量检索和文件系统代理。文件代理在小规模下表现略好,但随着规模增大,因候选发现能力不足而失效。结合BM25候选发现的Agent方法效果最佳。图RAG方法因建库成本过高或准确率低而失败。结论是BM25负责全局候选排序,Agent负责在缩小后的范围内推理。

读论文 - BM25 Wins at Scale

Measure Zero Measure Zero · 2026-08-05T00:00:00Z
RAG还活着吗?向量数据库在向量搜索中的作用 | Qdrant

文章讨论了向量数据库在人工智能中的重要性,尤其是在检索增强生成(RAG)中的应用。尽管大型语言模型(LLM)如Google的Gemini 1.5提供了更大的上下文窗口,但依赖上下文并不总是有效且成本高昂。向量搜索提供更高的精度和效率,能够实时获取最新信息,适合企业使用。Qdrant的向量数据库在成本和性能上具有显著优势,帮助企业优化AI系统的运行。

RAG还活着吗?向量数据库在向量搜索中的作用 | Qdrant

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-04T00:00:00Z
什么是HyDE?如何利用假设性文档改进RAG

RAG通过外部知识库检索辅助大语言模型回答,但用户提问与文档表述差异大时,直接嵌入查询效果不佳。HyDE技术先用LLM生成假设性文档,再嵌入该文档而非原始查询进行检索,使向量比较从“问题对答案”变为“答案对答案”,提升检索质量。文章还介绍了HyDE的实现、防幻觉机制及生产环境中的超时、PII保护等保障措施。

什么是HyDE?如何利用假设性文档改进RAG

freeCodeCamp.org freeCodeCamp.org · 2026-07-22T21:32:17Z
RAG调试指南:快速减少检索错误的方法

本文介绍了生产环境中RAG(检索增强生成)系统的五大常见故障类型:检索缺失、排序不当、模型忽略证据、数据新鲜度不足及延迟问题。文章详细分析了每种故障的症状、根因及诊断方法,并建议通过分步排查定位问题。最后,推荐使用Redis Iris平台,整合向量搜索、缓存和记忆功能,以简化架构并提升RAG系统的实时性和可靠性。

RAG调试指南:快速减少检索错误的方法

Redis Blog Redis Blog · 2026-07-21T00:00:00Z
CLaRa:通过连续潜在推理连接检索与生成

CLaRa(连续潜在推理)是一种通过嵌入式压缩和联合优化提升检索增强生成(RAG)模型性能的统一框架。它采用基于问答和释义监督的SCP框架,生成语义丰富的压缩向量,从而减少输入生成器的文档长度。CLaRa通过单一语言建模损失进行端到端训练,实验结果表明其在多个问答基准上表现优异,达到了先进的压缩和重排序性能。

CLaRa:通过连续潜在推理连接检索与生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-15T00:00:00Z

本文介绍了大语言模型(LLMs)的预训练和微调概念。预训练通过大量数据学习语言基础,而微调则是在此基础上针对特定任务进行适应。微调分为完全微调和参数高效微调(PEFT),后者更节省内存且风险较低。尽管微调有效,但并非唯一解决方案,改进提示或检索增强生成(RAG)有时更为合适。

微调入门解析(预训练模型如何学习新技能)

KDnuggets KDnuggets · 2026-07-10T14:00:32Z

检索增强生成(RAG)在与大型语言模型结合时存在检索无关和上下文污染等失败模式。常见的修复方法往往过度工程化,导致成本上升和准确性下降。可考虑使用长上下文提示、摘要检索、结构化检索和图形推理等替代方案,根据查询类型选择合适的架构,以提高准确性并降低成本。

你的RAG管道可能毫无用处。这里有一个更好的替代方案

KDnuggets KDnuggets · 2026-06-29T14:00:50Z
使用Telnyx AI推理构建简单的检索增强生成(RAG)应用

本文介绍了如何使用Telnyx AI推理构建简单的检索增强生成(RAG)应用。核心流程包括存储文档、嵌入用户问题、查找相关文档并返回答案。示例应用使用Flask API,能够处理用户提问并返回基于文档的答案,适用于支持助手和内部文档搜索等场景。

使用Telnyx AI推理构建简单的检索增强生成(RAG)应用

mongona news mongona news · 2026-06-26T22:11:23Z
如何应对RAG系统中的小上下文窗口限制

检索增强生成(RAG)是一种通过检索相关材料并将其整合到模型提示中以提升回答质量的方法。文章探讨了RAG在小上下文窗口下的局限性,并提出通过文档摘要、块摘要和原始块的层次化索引来优化检索过程的解决方案。关键在于使用摘要进行检索,使用原始块进行回答,并通过上下文预算管理信息量,从而在资源有限的情况下提高RAG系统的可靠性和可调试性。

如何应对RAG系统中的小上下文窗口限制

freeCodeCamp.org freeCodeCamp.org · 2026-06-18T00:09:31Z

本文介绍了五篇关于大型语言模型(LLMs)的重要论文,涵盖其核心概念和技术。首先是“Attention Is All You Need”,提出了Transformer架构,强调自注意力机制。其次是GPT-3论文,展示了通过提示进行少量学习的能力。接着探讨了模型规模与性能的关系,分析大型模型为何更有效。然后是InstructGPT,讲述如何通过人类反馈优化模型以更好地遵循指令。最后介绍了检索增强生成(RAG),使模型能从外部获取信息以提高回答质量。这些论文为理解现代LLMs提供了基础。

五篇清晰解释大型语言模型的有趣论文

KDnuggets KDnuggets · 2026-06-03T12:00:14Z
上下文图:当最近邻搜索不足时

本文讨论了在检索增强生成(RAG)管道中,向量检索与上下文图的结合使用。向量检索在简单问题上表现良好,但在复杂问题上不足。上下文图通过结构化知识为实体和关系,能更有效地连接相关信息。双通道检索架构结合了两者的优点,提高了检索的准确性和效率。Redis提供了支持这一架构的工具,适用于构建上下文感知的AI基础设施。

上下文图:当最近邻搜索不足时

Redis Blog Redis Blog · 2026-05-31T00:00:00Z
简单易懂的RAG解析与实际项目

RAG(检索增强生成)是一种架构,解决了传统大型语言模型无法访问私有数据的问题。它通过从数据库中检索相关信息来增强用户问题,并生成基于这些信息的答案。RAG的工作流程包括文档分块、嵌入、向量数据库和提示增强,确保AI能准确回答用户问题。理解RAG对软件工程师至关重要,因为现代企业软件几乎都涉及这一技术。

简单易懂的RAG解析与实际项目

freeCodeCamp.org freeCodeCamp.org · 2026-05-28T16:17:22Z
代理检索技术:完整指南

文章讨论了“代理检索”的概念,强调其与传统检索增强生成(RAG)的不同。代理检索允许智能代理动态控制检索过程,通过迭代查询获取更准确的信息。Redis Iris被介绍为支持这一过程的上下文引擎,提供快速、实时的数据检索和缓存,确保代理在决策时拥有最新的上下文信息。

代理检索技术:完整指南

Redis Blog Redis Blog · 2026-05-23T00:00:00Z
Antony Pegg:从托管PostgreSQL到生产RAG:在pgEdge云中构建您自己的Ellie

pgEdge推出的RAG服务器可实现24x7监控和管理Postgres数据库,支持检索增强生成。用户通过API发送查询,系统结合向量相似性和BM25关键词匹配,提供准确答案。RAG服务器可作为托管服务部署,支持多种嵌入和完成提供商,简化文档检索和管理流程,适用于合规和客户支持需求。

Antony Pegg:从托管PostgreSQL到生产RAG:在pgEdge云中构建您自己的Ellie

Planet PostgreSQL Planet PostgreSQL · 2026-05-21T12:27:22Z

谷歌扩展了Gemini API的文件搜索工具,支持多模态数据和自定义元数据,提升了检索增强生成系统的能力。新功能包括图像与文本的联合处理和页面引用,帮助用户更准确地找到信息并验证来源,使应用程序在处理大量数据时更高效、可靠。

Gemini API 文件搜索现已支持多模态:构建高效、可验证的检索增强生成系统

The Keyword The Keyword · 2026-05-05T18:00:00Z
RAG重排序解析:更好的上下文,更好的答案

RAG重排序是提升检索增强生成系统准确性和可靠性的关键。通过重新排序检索到的文档,确保语言模型获得相关信息,减少错误回答。重排序通过评估文档与用户查询的匹配度来优化结果。结合双编码器和交叉编码器的混合方法可以提高效率和准确性。Meilisearch是构建RAG系统的理想工具,提供快速检索和高质量结果。

RAG重排序解析:更好的上下文,更好的答案

meilisearch blog meilisearch blog · 2026-05-05T00:00:00Z
一文吃透Ollama Embeddings:概念、实操、避坑,助力RAG落地|本地部署AI大模型必备

本文介绍了Ollama中的嵌入向量及其在检索增强生成中的应用。嵌入向量将文本转换为数值数组,以便计算语义相似度。文章探讨了嵌入向量的生成方法、应用场景(如搜索引擎、去重、推荐系统)以及常见问题和解决方案,帮助新手理解和应用该技术。

一文吃透Ollama Embeddings:概念、实操、避坑,助力RAG落地|本地部署AI大模型必备

人言兑 人言兑 · 2026-04-24T10:40:15Z
五种高效的长上下文检索增强生成技术

本文介绍了五种高效的长上下文检索增强生成(RAG)技术,旨在解决注意力限制和成本挑战。这些技术包括通过重新排序解决“中间丢失”问题、利用上下文缓存减少延迟和计算成本,以及结合元数据过滤和查询扩展提高相关性,从而构建可扩展且精准的RAG系统,确保模型关注最相关的信息。

五种高效的长上下文检索增强生成技术

MachineLearningMastery.com MachineLearningMastery.com · 2026-04-15T12:00:40Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码