小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DiscoSign:话语感知的文本到手语注解翻译

DiscoSign提出话语感知的文本到手语注解翻译框架,基于大语言模型处理空间指代、问答从句和概念注解一致性,并引入新评估指标。实验表明,该方法提升空间一致性与实体追踪,同时保持单句翻译质量,首次建立话语级手语翻译与评估体系。

DiscoSign:话语感知的文本到手语注解翻译

Apple Machine Learning Research Apple Machine Learning Research · 2026-09-11T00:00:00Z
调整Qdrant集合前需检查的事项

调整Qdrant集合前,需明确检索目标(如排名、延迟或内存),并确保向量和负载索引正确。检查稀疏向量IDF修饰符和BM25平均长度等设置,避免无效结果。根据症状选择调整方向,如混合搜索或重排序。使用带标签的查询集和合适指标(如nDCG@10)评估,确保标签能检测改进,并在新查询上验证结果。

调整Qdrant集合前需检查的事项

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-19T21:00:00Z
如何清理Qdrant集合

Qdrant向量集合增长会暴露重复、过期数据等问题,导致检索结果质量下降。通过去重、混合搜索优化和添加时效性过滤,可提升答案正确率。评估需结合多个指标,并检查数据源完整性,避免单一指标掩盖问题。

如何清理Qdrant集合

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-10T00:00:00Z
基于Qdrant构建电商搜索的经验教训

构建电商搜索时,混合检索(密集向量+BM25)优于单一方法;过滤应在查询内进行,避免结果稀疏。嵌入文本比模型大小更关键,量化内存可省去重排序。个性化应作用于排序而非检索,商品运营用权重调整。评估需多指标互补,注意分片融合陷阱。

基于Qdrant构建电商搜索的经验教训

Qdrant - Vector Database Qdrant - Vector Database · 2026-07-24T00:00:00Z
视频问诊的核心功能模块有哪些

视频问诊系统由实时音视频通话、患者端、医生端、管理后台和合规安全五个核心模块组成。各模块职责不同但相互关联,评估时需关注延迟、弱网抗性、流程顺畅度、信息聚合、数据统计及合规实现,而非仅功能列表。

视频问诊的核心功能模块有哪些

实时互动网 实时互动网 · 2026-07-21T08:19:01Z
基于评估指标的标签分布学习中的标注饱和度

本文探讨了标注者在标签分布上的分歧对模型学习的影响。研究发现,评估指标的不同导致所需标注者数量差异:熵相关性需要约20-50名标注者,而分布匹配在约10名标注者时即可饱和。软标签在识别模糊与清晰项目方面优于标签平滑,建议根据目标评估指标调整标注预算。

基于评估指标的标签分布学习中的标注饱和度

Apple Machine Learning Research Apple Machine Learning Research · 2026-06-23T00:00:00Z
大型语言模型评估与AI代理监控的可观测性

人工智能,尤其是大型语言模型(LLM)的快速发展,推动了多代理系统在现代组织中的应用,以提升适应性和效率。评估LLM及监控AI代理的能力至关重要,确保其在实际应用中的可靠性。评估指标如幻觉率和毒性评分,有助于识别模型的优缺点。有效的监控和评估能够提升AI代理的性能,确保其在复杂环境中的稳定运行。

大型语言模型评估与AI代理监控的可观测性

The JetBrains Blog The JetBrains Blog · 2026-05-19T09:46:54Z
超越准确性:人工智能代理真正重要的五个指标

本文讨论了评估人工智能代理的五个重要指标,超越传统的准确性。这些指标包括任务完成率、工具选择准确性、自主评分、恢复率和每个成功任务的成本,旨在衡量代理的推理能力、可靠性和效率,尤其在金融和医疗等高风险领域具有重要意义。

超越准确性:人工智能代理真正重要的五个指标

MachineLearningMastery.com MachineLearningMastery.com · 2026-02-23T11:00:24Z
为什么大多数人错误使用SMOTE,以及如何正确使用它

SMOTE是一种解决机器学习类别不平衡问题的数据增强技术,通过在少数类样本间插值生成合成样本,帮助平衡数据集。使用时需先划分训练和测试集,以防数据泄漏。常见误用包括过度平衡和忽视评估指标的上下文。

为什么大多数人错误使用SMOTE,以及如何正确使用它

KDnuggets KDnuggets · 2026-02-11T16:21:32Z
Better Agents - 一个帮助用户评估、比较和改进AI代理的开源项目…

Better Agents是一个开源项目,旨在帮助开发者评估和比较AI代理框架。它提供多维评估指标、最佳实践和改进建议,助力工程团队在不同代理实现间做出权衡,加速构建可靠的自动化代理系统。

Better Agents - 一个帮助用户评估、比较和改进AI代理的开源项目…

云原生 云原生 · 2025-12-01T01:47:32Z
评估基于 LLM 的语音助手:超越传统指标的指南

语音助手已从简单规则系统发展为基于大语言模型的高级对话代理,具备长时对话和复杂指令执行能力。传统评估指标无法全面反映其质量,需建立新指标体系,关注事实准确性、安全性和用户体验。HHH原则强调助手应提供实用、诚实和无害的帮助,评估方法需结合人工判断与自动化工具,以确保助手的可信度和实用性。

评估基于 LLM 的语音助手:超越传统指标的指南

实时互动网 实时互动网 · 2025-11-04T06:26:01Z
评估评估指标——幻觉检测的幻影

本文探讨了语言模型中的幻觉检测评估指标,指出现有指标与人类判断不一致,且在参数扩展时表现不稳定。通过对6种幻觉检测指标的实证评估,发现LLM(如GPT-4)在评估中表现最佳,模式寻求解码方法能有效减少幻觉。这强调了需要更强大的指标和策略来理解和减轻幻觉问题。

评估评估指标——幻觉检测的幻影

Apple Machine Learning Research Apple Machine Learning Research · 2025-10-27T00:00:00Z
RAG 简要回顾

RAG(检索增强生成)技术在2025年广泛应用,主要包括离线文件解析、文本切片和嵌入优化。通过语义和结构切分提升文本处理效率,并在查询处理时生成多维嵌入。评估指标包括召回率、响应时间和用户满意度。Graph RAG解决全局和多跳问题,但构建图谱复杂,依赖于大型语言模型(LLM)能力。Agentic RAG允许多次检索,提升灵活性和可扩展性。

RAG 简要回顾

Measure Zero Measure Zero · 2025-10-07T00:00:00Z
模型选择对决:选择最佳模型的六个考虑因素

选择最佳机器学习模型时,应明确目标、建立基线、选择合适的评估指标,并使用交叉验证。需平衡模型复杂性与可解释性,并在真实数据上测试模型,以应对实际应用中的挑战。最终选择应与特定问题和数据相匹配。

模型选择对决:选择最佳模型的六个考虑因素

MachineLearningMastery.com MachineLearningMastery.com · 2025-09-30T14:05:15Z
用于AI系统性能评估的大型语言模型框架

AI系统开发面临的挑战是确保其发布后持续良好表现。Microsoft.Extensions.AI.Evaluation是一个开源库,帮助收集和比较AI系统的评估指标,如一致性、流畅性和完整性。通过C#代码与OpenAI交互,评估聊天完成度,以优化系统性能。

用于AI系统性能评估的大型语言模型框架

DEV Community DEV Community · 2025-05-27T22:19:26Z
自然语言处理评估指标

ROUGE和BLEU是文本生成评估指标。ROUGE侧重于召回率,比较生成文本与参考文本的词汇重叠,适合用于摘要;而BLEU则关注精确度,评估生成文本与参考文本的匹配程度。BERTScore通过语义相似性评估文本,强调词义而非字面匹配。

自然语言处理评估指标

DEV Community DEV Community · 2025-05-24T03:28:37Z

本研究探讨了大语言模型在非英语环境中的应用挑战,识别了多语言工作流中的整合问题。分析指出现代神经评估指标在区分有意义评论与噪声方面的不足,并提出了26种错误类别,揭示了不同语言在连贯性、信息量和语法遵从性上的差异。

A Qualitative Study on LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究提出了两种新评估指标LCP和ROUGE-LCP,以缩小代码补全评估与用户感知之间的差距。同时,提出了一种基于结构和语义重排的代码图数据处理方法,显著提高了用户感知一致性和模型性能。

Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large Language Model Code Completion

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-19T00:00:00Z
大型语言模型是否有英语口音?评估和改善多语言大型语言模型的自然性

当前大型语言模型主要以英语为主,导致多语言输出不自然。本文提出新的自动化语料库评估指标,评估多语言环境下LLM输出的自然性,并在法语和中文中进行测试,发现英语影响的模式。为改善这一问题,提出了一种简单有效的对齐方法,提升目标语言的自然性,同时不影响通用基准的表现。

大型语言模型是否有英语口音?评估和改善多语言大型语言模型的自然性

Apple Machine Learning Research Apple Machine Learning Research · 2025-05-16T00:00:00Z

本研究提出了一种结合关键数据嵌入的混合生成语义通信系统,解决了视觉细节缺失和评估指标不足的问题。通过语义过滤选择相关图像特征,并引入生成视觉信息保真度(GVIF)指标,实验结果表明该系统在视觉保真度上优于现有方案。

Visual Fidelity Index and Critical Data Embedding in Generative Semantic Communications

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-15T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码