小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文介绍了多个中文基准测试(如CMMLU、ZhuJiu、CIF-Bench等),用于评估大语言模型(LLMs)在自然语言处理中的性能。研究表明,现有LLMs在中文任务的准确性上仍有提升空间,通过这些基准,研究者分析了模型的能力与局限性,推动了中文语言模型的评估与发展。

大型语言模型中的中文知识校正基准测试

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-09T00:00:00Z

本文介绍了预训练语言模型(PLMs)的最新进展,重点讨论了大型语言模型的预训练、适应、调整及评估。研究表明,现有多语言模型在中文任务上的表现不佳,并提出了新的评估基准以提升模型性能,同时探讨了未来的研究方向和挑战。

粤语自然语言处理的潜力:大型语言模型的粤语能力基准

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-29T00:00:00Z

本文介绍了多个针对大型语言模型(LLMs)的评估基准和新模型,包括LOT基准、LongLM模型、CritiqueLLM批判生成模型及ProxyQA框架,旨在提升长文本处理能力和生成质量。同时,研究揭示了中文任务中的评估偏差,并提出了CLongEval基准,分析了多种LLMs的性能,展示了在特定领域的应用和改进潜力。

新语:一种高效的基于大型语言模型的评论生成系统

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-21T00:00:00Z

本文介绍了多个针对大型语言模型(LLMs)的评估基准,如F-Eval、psybench、E-EVAL、MedBench和LHMKE,旨在评估其在法律、心理学、教育和医学等领域的能力。研究发现,尽管一些模型优于基础模型,但在复杂科目上仍存在显著差距,尤其在中文任务处理上亟需改进。

FoundaBench: 评估大型语言模型在中文基础知识能力上的表现

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-04-29T00:00:00Z

该文综述了FollowEval、CFBenchmark、FollowBench、AlignBench、IFEval、ZhuJiu、CELLO、中文法律基准、CMMLU和LongBench等多个大语言模型评估基准,涵盖指令跟随、金融、对齐、法律及长文本理解等维度。结果表明,现有模型在指令遵循、中文任务和长语境理解上仍明显落后于人类,存在较大改进空间。

CIF-Bench:一个用于评估大型语言模型通用性的中文指令遵循基准

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-02-20T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码