小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本研究探讨大型语言模型(LLMs)在类风湿关节炎(RA)诊断中的应用,发现尽管预测准确率高达95%,但推理过程中的错误率约为68%。这一结果对LLMs在临床实践中的可靠性提出了质疑。

Right Prediction, Wrong Reasoning: Uncovering Inconsistencies of Large Language Models in the Diagnosis of Rheumatoid Arthritis

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-09T00:00:00Z

本研究提出ReAgent框架,解决多跳问答中的推理错误累积问题。通过回溯机制和信息聚合,该系统有效检测并纠正推理错误,性能提升约6%。

ReAgent: Knowledge-Enhanced Reversible Multi-Agent Reasoning for Multi-Hop Question Answering

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-10T00:00:00Z

本文探讨了大型语言模型(LLMs)在数学推理中的应用,提出了新评估方法和技术,显著提升了模型性能。研究发现,LLMs在识别数学误解和推理错误方面存在困难,强调了改进评估范式的重要性,以更准确地评估其认知能力。通过新数据集和基准测试,揭示了模型在实际应用中的局限性,呼吁对推理过程进行严格评估。

并非所有的大型语言模型推理能力都相同

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-02T00:00:00Z

本文探讨大型语言模型(LLMs)在心理学研究中的应用及其认知能力。研究发现,LLMs在文本生成方面表现优异,但在功能语言能力测试中存在局限。通过与人类推理的比较,发现LLMs在某些任务中也会出现类似的推理错误。文章还讨论了LLMs在心理学研究中的潜力及伦理挑战,强调需负责任地使用这些技术。

大型语言模型与认知科学:相似性、差异性及挑战的全面评述

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-04T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码