小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
一分钟读论文:《Safety Sentry:上下文感知的三向路由Agent安全审查》

上海科技大学的论文《Safety Sentry》提出了一种新的安全审查方法,将二元分类改为三向路由决策(执行、请求确认、拒绝)。该方法通过轻量级guard model实现上下文感知的细粒度审查,能够更好地区分低、中、高风险操作,提高安全性与效率。实验结果表明,该方法在准确率和召回率上优于传统方法,且具有较强的部署灵活性,适应不同风险容忍度需求。

一分钟读论文:《Safety Sentry:上下文感知的三向路由Agent安全审查》

Micropaper
Micropaper · 2026-07-16T00:00:00Z
阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

阿里研究团队在ACL 2026会议上获得最佳资源论文奖,研究揭示了Agent在复杂规则推理中的缺陷,并提出了HSCodeComp基准。测试结果显示,现有Agent的准确率仅为45%,远低于人类专家的95%。研究指出,推理链过长和领域知识不足是主要问题,旨在提升Agent的能力。基于此成果设计的Agent在HSCodeComp测试中的准确率达65%。

阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

量子位
量子位 · 2026-07-08T07:51:26Z
残余上下文扩散语言模型

残余上下文扩散语言模型(RCD)通过回收被丢弃的令牌,提升了扩散大语言模型(dLLMs)的效率。RCD将这些令牌转化为上下文残差,注入下一步去噪中。该方法在多个基准测试中提高了5-10个百分点的准确率,特别是在AIME任务中,准确率几乎翻倍,去噪步骤减少4-5倍。

残余上下文扩散语言模型

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。

模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

实时互动网
实时互动网 · 2026-06-29T09:34:57Z
AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

伊利诺伊大学的研究团队首次量化了AI代理在工具链路被阻断时的规划脆弱性。研究发现,当关键工具失效时,模型的准确率显著下降,GPT-5.4的准确率从51.90%降至11.36%。这表明当前AI代理在复杂任务中存在系统性缺陷,强调了改进工具选择和恢复能力的重要性。建议引入失败感知机制和回溯策略,以提升代理在不确定环境中的表现。

AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

Micropaper
Micropaper · 2026-06-24T00:00:00Z
微调6亿参数Qwen3 4B实现91.6%分类准确率

通过微调6亿参数的小模型Qwen 3 0.6B,家庭问题分类准确率从9.92%提升至91.6%。关键在于让模型学习无意义的代码,降低认知负担,提升分类效果。这一策略适用于特定领域的AI应用。

微调6亿参数Qwen3 4B实现91.6%分类准确率

极道
极道 · 2026-06-22T02:47:00Z
一分钟读论文:《重新思考还是延长预算?面向推理预算的选择性验证》

弗吉尼亚理工大学的研究表明,推理时持续验证初始答案不仅浪费计算资源,还可能降低准确率。他们提出的SEVRA框架通过选择性验证提高了准确率,减少了有害翻转率和Token消耗。研究发现,增加初始推理预算有时更有效,SEVRA在多个基准测试中表现优异,提供了明确的部署指导。

一分钟读论文:《重新思考还是延长预算?面向推理预算的选择性验证》

Micropaper
Micropaper · 2026-06-21T00:00:00Z
【公益译文】2026年AI指数报告(四)

AI模型在编码、数学、金融和法律等领域的能力不断提升。基准测试显示,模型在解决复杂任务方面的表现差异显著,尤其在数学证明和法律推理中仍面临挑战。尽管在某些领域取得进展,整体准确率仍未达到理想水平,反映出专业知识应用的复杂性。

【公益译文】2026年AI指数报告(四)

绿盟科技技术博客
绿盟科技技术博客 · 2026-06-10T09:25:23Z
如何提升AI实时语音技术准确率?

提升AI实时语音技术的准确率包括听清、听懂、答对和闭环迭代四个环节。噪声、方言和语速影响识别,需通过降噪和多场景训练改善。语义理解需追踪上下文,处理指代和意图模糊。回应生成需控制幻觉和确保一致性。持续反馈和优化是关键,未来技术进步将进一步提高准确率。

如何提升AI实时语音技术准确率?

实时互动网
实时互动网 · 2026-06-09T06:52:23Z
论文周报 |微软MAI-Thinking探索纯RL自我进化,AIME准确率达97%;无需架构修改,VLM³凭纯文本坐标实现3D任务泛化...速览一周AI前沿论文

微软 AI 团队提出了「爬山机器」框架,并训练了参数达到 1T 的 MoE 模型 MAI-Thinking-1。该模型通过自适应熵控制的强化学习,在无第三方数据的情况下实现了长期稳定的性能增长,并在多个基准测试中取得领先水平。

论文周报 |微软MAI-Thinking探索纯RL自我进化,AIME准确率达97%;无需架构修改,VLM³凭纯文本坐标实现3D任务泛化...速览一周AI前沿论文

HyperAI超神经
HyperAI超神经 · 2026-06-08T09:19:04Z
深度估计准确率冲上0.9,Meta提出VLM³,论证视觉模型天生会学3D,以Qwen3-VL-4B为基础实现多任务的统一建模

三维空间感知是自动驾驶和机器人领域的核心能力,旨在从二维图像恢复真实世界的空间结构。Meta与普林斯顿大学提出的VLM³框架,基于标准视觉语言模型,统一了物体级三维理解和公制深度估计等任务,显著提升了模型在细粒度三维感知中的表现。研究表明,通用视觉语言模型在三维表征能力上超出预期,为三维视觉领域的统一基础模型提供了新依据。

深度估计准确率冲上0.9,Meta提出VLM³,论证视觉模型天生会学3D,以Qwen3-VL-4B为基础实现多任务的统一建模

HyperAI超神经
HyperAI超神经 · 2026-06-08T08:06:39Z
分析:AI 助手在回答流媒体可用性查询方面表现不一致

一项分析显示,流媒体影片可用性数据的准确率,ChatGPT为43.76%,Claude为50.21%,而Reelgood高达96.89%。大语言模型在处理实时目录时存在结构性缺陷,导致错误信息,包括过时数据和服务混淆等问题。

分析:AI 助手在回答流媒体可用性查询方面表现不一致

实时互动网
实时互动网 · 2026-06-03T03:12:42Z
百度文心发布 PaddleOCR-VL-1.6:准确率突破 96.33%,刷新文档解析 SOTA

百度发布的PaddleOCR-VL-1.6在OmniDocBench v1.6评测中准确率超过96.3%,综合性能全球第一,支持100多种语言,适应复杂文档场景,满足文档数字化需求。该模型已上线官网并开源,供全球开发者使用。

百度文心发布 PaddleOCR-VL-1.6:准确率突破 96.33%,刷新文档解析 SOTA

量子位
量子位 · 2026-06-02T07:47:30Z
大模型不适用于临床管理:对真实世界电子健康记录中结构化查询的评估

西奈山的研究表明,人工智能在医院管理任务中表现不佳,尤其是在处理电子健康记录时。尽管AI能够理解问题,但由于未使用工具计算,导致错误。赋予模型编写代码的能力后,准确率显著提高。研究强调,AI应与传统工具结合使用,以优化医疗系统的性能。

大模型不适用于临床管理:对真实世界电子健康记录中结构化查询的评估

极道
极道 · 2026-05-16T23:15:00Z
Databricks将GPT-5.5引入企业代理工作流

Databricks推出了GPT-5.5,显著提升了复杂企业文档任务的处理能力。与GPT-5.4相比,GPT-5.5在OfficeQA Pro上减少了46%的错误,首次实现超过50%的准确率,尤其在解析扫描PDF和旧文件时表现出色,改善了多步骤任务的协调性。客户可通过AI Unity Gateway使用GPT-5.5,提升定制代理工作流的效率。

Databricks将GPT-5.5引入企业代理工作流

OpenAI
OpenAI · 2026-05-15T00:00:00Z

2023年,大语言模型推动Text-to-SQL技术显著进展,准确率从50%提升至85%以上。文章探讨了DIN-SQL、C3和DAIL-SQL三种方法,强调schema linking、SQL生成和自我校验的重要性。Text-to-SQL不仅是NLP问题,也是数据库接入层的挑战,未来系统将更注重模块化和可复用性。

【数据库研究前沿】Text-to-SQL 与 Agentic Query:DIN-SQL、C3、DAIL-SQL 工程复盘

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-04-27T00:00:00Z

熊猫发现Withings Sleep睡眠监测垫,解决了传统穿戴设备的不便。该垫通过气动传感器监测睡眠,准确率达94.4%,使用简单,无需佩戴和充电,提供全面的睡眠数据,帮助改善睡眠质量。

告别手腕上的束缚!这款这无感监测垫让我实现“裸睡级”睡眠追踪

熊猫不是猫QAQ
熊猫不是猫QAQ · 2026-04-09T05:47:05Z
单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

硅心科技推出的aiX-apply-4B模型在代码变更应用中表现优异,准确率达到93.8%,推理速度提升15倍,且仅需一张显卡即可高效运行,解决了企业算力不足的问题。

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

量子位
量子位 · 2026-03-30T00:41:45Z
溶血性预测准确率提升350%,港中文/浙大/澳门理工等团队提出通用框架Bi-TEAM,融合生物学语义与化学精度

表征学习在生物化学与分子工程中愈发重要,尤其在肽的结构与功能建模方面。香港中文大学提出的Bi-TEAM框架通过整合生物与化学信息,提高了肽设计的准确性和成功率,特别是在细胞穿透性环肽的设计中表现优异,为药物研发提供了新技术路径。

溶血性预测准确率提升350%,港中文/浙大/澳门理工等团队提出通用框架Bi-TEAM,融合生物学语义与化学精度

HyperAI超神经
HyperAI超神经 · 2026-03-11T04:25:56Z

春节期间,我尝试了多款语音输入软件,使用“闪电说”结合流式模型进行转写。尽管输入效率明显提升,但准确率和环境噪音仍是问题,AI的过度加工也影响体验。尽管如此,语音输入在特定情况下仍能提高效率,未来我将继续探索这一工作流。

从打字到动嘴:我的语音输入踩坑与探索

YeungYeah 的乱写地
YeungYeah 的乱写地 · 2026-02-24T07:52:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码