小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Speechmatics 与 LiveKit 瞄准语音智能体落地生产的准确率短板

Speechmatics 的 Linden 模型现可通过 LiveKit Inference 平台使用,开发者无需额外申请密钥即可快速切换。Linden 支持 55 种以上语言,擅长处理浓重口音、嘈杂环境和字母数字识别,提升语音智能体在真实场景中的转写准确性。boost.ai 已将其投入生产,LiveKit 提供统一 API 和计费,简化开发流程。

Speechmatics 与 LiveKit 瞄准语音智能体落地生产的准确率短板

实时互动网 实时互动网 · 2026-08-28T06:33:56Z
谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力

谷歌发布Gemini 3.5 Transcribe语音转文本模型,提升实时转写准确率、降低延迟,支持85种语言,自动去除口头语并修正表达,可区分说话者。流式转写延迟低于1秒,错误率低至2.6%。已通过Gemini API公开预览,未来支持Chrome浏览器。

谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力

蓝点网 蓝点网 · 2026-08-27T03:16:33Z
Databricks文档智能:推动复杂文档提取的前沿

Databricks推出AI Extract的Precision Mode,结合定制模型与智能代理,解决长文档、复杂模式提取难题。在约9000份文档测试中,准确率达94.7%,超越GPT-5.6 Sol等前沿模型7个百分点,适用于金融、医疗等领域,现已开放使用。

Databricks文档智能:推动复杂文档提取的前沿

Databricks Databricks · 2026-08-18T22:00:00Z
2026年提升RAG准确率的顶级重排序模型

本文介绍RAG流水线中的重排序(reranking)层,旨在解决检索结果中相关文档排名靠后的问题。文章比较了交叉编码器、双编码器和LLM重排序器三种模型类型,强调选择需权衡延迟、成本和语言覆盖。生产实践中,建议采用混合检索提升召回率,并注意校准阈值、控制成本,Redis Iris可集成这些功能以优化性能。

2026年提升RAG准确率的顶级重排序模型

Redis Blog Redis Blog · 2026-07-26T00:00:00Z
为什么前沿数据代理在质量和成本上优于通用编码代理

Databricks团队在401个真实任务上评估了Genie Code与三款主流编码代理,结果显示Genie Code准确率最高(76.6%),成本最低(每任务0.55美元),约为竞争对手一半。其优势在于通过语义搜索和持久记忆高效定位数据,平均仅需8.3次工具调用,避免了低效探索。研究挑战了“更高成本带来更高准确性”的传统观念,强调数据代理需适应动态环境。

为什么前沿数据代理在质量和成本上优于通用编码代理

Databricks Databricks · 2026-07-23T15:33:58Z
SFT战略定方向RL战术搞创新,3B模型靠平衡干翻闭源巨无霸

2026年,开源小模型通过平衡强化学习(RL)与监督微调(SFT),可超越闭源大模型。SFT提供战略方向,RL负责战术创新,两者失衡会导致模型僵化或混乱。GRPO、RULER、ART等工具优化平衡,使3B模型准确率从62%升至89%,突破纯SFT的72%上限,实现高效进化。

SFT战略定方向RL战术搞创新,3B模型靠平衡干翻闭源巨无霸

极道 极道 · 2026-07-23T00:24:00Z
【技术前沿】音视频开发者如何看待英伟达推出合成视频检测器NIM?

英伟达推出合成视频检测器NIM,宣称可逐帧检测AI生成视频,准确率最高92%。但实际应用中面临平台压缩、局部修改、转场剪辑及不同生成模型等挑战,检测准确率可能受影响。作者认为该工具是网络防御的重要进展,但需实际验证,建议将其作为人工核验的辅助信号,而非直接判定依据。

【技术前沿】音视频开发者如何看待英伟达推出合成视频检测器NIM?

实时互动网 实时互动网 · 2026-07-22T02:20:14Z
🔍 别让大模型"想太多":SKILL开发中的语义陷阱与抗幻觉设计

大模型Skill开发中,核心术语选择影响巨大:用“漏洞”准确率89.3%,用“风险”仅62.1%。原因是“风险”语义宽泛,触发模型发散性输出,突破约束。构建高质量Skill需结构化工作流、校验循环、定义文件和定制工具。应选窄边界词,用否定清单、硬输出格式锚定边界,并可用语义陷阱检测器自动化排查。

🔍 别让大模型"想太多":SKILL开发中的语义陷阱与抗幻觉设计

像清水一般清澈透明 像清水一般清澈透明 · 2026-07-18T08:05:58Z
一分钟读论文:《Safety Sentry:上下文感知的三向路由Agent安全审查》

上海科技大学的论文《Safety Sentry》提出了一种新的安全审查方法,将二元分类改为三向路由决策(执行、请求确认、拒绝)。该方法通过轻量级guard model实现上下文感知的细粒度审查,能够更好地区分低、中、高风险操作,提高安全性与效率。实验结果表明,该方法在准确率和召回率上优于传统方法,且具有较强的部署灵活性,适应不同风险容忍度需求。

一分钟读论文:《Safety Sentry:上下文感知的三向路由Agent安全审查》

Micropaper Micropaper · 2026-07-16T00:00:00Z
阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

阿里研究团队在ACL 2026会议上获得最佳资源论文奖,研究揭示了Agent在复杂规则推理中的缺陷,并提出了HSCodeComp基准。测试结果显示,现有Agent的准确率仅为45%,远低于人类专家的95%。研究指出,推理链过长和领域知识不足是主要问题,旨在提升Agent的能力。基于此成果设计的Agent在HSCodeComp测试中的准确率达65%。

阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

量子位 量子位 · 2026-07-08T07:51:26Z
残余上下文扩散语言模型

残余上下文扩散语言模型(RCD)通过回收被丢弃的令牌,提升了扩散大语言模型(dLLMs)的效率。RCD将这些令牌转化为上下文残差,注入下一步去噪中。该方法在多个基准测试中提高了5-10个百分点的准确率,特别是在AIME任务中,准确率几乎翻倍,去噪步骤减少4-5倍。

残余上下文扩散语言模型

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-02T00:00:00Z
模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。

模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

实时互动网 实时互动网 · 2026-06-29T09:34:57Z
AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

伊利诺伊大学的研究团队首次量化了AI代理在工具链路被阻断时的规划脆弱性。研究发现,当关键工具失效时,模型的准确率显著下降,GPT-5.4的准确率从51.90%降至11.36%。这表明当前AI代理在复杂任务中存在系统性缺陷,强调了改进工具选择和恢复能力的重要性。建议引入失败感知机制和回溯策略,以提升代理在不确定环境中的表现。

AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

Micropaper Micropaper · 2026-06-24T00:00:00Z
微调6亿参数Qwen3 4B实现91.6%分类准确率

通过微调6亿参数的小模型Qwen 3 0.6B,家庭问题分类准确率从9.92%提升至91.6%。关键在于让模型学习无意义的代码,降低认知负担,提升分类效果。这一策略适用于特定领域的AI应用。

微调6亿参数Qwen3 4B实现91.6%分类准确率

极道 极道 · 2026-06-22T02:47:00Z
一分钟读论文:《重新思考还是延长预算?面向推理预算的选择性验证》

弗吉尼亚理工大学的研究表明,推理时持续验证初始答案不仅浪费计算资源,还可能降低准确率。他们提出的SEVRA框架通过选择性验证提高了准确率,减少了有害翻转率和Token消耗。研究发现,增加初始推理预算有时更有效,SEVRA在多个基准测试中表现优异,提供了明确的部署指导。

一分钟读论文:《重新思考还是延长预算?面向推理预算的选择性验证》

Micropaper Micropaper · 2026-06-21T00:00:00Z
【公益译文】2026年AI指数报告(四)

AI模型在编码、数学、金融和法律等领域的能力不断提升。基准测试显示,模型在解决复杂任务方面的表现差异显著,尤其在数学证明和法律推理中仍面临挑战。尽管在某些领域取得进展,整体准确率仍未达到理想水平,反映出专业知识应用的复杂性。

【公益译文】2026年AI指数报告(四)

绿盟科技技术博客 绿盟科技技术博客 · 2026-06-10T09:25:23Z
如何提升AI实时语音技术准确率?

提升AI实时语音技术的准确率包括听清、听懂、答对和闭环迭代四个环节。噪声、方言和语速影响识别,需通过降噪和多场景训练改善。语义理解需追踪上下文,处理指代和意图模糊。回应生成需控制幻觉和确保一致性。持续反馈和优化是关键,未来技术进步将进一步提高准确率。

如何提升AI实时语音技术准确率?

实时互动网 实时互动网 · 2026-06-09T06:52:23Z
论文周报 |微软MAI-Thinking探索纯RL自我进化,AIME准确率达97%;无需架构修改,VLM³凭纯文本坐标实现3D任务泛化...速览一周AI前沿论文

微软 AI 团队提出了「爬山机器」框架,并训练了参数达到 1T 的 MoE 模型 MAI-Thinking-1。该模型通过自适应熵控制的强化学习,在无第三方数据的情况下实现了长期稳定的性能增长,并在多个基准测试中取得领先水平。

论文周报 |微软MAI-Thinking探索纯RL自我进化,AIME准确率达97%;无需架构修改,VLM³凭纯文本坐标实现3D任务泛化...速览一周AI前沿论文

HyperAI超神经 HyperAI超神经 · 2026-06-08T09:19:04Z
深度估计准确率冲上0.9,Meta提出VLM³,论证视觉模型天生会学3D,以Qwen3-VL-4B为基础实现多任务的统一建模

三维空间感知是自动驾驶和机器人领域的核心能力,旨在从二维图像恢复真实世界的空间结构。Meta与普林斯顿大学提出的VLM³框架,基于标准视觉语言模型,统一了物体级三维理解和公制深度估计等任务,显著提升了模型在细粒度三维感知中的表现。研究表明,通用视觉语言模型在三维表征能力上超出预期,为三维视觉领域的统一基础模型提供了新依据。

深度估计准确率冲上0.9,Meta提出VLM³,论证视觉模型天生会学3D,以Qwen3-VL-4B为基础实现多任务的统一建模

HyperAI超神经 HyperAI超神经 · 2026-06-08T08:06:39Z
分析:AI 助手在回答流媒体可用性查询方面表现不一致

一项分析显示,流媒体影片可用性数据的准确率,ChatGPT为43.76%,Claude为50.21%,而Reelgood高达96.89%。大语言模型在处理实时目录时存在结构性缺陷,导致错误信息,包括过时数据和服务混淆等问题。

分析:AI 助手在回答流媒体可用性查询方面表现不一致

实时互动网 实时互动网 · 2026-06-03T03:12:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码