小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
思瑞浦打造覆盖高精度电压基准产品的完整产品矩阵

(全球TMT 2026年07月21日讯)思瑞浦依托在高性能模拟芯片领域的持续创新,打造覆盖高精度电压基准产品的 […]

思瑞浦打造覆盖高精度电压基准产品的完整产品矩阵

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-21T14:30:58Z
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准

音频语言模型(ALMs)推动语音理解向多任务生成转型。西工大与南京大学等合作提出MSU-Bench评测基准,专注于多说话人对话理解,涵盖16个子任务。研究表明,现有模型在说话人定位和对话推理方面仍存在不足,未来需优化以提升多说话人理解能力。

Interspeech2026 | MSU-Bench:多说话人对话理解评测基准

实时互动网
实时互动网 · 2026-07-14T03:29:29Z
GPT-5.6系列模型的社区反馈、基准表现和使用建议

GPT-5.6系列模型分为Sol、Terra和Luna三种,分别适用于复杂任务、日常工作和批量处理。Sol适合复杂操作但价格较高;Terra性价比高,适合大多数开发者;Luna适合低成本、高吞吐的任务。用户应根据任务复杂度和成本选择合适的模型。

GPT-5.6系列模型的社区反馈、基准表现和使用建议

浮云翩迁之间
浮云翩迁之间 · 2026-07-12T11:42:26Z
企业AI基准存在问题

DevRev推出了首个企业AI代理基准,旨在评估AI系统在实际工作中的表现。该基准关注数据复杂性,强调在不同数据规模下的任务执行效率和准确性。与传统基准不同,DevRev的基准允许组织自行测试,促进社区参与,分为四个级别,涵盖从简单检索到复杂跨域问题解决的任务。

企业AI基准存在问题

The New Stack
The New Stack · 2026-07-09T17:51:08Z
一分钟读论文:《AgentGym2——从理想化基准到真实世界部署的评估范式转移》

构建生产级AI智能体时,传统基准测试无法反映真实环境的挑战。AgentGym2提出去理想化评估,强调端到端执行、工具发现和组合能力。测试显示,GPT-5等模型在真实场景中表现不佳,需关注探索能力和鲁棒性。未来应重视专门训练和多样化基准评估,以提升AI在复杂环境中的表现。

一分钟读论文:《AgentGym2——从理想化基准到真实世界部署的评估范式转移》

Micropaper
Micropaper · 2026-07-08T00:00:00Z
Mayur B.: 我不诚实的基准

该文章介绍了RSS.app,这是一个工具,用户可以通过它从几乎任何网站获取感兴趣的RSS源信息。

Mayur B.: 我不诚实的基准

Planet PostgreSQL
Planet PostgreSQL · 2026-07-07T07:21:02Z

阿里巴巴达摩院提出了“自主策略演化”评估新范式EvoPolicyGym,关注在固定预算内Agent如何迭代改进策略。该方法通过轨迹级诊断框架分析预算分配、反馈转化和策略精炼能力,揭示不同模型的演化模式。实验结果显示GPT-5.5表现优异,强调了Agent从反馈中学习的重要性。

一分钟读论文:《Agent能否从失败中进化——自主策略演化评估基准EvoPolicyGym》

Micropaper
Micropaper · 2026-07-07T00:00:00Z
ICML 2026 Spotlight|快手联合中科院软件所提出业界首个隐喻视频理解基准与方法

在短视频和社交媒体时代,创作者通过隐喻表达深层意涵。快手与科研机构合作,提出隐喻视频理解基准MetaphorVU,以提升多模态大模型的隐喻理解能力。研究发现现有模型在跨域映射上存在不足,导致理解失败。为此,团队开发了MetaphorBoost,通过隐喻知识图谱增强模型理解能力,取得显著提升。这项研究为多模态理解提供了新的评测标准和增强路径。

ICML 2026 Spotlight|快手联合中科院软件所提出业界首个隐喻视频理解基准与方法

实时互动网
实时互动网 · 2026-07-06T07:48:18Z
中国信通院发布AI Infra运维领域首个评测基准

中国信通院发布了AISHPerf人工智能软硬件基准体系3.0版本,包含智算运维智能体和算子生成智能体的评测基准,旨在提升国产芯片的运维能力和标准化。该基准体系基于近百亿条真实运维数据,评估智能体在实际生产环境中的问题解决能力,推动国产算力集群的高效发展。

中国信通院发布AI Infra运维领域首个评测基准

量子位
量子位 · 2026-06-30T07:20:26Z
我们一直在错误地衡量AI;为什么经济价值工作是新的基准

随着AI行业标准化的推进,新的评估工具Agent’s Last Exam(ALE)应运而生,旨在衡量AI代理在真实工作中的表现。该工具基于实际职业任务,评估AI在55种职业中的有效性。研究显示,尽管AI在某些任务上表现出色,但在复杂工作中仍未达到人类水平。Song教授指出,评估AI的经济价值是比较进展的重要方式,但并非唯一标准。

我们一直在错误地衡量AI;为什么经济价值工作是新的基准

The New Stack
The New Stack · 2026-06-15T13:42:33Z
AI 范式雷达:《Agent评估新标准:用A2A+MCP协议实现基准即Agent》

《AgentBeats》论文提出了AAA(Agentified Agent Assessment)范式,通过将基准视为独立的Judge Agent,利用A2A协议和MCP工具实现评估标准化。在五个月的开放竞赛中,该框架成功协调298个Judge Agent对467个Subject Agent的评估,显著降低了集成复杂度,解决了传统评估方法的可扩展性和可复现性问题。

AI 范式雷达:《Agent评估新标准:用A2A+MCP协议实现基准即Agent》

Micropaper
Micropaper · 2026-06-13T00:00:00Z
教育直播SDK具备哪些功能?从能力清单看选型基准

选择教育直播SDK时,应关注功能的实际表现而非数量。功能可分为四层:音视频基础能力、教学交互工具、课堂管理与控制、云端配套服务。评估时需重视音视频质量、互动体验和质量监控,以确保SDK在真实教学场景中的有效性。

教育直播SDK具备哪些功能?从能力清单看选型基准

实时互动网
实时互动网 · 2026-06-10T10:07:41Z
谷歌Gemma 4 12B的性能几乎与26B基准相当——并可在您的笔记本电脑上运行

谷歌推出了Gemma 4 12B模型,旨在为标准笔记本电脑提供高性能的多模态智能。该模型内存占用比Gemma 4 26B小一半,但性能接近,支持本地运行,适合开发者使用。其统一架构可直接处理音频和图像输入,减少延迟和内存使用,吸引了开发者的关注。

谷歌Gemma 4 12B的性能几乎与26B基准相当——并可在您的笔记本电脑上运行

The New Stack
The New Stack · 2026-06-04T19:30:19Z

Kaggle Benchmarks推出本地开发功能,允许开发者在本地环境中创建和验证评估任务。该功能支持使用AI编码代理通过自然语言构建任务,旨在加速AI模型的评估和改进,推动可信赖的AI评估民主化。

Kaggle 使 AI 基准创建变得轻而易举

The Keyword
The Keyword · 2026-06-04T16:00:00Z
MySQL 9.7.0 PGO基准分析

本文讨论了MySQL的Profile-Guided Optimization(PGO)技术,强调其在性能上的显著提升。PGO通过运行时分析优化代码,使CPU更高效地执行MySQL的热代码路径,从而提高每秒处理事务的能力。测试结果显示,PGO在不同线程数下带来了0.5%到14.3%的性能提升,尤其在低并发情况下效果显著。

MySQL 9.7.0 PGO基准分析

Planet MySQL
Planet MySQL · 2026-05-22T07:33:49Z
腾讯开源 Hy-MT1.5 翻译模型:440MB 跑出顶级翻译能力;MIT 联合发布 MathNet:涵盖 2.7 万道奥数真题的多模态数学推理基准

腾讯推出的轻量级机器翻译模型Hy-MT1.5-1.8B-1.25bit,支持33种语言和1056个翻译方向,翻译效果超越部分大型开源模型。该模型参数仅18亿,用户可在线体验并访问HyperAI官网获取更多资源。

腾讯开源 Hy-MT1.5 翻译模型:440MB 跑出顶级翻译能力;MIT 联合发布 MathNet:涵盖 2.7 万道奥数真题的多模态数学推理基准

HyperAI超神经
HyperAI超神经 · 2026-05-18T04:28:41Z
大语言模型速度基准:指标与基础设施指南

本文讨论了大语言模型(LLM)推理速度的关键指标及其对用户体验的影响,强调选择合适模型和优化指标的重要性。介绍了TTFT、TTFAT、输出速度等六个性能指标,并提到语义缓存技术可以减少推理瓶颈,提高响应速度和降低成本。Redis作为实时数据平台,支持语义缓存和向量搜索,适合构建高效的GenAI应用。

大语言模型速度基准:指标与基础设施指南

Redis Blog
Redis Blog · 2026-05-10T00:00:00Z
谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案

谷歌DeepMind推出的「AI联合数学家」成功解决了Kourovka Notebook第21.10号问题,标志着数学研究的新突破。该系统通过人机协作,提升了解决数学难题的效率,强调持续互动与反馈,记录失败假设,帮助数学家更好地研究。在FrontierMath基准测试中,该系统取得了48%的准确率,超越了其他AI模型,展示了AI与数学家合作的潜力。

谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案

量子位
量子位 · 2026-05-09T07:12:48Z
从事物的位置到它们的用途:多模态大语言模型的空间–功能智能基准评估

本文介绍了空间功能智能基准(SFI-Bench),用于评估多模态大语言模型的高级推理能力。SFI-Bench包含1700多个基于视频的问题,重点评估结构化空间推理和功能推理。实验结果显示,现有模型在整合空间记忆与功能知识方面存在瓶颈,强调了提升多模态智能代理的必要性。

从事物的位置到它们的用途:多模态大语言模型的空间–功能智能基准评估

Apple Machine Learning Research
Apple Machine Learning Research · 2026-05-06T00:00:00Z
提高`nvptx64-nvidia-cuda`目标的基准

Rust 1.97将于2026年7月9日发布,更新nvptx64-nvidia-cuda目标的PTX ISA版本,移除对2017年及之前GPU架构的支持。这将提升编译器的正确性和性能,但不再支持旧版CUDA驱动或低于7.0的GPU。

提高`nvptx64-nvidia-cuda`目标的基准

Rust Blog
Rust Blog · 2026-05-01T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码