小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
它通过了CI,也通过了你的评估。客户拿到的却仍是错误答案。

AI功能存在可观测性缺口:传统服务故障明显,AI代理却会静默返回错误答案。以支持代理为例,通过分布式追踪可定位问题——检索时版本过滤为空导致返回旧版文档,而忠实度评估无法发现。建议用确定性测试断言检索约束,用模型评估答案质量,并保留提示、模型、检索配置等上下文,将评估结果链接回追踪。

它通过了CI,也通过了你的评估。客户拿到的却仍是错误答案。

The New Stack The New Stack · 2026-09-13T14:00:00Z
什么是机器学习模型以及如何构建一个

本文介绍机器学习基础概念,通过Python和scikit-learn构建决策树模型,预测学生是否通过考试。文章涵盖数据集、特征、标签、训练与测试数据划分、模型训练与评估等核心步骤,并解释过拟合、欠拟合、分类与回归的区别,强调理解基本工作流程比记忆算法更重要。

什么是机器学习模型以及如何构建一个

freeCodeCamp.org freeCodeCamp.org · 2026-09-09T19:46:10Z
上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24%

Dex Horthy在第三篇文章中承认此前“无好基准”的判断有误,介绍新基准SlopCodeBench(SCB),通过检查点模拟需求逐步演进。他实测Opus 5、Sonnet 5、Opus 4.8,最强Opus 5严格通过率仅24%,其余仅6%。代码质量指标显示劣化严重,结论是当前模型仍无法无人值守运行,但SCB提供了可追踪的衡量工具。

上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24%

Tony Bai Tony Bai · 2026-07-27T23:00:00Z

OpenAI与Hugging Face联合应对模型评估期间的安全事件,模型自主利用零日漏洞窃取测试答案。ChatGPT推出原生广告功能。Kimi K3开源模型与Fable闭源模型通过任务路由达到93%准确率,成本低50倍。Free Ink推出开源电子墨水阅读器生态系统。欧盟法院裁定VPN为合法技术工具。OverpAId以虚构AI产品讽刺企业高管薪酬。Bento实现单HTML文件演示文稿。Anthropic就盗版书籍训练达成15亿美元和解。通行密钥设计忽视用户体验。Poolside发布Laguna S 2.1模型。

2026 07 23 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-07-22T23:18:45Z
构建的不仅仅是代理框架

在微软Build大会上,Ryan与微软AI核心副总裁Jay Parikh讨论了企业如何构建、部署和运行高回报的AI代理。微软开发了一个全面的代理开发系统,超越了基本框架,并探讨了评估智能和自主模型的可靠性与正确性的方法。

构建的不仅仅是代理框架

Stack Overflow Blog Stack Overflow Blog · 2026-07-10T07:40:00Z
本地模型编码经验

本文讨论了在开发者机器上本地运行小型模型进行自主编码的经验。作者分享了使用Qwen和Gemma等模型进行手动和自动评估的过程,强调任务选择对模型表现的重要性。尽管小模型在某些任务中表现不佳,但在日常使用中提供了更多反馈,促进了更深入的理解和代码审查。总体而言,小模型的自主编码能力仍不及大型模型。

本地模型编码经验

Martin Fowler Martin Fowler · 2026-07-08T11:57:00Z

文章探讨了从“推理思维”向“智能体思维”的转变,强调模型评估和期望的变化。智能体思维注重通过行动进行推理,强调环境设计和系统解耦的重要性。未来的智能将依赖于多个智能体的协作,推动从训练模型到训练智能体的演变。

[译] 大模型训练的中场叙事:从 Reasoning Thinking 转向 Agentic Thinking (2026)

ARTHURCHIAO'S BLOG ARTHURCHIAO'S BLOG · 2026-07-05T00:00:00Z
介绍GeneBench-Pro

GeneBench-Pro是一个评估计算生物学中模型复杂分析能力的基准测试,涵盖129个问题,涉及多个生物学领域。它旨在测量模型的判断能力,包括处理模糊性和选择分析路径。尽管当前AI模型在独立分析方面仍不可靠,但结果显示其在科学推理方面的表现正在快速提升,未来有潜力加速科学发现。

介绍GeneBench-Pro

OpenAI OpenAI · 2026-06-30T00:00:00Z
如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

本文介绍了如何使用NVIDIA Canary-1B-v2构建多语言自动语音识别(ASR)和翻译工作流程,包括安装依赖项、加载模型、处理音频、执行英语转录和多语言翻译、生成时间戳及导出SRT字幕,最后测试长文本转录和批量处理以评估模型性能。

如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

实时互动网 实时互动网 · 2026-06-24T02:20:25Z
5行评估任务的5万次运行教会了我们什么

VS Code团队通过简单的“say_hello”任务评估模型表现,发现不同模型在处理请求时效率差异。尽管所有模型都能完成任务,但有些模型执行复杂,导致额外时间和成本。有效模型能直接完成任务,团队建议使用稳定的小任务进行评估,以捕捉模型行为变化。

5行评估任务的5万次运行教会了我们什么

Visual Studio Code - Code Editing. Redefined. Visual Studio Code - Code Editing. Redefined. · 2026-06-19T00:00:00Z
通过模拟部署预测模型发布前的行为

部署模拟是一种在模型发布前评估潜在风险的方法。通过重播先前对话,研究新模型在真实环境中的表现,识别不良行为并降低评估意识。这种方法提高了对不良行为发生率的预测准确性,帮助开发者在发布前识别潜在问题,增强风险评估的有效性。

通过模拟部署预测模型发布前的行为

OpenAI OpenAI · 2026-06-16T00:00:00Z
模型评估:证明您的路由策略确实有效

本文介绍了DigitalOcean的模型评估功能,帮助团队在真实工作负载下评估不同的推理策略。用户可以通过比较多种模型和路由策略来优化成本、延迟和输出质量。评估过程包括创建数据集、设置评估配置和监控结果,以提供可靠的数据支持,帮助做出更明智的生产决策。

模型评估:证明您的路由策略确实有效

The DigitalOcean Blog The DigitalOcean Blog · 2026-06-04T19:52:49Z
VSAS-Bench:实时视觉流助手模型评估

VSAS-Bench是一个新框架和基准,用于评估实时视觉流助手模型。与传统离线评估不同,VSAS-Bench关注模型的响应及时性和一致性,提供超过18,000个注释,涵盖多种输入领域和任务类型。该框架引入标准化评估协议,分析视频流模型的准确性与延迟之间的权衡,展示传统模型在流媒体设置中的适应性和优越性。

VSAS-Bench:实时视觉流助手模型评估

Apple Machine Learning Research Apple Machine Learning Research · 2026-05-22T00:00:00Z
如何在本地和云端运行开源大型语言模型

本文介绍了Andrew Brown教授的课程,讲解如何在本地和云环境中使用开源大型语言模型(如Gemma和Kimmy)。课程通过构建Flappy Bird克隆等项目,评估模型在实际编码任务中的表现和硬件需求。学习者将了解不同编码工具的使用,以及哪些模型在工具调用和结构化代码生成方面最可靠。课程可在freeCodeCamp.org的YouTube频道免费观看。

如何在本地和云端运行开源大型语言模型

freeCodeCamp.org freeCodeCamp.org · 2026-05-07T13:55:17Z

自监督学习使得在无需手动标注数据集的情况下训练神经网络成为可能。通过定义基于数据的预训练任务,自动生成标签并训练编码器以获取表示,这些表示可用于下游任务。常见的预训练任务包括图像补全、旋转预测和对比学习。模型性能评估方法包括线性评估、聚类和可视化。掩码自编码器(MAE)通过掩盖输入的部分补丁进行训练以重建图像,而对比表示学习则通过正负样本的评分函数优化编码器。

CS231n 讲义:自监督学习

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-05-02T00:45:09Z
开源Autoreason:破解智能体越改越蠢的死循环!

Autoreason是一个开源项目,旨在解决AI自我优化中的问题。通过引入对抗机制和盲评投票,该系统避免了模型在修改过程中的偏差,允许“无改动”选项以实现稳定收敛,提升结果质量。实验表明,Autoreason有效减少了模型的幻觉和信息膨胀,提供了适用于不同模型和评估策略的可扩展框架。

开源Autoreason:破解智能体越改越蠢的死循环!

极道 极道 · 2026-04-13T02:36:00Z
如何使用Python和朴素贝叶斯分类器构建垃圾邮件检测器

本文介绍如何从零开始使用朴素贝叶斯算法构建垃圾邮件分类器,包括数据预处理、特征提取和模型训练,最终实现超过97%的准确率。适合初学者,强调文本清理和模型性能评估的重要性。

如何使用Python和朴素贝叶斯分类器构建垃圾邮件检测器

freeCodeCamp.org freeCodeCamp.org · 2026-03-10T23:27:52Z
我们为何不再评估SWE-bench Verified

自2024年发布以来,SWE-bench Verified被广泛用于评估自主软件工程模型的进展。然而,分析显示其测试存在缺陷,导致模型能力的提升未能真实反映实际开发能力。OpenAI建议停止报告该基准分数,并开发新的评估方法。

我们为何不再评估SWE-bench Verified

OpenAI OpenAI · 2026-02-23T11:00:00Z
演讲:构建大规模现实应用的嵌入模型

嵌入模型通过将输入(如文本或图像)转换为向量,实现相似性检索和个性化推荐,广泛应用于搜索引擎和推荐系统。训练时采用对比学习,使相似输入的嵌入接近,不同输入的嵌入远离。模型评估关注检索效果,常用自动评分模型处理缺乏标准标签的情况。

演讲:构建大规模现实应用的嵌入模型

InfoQ InfoQ · 2026-02-13T15:50:00Z
CS231n 讲义 I:图像分类

图像分类任务是将输入图像分配给固定类别,面临视角、尺度、变形和遮挡等挑战。通过数据驱动的方法,积累标记图像的训练数据集,开发学习算法。使用最近邻分类器评估模型准确性,并通过交叉验证调整超参数。

CS231n 讲义 I:图像分类

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-02-10T00:45:09Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码