小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
构建的不仅仅是代理框架

在微软Build大会上,Ryan与微软AI核心副总裁Jay Parikh讨论了企业如何构建、部署和运行高回报的AI代理。微软开发了一个全面的代理开发系统,超越了基本框架,并探讨了评估智能和自主模型的可靠性与正确性的方法。

构建的不仅仅是代理框架

Stack Overflow Blog
Stack Overflow Blog · 2026-07-10T07:40:00Z
本地模型编码经验

本文讨论了在开发者机器上本地运行小型模型进行自主编码的经验。作者分享了使用Qwen和Gemma等模型进行手动和自动评估的过程,强调任务选择对模型表现的重要性。尽管小模型在某些任务中表现不佳,但在日常使用中提供了更多反馈,促进了更深入的理解和代码审查。总体而言,小模型的自主编码能力仍不及大型模型。

本地模型编码经验

Martin Fowler
Martin Fowler · 2026-07-08T11:57:00Z

文章探讨了从“推理思维”向“智能体思维”的转变,强调模型评估和期望的变化。智能体思维注重通过行动进行推理,强调环境设计和系统解耦的重要性。未来的智能将依赖于多个智能体的协作,推动从训练模型到训练智能体的演变。

[译] 大模型训练的中场叙事:从 Reasoning Thinking 转向 Agentic Thinking (2026)

ARTHURCHIAO'S BLOG
ARTHURCHIAO'S BLOG · 2026-07-05T00:00:00Z
介绍GeneBench-Pro

GeneBench-Pro是一个评估计算生物学中模型复杂分析能力的基准测试,涵盖129个问题,涉及多个生物学领域。它旨在测量模型的判断能力,包括处理模糊性和选择分析路径。尽管当前AI模型在独立分析方面仍不可靠,但结果显示其在科学推理方面的表现正在快速提升,未来有潜力加速科学发现。

介绍GeneBench-Pro

OpenAI
OpenAI · 2026-06-30T00:00:00Z
如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

本文介绍了如何使用NVIDIA Canary-1B-v2构建多语言自动语音识别(ASR)和翻译工作流程,包括安装依赖项、加载模型、处理音频、执行英语转录和多语言翻译、生成时间戳及导出SRT字幕,最后测试长文本转录和批量处理以评估模型性能。

如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

实时互动网
实时互动网 · 2026-06-24T02:20:25Z
5行评估任务的5万次运行教会了我们什么

VS Code团队通过简单的“say_hello”任务评估模型表现,发现不同模型在处理请求时效率差异。尽管所有模型都能完成任务,但有些模型执行复杂,导致额外时间和成本。有效模型能直接完成任务,团队建议使用稳定的小任务进行评估,以捕捉模型行为变化。

5行评估任务的5万次运行教会了我们什么

Visual Studio Code - Code Editing. Redefined.
Visual Studio Code - Code Editing. Redefined. · 2026-06-19T00:00:00Z
通过模拟部署预测模型发布前的行为

部署模拟是一种在模型发布前评估潜在风险的方法。通过重播先前对话,研究新模型在真实环境中的表现,识别不良行为并降低评估意识。这种方法提高了对不良行为发生率的预测准确性,帮助开发者在发布前识别潜在问题,增强风险评估的有效性。

通过模拟部署预测模型发布前的行为

OpenAI
OpenAI · 2026-06-16T00:00:00Z
模型评估:证明您的路由策略确实有效

本文介绍了DigitalOcean的模型评估功能,帮助团队在真实工作负载下评估不同的推理策略。用户可以通过比较多种模型和路由策略来优化成本、延迟和输出质量。评估过程包括创建数据集、设置评估配置和监控结果,以提供可靠的数据支持,帮助做出更明智的生产决策。

模型评估:证明您的路由策略确实有效

The DigitalOcean Blog
The DigitalOcean Blog · 2026-06-04T19:52:49Z
VSAS-Bench:实时视觉流助手模型评估

VSAS-Bench是一个新框架和基准,用于评估实时视觉流助手模型。与传统离线评估不同,VSAS-Bench关注模型的响应及时性和一致性,提供超过18,000个注释,涵盖多种输入领域和任务类型。该框架引入标准化评估协议,分析视频流模型的准确性与延迟之间的权衡,展示传统模型在流媒体设置中的适应性和优越性。

VSAS-Bench:实时视觉流助手模型评估

Apple Machine Learning Research
Apple Machine Learning Research · 2026-05-22T00:00:00Z
如何在本地和云端运行开源大型语言模型

本文介绍了Andrew Brown教授的课程,讲解如何在本地和云环境中使用开源大型语言模型(如Gemma和Kimmy)。课程通过构建Flappy Bird克隆等项目,评估模型在实际编码任务中的表现和硬件需求。学习者将了解不同编码工具的使用,以及哪些模型在工具调用和结构化代码生成方面最可靠。课程可在freeCodeCamp.org的YouTube频道免费观看。

如何在本地和云端运行开源大型语言模型

freeCodeCamp.org
freeCodeCamp.org · 2026-05-07T13:55:17Z

自监督学习使得在无需手动标注数据集的情况下训练神经网络成为可能。通过定义基于数据的预训练任务,自动生成标签并训练编码器以获取表示,这些表示可用于下游任务。常见的预训练任务包括图像补全、旋转预测和对比学习。模型性能评估方法包括线性评估、聚类和可视化。掩码自编码器(MAE)通过掩盖输入的部分补丁进行训练以重建图像,而对比表示学习则通过正负样本的评分函数优化编码器。

CS231n 讲义:自监督学习

Louis Aeilot's Blog
Louis Aeilot's Blog · 2026-05-02T00:45:09Z
开源Autoreason:破解智能体越改越蠢的死循环!

Autoreason是一个开源项目,旨在解决AI自我优化中的问题。通过引入对抗机制和盲评投票,该系统避免了模型在修改过程中的偏差,允许“无改动”选项以实现稳定收敛,提升结果质量。实验表明,Autoreason有效减少了模型的幻觉和信息膨胀,提供了适用于不同模型和评估策略的可扩展框架。

开源Autoreason:破解智能体越改越蠢的死循环!

极道
极道 · 2026-04-13T02:36:00Z
如何使用Python和朴素贝叶斯分类器构建垃圾邮件检测器

本文介绍如何从零开始使用朴素贝叶斯算法构建垃圾邮件分类器,包括数据预处理、特征提取和模型训练,最终实现超过97%的准确率。适合初学者,强调文本清理和模型性能评估的重要性。

如何使用Python和朴素贝叶斯分类器构建垃圾邮件检测器

freeCodeCamp.org
freeCodeCamp.org · 2026-03-10T23:27:52Z
我们为何不再评估SWE-bench Verified

自2024年发布以来,SWE-bench Verified被广泛用于评估自主软件工程模型的进展。然而,分析显示其测试存在缺陷,导致模型能力的提升未能真实反映实际开发能力。OpenAI建议停止报告该基准分数,并开发新的评估方法。

我们为何不再评估SWE-bench Verified

OpenAI
OpenAI · 2026-02-23T11:00:00Z
演讲:构建大规模现实应用的嵌入模型

嵌入模型通过将输入(如文本或图像)转换为向量,实现相似性检索和个性化推荐,广泛应用于搜索引擎和推荐系统。训练时采用对比学习,使相似输入的嵌入接近,不同输入的嵌入远离。模型评估关注检索效果,常用自动评分模型处理缺乏标准标签的情况。

演讲:构建大规模现实应用的嵌入模型

InfoQ
InfoQ · 2026-02-13T15:50:00Z
CS231n 讲义 I:图像分类

图像分类任务是将输入图像分配给固定类别,面临视角、尺度、变形和遮挡等挑战。通过数据驱动的方法,积累标记图像的训练数据集,开发学习算法。使用最近邻分类器评估模型准确性,并通过交叉验证调整超参数。

CS231n 讲义 I:图像分类

Louis Aeilot's Blog
Louis Aeilot's Blog · 2026-02-10T00:45:09Z

在人工智能迅速发展的背景下,构建机器学习应用已形成系统化流程。文章梳理了数据准备、模型训练和服务部署的完整生命周期,强调数据质量、模型评估和持续迭代的重要性,以助力开发者高效推进AI项目。

AI模型从数据到服务的全流程详解

dotNET跨平台
dotNET跨平台 · 2026-01-27T04:42:38Z
提升你的机器学习技能:安德鲁·吴课程后的行动指南

在安德鲁·吴的机器学习课程后,提升技能的关键在于重建神经网络的思维模型,理解架构而非仅仅算法,处理真实复杂数据。学习调试和评估模型,掌握数据预处理和实验记录,理解语言模型的基本原理,选择具有挑战性的项目以增强能力。

提升你的机器学习技能:安德鲁·吴课程后的行动指南

MachineLearningMastery.com
MachineLearningMastery.com · 2026-01-26T17:09:50Z
GIE-Bench:面向文本引导图像编辑的基础评估

本文介绍了GIE-Bench,这是一个用于评估文本引导图像编辑模型的新基准。该基准通过功能正确性和图像内容保留两个维度进行评估,包含1000多个高质量编辑示例。研究发现,GPT-Image-1在指令遵循准确性上表现优异,但常常过度修改无关区域,揭示了当前模型行为的权衡。GIE-Bench为更准确的评估提供了可扩展的框架。

GIE-Bench:面向文本引导图像编辑的基础评估

Apple Machine Learning Research
Apple Machine Learning Research · 2025-12-16T00:00:00Z
时间序列中的Transformer与LSTM:哪种效果更好?

本文探讨了使用LSTM和Transformer模型进行单变量时间序列预测。通过分析芝加哥公共交通数据,展示了数据预处理、模型训练和评估的过程。结果表明,两种模型的预测性能相似,Transformer略优。建议尝试不同数据集以观察模型表现的差异。

时间序列中的Transformer与LSTM:哪种效果更好?

MachineLearningMastery.com
MachineLearningMastery.com · 2025-12-15T11:00:36Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码