小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

数学推理已成为衡量大语言模型(LLM)智能水平的核心指标。从算术计算到奥林匹克级问题,再到多步规划与工具调用,模型正从「给出答案」迈向「理解问题并完成推理」。相比传统问答数据集,高质量数据不仅要有准确答案,还需提供规范化的推理轨迹、多路径求解与可验证结果,帮助模型拆解问题、构建逻辑闭环,提升复杂任务下的稳定性。

数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

HyperAI超神经
HyperAI超神经 · 2026-07-29T09:43:32Z
基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

AI X 射线科学家」的意义,并不在于取代实验人员,而是让 AI 从数据分析工具进一步走进实验现场,参与设备操作、状态判断和策略调整。尽管目前仍受限于样品数量、真实机时和人工安全中转,这项研究已证明,大模型能够在复杂、非理想的真实环境中通过持续观测与推理完成实验闭环。未来,随着模型、机器人和科学仪器进一步融合,AI 有望成为大型科研装置中重要的协作伙伴,帮助研究人员减少重复操作,将更多精力投入科学问题本身。

基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

HyperAI超神经
HyperAI超神经 · 2026-07-27T09:48:17Z
大型语言模型(LLM)框架比较:LangChain、LlamaIndex与原始API调用

本文比较了三种大型语言模型(LLM)框架:LangChain、LlamaIndex和原始API调用。LangChain适合复杂应用的多步骤操作,LlamaIndex专注于高效的数据检索,而原始API调用则提供最低延迟和最高透明度。选择合适的框架应根据项目需求,简单任务使用原始API,文档检索使用LlamaIndex,状态管理和多步骤推理适合LangChain。建议根据实际需求逐步引入框架。

大型语言模型(LLM)框架比较:LangChain、LlamaIndex与原始API调用

MachineLearningMastery.com
MachineLearningMastery.com · 2026-07-09T15:38:56Z
如何构建具有工具调用和记忆功能的本地AI代理

本文介绍了如何使用LangChain v1、Ollama和Python构建一个具有工具调用和短期记忆的本地AI代理。该代理能够自主决定何时调用工具,并记住对话内容,以便进行自然的后续提问。教程包括Ollama和Python依赖项的安装、代理代码的编写及运行步骤,强调了本地模型的隐私保护和无API费用的优势。

如何构建具有工具调用和记忆功能的本地AI代理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-07T20:08:59Z
读取代理追踪是你无法通过评估进行调用的方式

Next.js可以追踪请求,使用@vercel/otel和环境变量将追踪导出到OTLP兼容的后端。Sentry的SDK团队利用AI自动设置错误报告的重现环境,显著缩短了设置时间。

读取代理追踪是你无法通过评估进行调用的方式

Sentry Blog
Sentry Blog · 2026-07-01T09:00:00Z
OpenCode中设置DeepSeek Flash+GLM 5.2:调用费省七成

OpenCode通过配置DeepSeek Flash和GLM 5.2,实现高效的AI调用管理,降低整体成本70%。Flash处理日常事务,GLM专注复杂决策,提升响应速度和资源使用效率,适合团队高效工作。

OpenCode中设置DeepSeek Flash+GLM 5.2:调用费省七成

极道
极道 · 2026-06-28T11:29:00Z

腾讯网盘即将上线,支持与腾讯系产品如微云、腾讯文档互通。其特点包括按组织共享空间、高效协作、统一身份登录及智能体调用数据,且支持私有化部署,满足企业数据合规需求,旨在提升用户管理文件的便利性。

腾讯重新杀入网盘领域 即将推出腾讯网盘 支持多种应用数据互通和AI智能体调用

蓝点网
蓝点网 · 2026-06-17T01:30:05Z
工具调用实践——网络搜索

本文介绍了如何为大型语言模型(LLM)添加网络搜索功能,开发者可以使用第三方搜索API(如Tavily)获取最新信息。文章提供了Tavily API的示例代码,并展示了LLM在有无网络搜索情况下的回答差异。通过实现网络搜索工具,LLM能够实时获取信息并回答用户问题。

工具调用实践——网络搜索

Rei
Rei · 2026-06-16T14:14:29Z
Spring AI 2.0中的工具调用:一种可组合的智能架构

Tanzu Spring 提供对 OpenJDK、Spring 和 Apache Tomcat 的支持,用户只需简单订阅即可获得相关服务和二进制文件。

Spring AI 2.0中的工具调用:一种可组合的智能架构

Spring
Spring · 2026-06-15T00:00:00Z
Nova v2.0 发布:工具调用展示、会话置顶与更多改进

Nova v2.0 发布,新增工具调用展示、错误消息卡片、会话置顶、账号导入导出等功能,全面提升移动端 AI 对话体验。

Nova v2.0 发布:工具调用展示、会话置顶与更多改进

Eric's Blog
Eric's Blog · 2026-06-12T00:00:00Z
谷歌宣布网站/发布商可以主动退出谷歌搜索AI概览 不允许AI概览调用内容

谷歌宣布网站可主动退出其搜索的AI概览和AI模式,以保护网站流量和广告收入。退出后不会影响自然搜索流量,目前仅在英国测试,未来将推广至全球。此举是对因AI概览引发的法律争议的回应,网站可根据数据决定是否退出。

谷歌宣布网站/发布商可以主动退出谷歌搜索AI概览 不允许AI概览调用内容

蓝点网
蓝点网 · 2026-06-04T03:00:06Z
工具调用

本文介绍了如何在 Chat CLI 中实现工具调用功能,使 AI 能够获取外部信息并执行任务。通过 OpenAI API 的 Tool Call 功能,AI 可以调用定义的工具,如获取天气信息。文章详细描述了工具的定义、调用流程及示例代码,并强调了安全问题及预防措施,以确保 Agent 的安全性和有效性。

工具调用

Rei
Rei · 2026-06-03T14:20:50Z
AI 范式雷达:《高质量合成数据让多步工具调用性能飙升 10%》

PROVE 论文提出了一种新方法,解决多步工具调用中的训练数据与真实工具状态错配问题。通过高质量合成数据和程序化奖励,显著提升了模型在多工具场景下的稳定性。该方法强调执行对齐,确保训练样本与部署环境共享可执行约束,降低了奖励噪声。尽管存在工具覆盖面和维护成本等限制,PROVE 为 Agent 训练提供了重要的改进方向。

AI 范式雷达:《高质量合成数据让多步工具调用性能飙升 10%》

Micropaper
Micropaper · 2026-06-03T00:00:00Z

OpenAI 宣布将逐步弃用使用率低的 o3 和 GPT-4.5 模型,o3 将在 90 天后弃用,GPT-4.5 在 30 天后弃用。新推出的 GPT-5.5 Instant 模型将提供更易读的输出和改善的对话节奏。旧版模型的 Canvas 功能将不再支持,付费用户可在有限时间内继续使用。API 端将继续支持这些模型。

o3和GPT-4.5模型将被陆续从ChatGPT中删除 不过API端继续提供调用

蓝点网
蓝点网 · 2026-05-31T07:07:13Z
功能调用现按单位计费

从2026年5月29日起,Pro和新企业客户的功能调用将由套餐计费转为按单位计费,每次调用费用为$0.0000006,之前为每百万次调用$0.60。此变更更适应团队规模和使用模式。

功能调用现按单位计费

Vercel News
Vercel News · 2026-05-29T10:00:00Z
早报|华为公布韬定律,Mate 90有望搭载更强芯片/宇树科技上会估值420亿/DeepSeek登顶全球调用榜

华为在国际电路与系统研讨会上发布了麒麟2026芯片,采用逻辑折叠技术,预计搭载在Mate 90上。何庭波提出的“韬定律”旨在提升半导体性能,预计到2031年实现更高晶体管密度。华为希望与全球合作伙伴共同推动半导体产业发展。

早报|华为公布韬定律,Mate 90有望搭载更强芯片/宇树科技上会估值420亿/DeepSeek登顶全球调用榜

爱范儿
爱范儿 · 2026-05-26T00:18:37Z
AI团队花费数月时间开发的网络爬虫,SerpApi通过一次API调用即可替代

SerpApi 是一个网络搜索 API,简化了从搜索引擎获取数据的过程,避免了 IP 阻塞和 CAPTCHA 等问题。开发者可以通过调用 API 获取结构化数据,专注于产品开发。该平台支持多种搜索引擎,适用于实时数据需求,尤其在 AI 应用中,提供可靠的信息源,减少模型错误推测。

AI团队花费数月时间开发的网络爬虫,SerpApi通过一次API调用即可替代

The New Stack
The New Stack · 2026-05-12T14:00:00Z
在24GB M4 MacBook上跑本地大模型:Qwen 3.5-9B实测40 tokens/s,支持工具调用

开发者jola分享了在M4 MacBook Pro上运行Qwen 3.5-9B(Q4_K_S量化版)本地大语言模型的经验,尽管该模型无法完成复杂任务,但它提升了开发者的参与度,成为一种可控的离线助手,适合24GB内存的用户。

在24GB M4 MacBook上跑本地大模型:Qwen 3.5-9B实测40 tokens/s,支持工具调用

dotNET跨平台
dotNET跨平台 · 2026-05-12T00:01:01Z
掌握AI代理中工具调用的路线图

本文探讨了AI代理中掌握工具调用的关键步骤,包括理解工具调用协议、编写工具定义、构建错误处理机制、战略性并行调用、管理工具目录规模、设计安全性和评估工具调用。强调模型推理与执行的分离,以提高代理的可靠性和效率。

掌握AI代理中工具调用的路线图

MachineLearningMastery.com
MachineLearningMastery.com · 2026-05-07T12:00:13Z
将大型语言模型连接到现实世界:工具使用、功能调用与模型上下文协议

大型语言模型(LLM)最初只能生成文本,无法与外部系统直接交互。通过功能调用,LLM可以请求特定操作,执行由应用层完成。模型上下文协议(MCP)标准化了工具的描述和发现,简化了不同提供商之间的集成。尽管快速发展带来了便利,但安全性和模型的上下文限制仍需关注。

将大型语言模型连接到现实世界:工具使用、功能调用与模型上下文协议

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-05-04T15:30:46Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码