小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

数学推理已成为衡量大语言模型(LLM)智能水平的核心指标。从算术计算到奥林匹克级问题,再到多步规划与工具调用,模型正从「给出答案」迈向「理解问题并完成推理」。相比传统问答数据集,高质量数据不仅要有准确答案,还需提供规范化的推理轨迹、多路径求解与可验证结果,帮助模型拆解问题、构建逻辑闭环,提升复杂任务下的稳定性。

数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

HyperAI超神经
HyperAI超神经 · 2026-07-29T09:43:32Z
基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

AI X 射线科学家」的意义,并不在于取代实验人员,而是让 AI 从数据分析工具进一步走进实验现场,参与设备操作、状态判断和策略调整。尽管目前仍受限于样品数量、真实机时和人工安全中转,这项研究已证明,大模型能够在复杂、非理想的真实环境中通过持续观测与推理完成实验闭环。未来,随着模型、机器人和科学仪器进一步融合,AI 有望成为大型科研装置中重要的协作伙伴,帮助研究人员减少重复操作,将更多精力投入科学问题本身。

基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

HyperAI超神经
HyperAI超神经 · 2026-07-27T09:48:17Z
Python 潮流周刊#160:AI 智能体与 LLM 推理

分享了 12 篇文章,12 个开源项目

Python 潮流周刊#160:AI 智能体与 LLM 推理

豌豆花下猫 | Python猫
豌豆花下猫 | Python猫 · 2026-07-25T00:00:00Z
阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务

阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务

量子位
量子位 · 2026-07-23T06:58:23Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结...

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道
结构之法 算法之道 · 2026-07-21T15:49:12Z
基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。在实际项目中,如何高效地在GPU集群上部署和优化大模型推理,已经成为AI基础设施团队面临的核心挑战之一。本文基于多个实际项目的经验积累,系统性地介绍大模型推理部署的方法论、部署方案选型、性能调优以及常见问题的解决方案。

基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-21T05:47:53Z
KServe 入门:部署第一个 vLLM 推理服务

在 Kubernetes 上启动一个推理服务并不难,vLLM + Deployment 就能跑起来。但是服务多起来以后,模型从哪里加载、使用哪个 Runtime、GPU 怎么分配、服务怎么暴露,这些配置很快就会散落在一堆 YAML 里。KServe 就是用来解决模型服务管理问题的。 本文从零安装 KServe Standard 模式和 Envoy Gateway,通过本地 PVC 部署...

KServe 入门:部署第一个 vLLM 推理服务

探索云原生
探索云原生 · 2026-07-19T20:00:00Z
WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

量子位
量子位 · 2026-07-19T06:23:00Z
数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。

数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

HyperAI超神经
HyperAI超神经 · 2026-07-17T08:06:36Z
ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

ABot-AgentOS是一种通用机器人智能体操作系统,旨在解决具身智能中的推理与执行、泛化和持久记忆等挑战。该系统结合多模态感知、记忆和推理,支持机器人在物理世界中的长期交互。通过边缘-云协同架构,ABot-AgentOS能够高效执行任务并优化技能,其多模态记忆系统确保机器人持续学习和利用经验,提升智能体整体能力。

ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

结构之法 算法之道
结构之法 算法之道 · 2026-07-17T07:56:33Z
一分钟读论文:《Procedural Memory Distillation:Agent经验复用的程序性记忆蒸馏》

Semih Yavuz等人的研究提出了一种新方法,将过程性信号转化为可复用的程序性记忆,从而提升语言模型的性能。该方法通过三级抽象和协同进化,确保模型在推理时无需外部记忆模块,减少延迟并提高效率。实验结果表明,PMD在LIVECODEBENCH基准上相较于传统方法有显著提升,并在不同难度问题上表现一致。

一分钟读论文:《Procedural Memory Distillation:Agent经验复用的程序性记忆蒸馏》

Micropaper
Micropaper · 2026-07-16T00:00:00Z

卡内基梅隆大学与国际金融管理学院的研究提出了SR2AM架构,将大语言模型的决策过程分为三个系统,显著提升了30B参数模型的性能,达到685B至1T参数级别,同时减少了25.8%至95.3%的token消耗。该架构通过自我调节模块优化了规划与执行的平衡,提高了效率与准确性,实验结果表明SR2AM在不同规模模型上均有效,能够动态分配计算资源。

一分钟读论文:《SR2AM:自我调节模拟规划如何实现高效Agent推理》

Micropaper
Micropaper · 2026-07-16T00:00:00Z
Thinking Machines推出的Inkling现已在AI Gateway上可用

Inkling是Thinking Machines推出的通用AI模型,支持推理和编程等多种任务。用户可通过AI Gateway访问,设置为thinkingmachines/inkling。该平台提供统一API,能够跟踪使用情况和成本,并支持自定义报告和预算管理。

Thinking Machines推出的Inkling现已在AI Gateway上可用

Vercel News
Vercel News · 2026-07-15T00:00:00Z
CLaRa:通过连续潜在推理连接检索与生成

CLaRa(连续潜在推理)是一种通过嵌入式压缩和联合优化提升检索增强生成(RAG)模型性能的统一框架。它采用基于问答和释义监督的SCP框架,生成语义丰富的压缩向量,从而减少输入生成器的文档长度。CLaRa通过单一语言建模损失进行端到端训练,实验结果表明其在多个问答基准上表现优异,达到了先进的压缩和重排序性能。

CLaRa:通过连续潜在推理连接检索与生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-15T00:00:00Z

大型语言模型(LLM)在生产环境中的应用可能导致延迟和成本增加。优化策略包括测量延迟、减少输出令牌、使用小模型处理简单任务、减少模型调用次数、设计可缓存的提示、添加多层缓存、控制上下文预算、批处理非交互式工作、优化批处理、管理缓存和上下文长度、基准测试优化效果、实施流量控制和优雅降级。这些方法能有效降低延迟和成本,提高系统效率。

在生产环境中减少大型语言模型延迟和推理成本的12种方法

KDnuggets
KDnuggets · 2026-07-14T12:00:33Z
在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,这是一款增强推理能力的小模型,拥有 90 亿参数。该模型通过高质量数据提升复杂推理任务的表现,支持长上下文和工具调用,拓展了多模态应用。HyperAI 提供了快速部署和测试的资源,方便开发者使用。

在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

HyperAI超神经
HyperAI超神经 · 2026-07-14T05:59:31Z
内在语言揭秘:人类思考为何离不开词语生成?

语言不仅是思想的表达工具,也是思维生成的关键。内在语言帮助人们构建和明确想法,促进推理和创造。语言的自回归特性影响思维路径,个体思维与社会经验相连,促进认知和情感调节。未来智能系统可能结合潜空间推理与语言生成,语言在智能发展中将扮演重要角色。

内在语言揭秘:人类思考为何离不开词语生成?

极道
极道 · 2026-07-14T00:01:00Z
ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

清华大学团队在ICML 26上获得杰出论文奖,提出了JustGRPO模型,解决了扩散语言模型(dLLM)在数学和编程推理中的灵活性陷阱问题。该模型在GSM8K基准测试中取得89.1%的准确率,展示了其推理潜力。

ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

HyperAI超神经
HyperAI超神经 · 2026-07-13T03:28:59Z
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道
极道 · 2026-07-12T00:56:00Z
AI论文评审:自一致性提升语言模型中的链式思维推理

自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。

AI论文评审:自一致性提升语言模型中的链式思维推理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-08T18:55:53Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码