小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

数学推理已成为衡量大语言模型(LLM)智能水平的核心指标。从算术计算到奥林匹克级问题,再到多步规划与工具调用,模型正从「给出答案」迈向「理解问题并完成推理」。相比传统问答数据集,高质量数据不仅要有准确答案,还需提供规范化的推理轨迹、多路径求解与可验证结果,帮助模型拆解问题、构建逻辑闭环,提升复杂任务下的稳定性。

数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

HyperAI超神经
HyperAI超神经 · 2026-07-29T09:43:32Z
后训练正成为真正前沿:Kimi K3九大专家蒸馏灌顶内幕

训练会杀死创造力,把AI变成另外一个搜索引擎,但后训练每天用强化学习重新发明人类思维,难道这不算另一种更狠的格式化。 AI圈最近三年在卷什么,后训练。 这词2024年就有人喊了,但真正让所有人疯了一样砸钱砸人砸显卡的是2025下半年之后。 OpenAI后训团队负责人去年底在某个闭门会上甩了句话,现在的前沿不在预训练,在后训练。 这句话像颗炸弹把整个圈子炸醒了。

后训练正成为真正前沿:Kimi K3九大专家蒸馏灌顶内幕

极道
极道 · 2026-07-28T09:43:00Z
大模型训练是在挖“结构信息”,新尺子把信息论脸打肿了

很少有概念像智能一样被如此多的学科所引用,也很少有概念像智能一样被以如此多互不相容的方式进行理论阐释。 对统计学和机器学习而言,智能是数据的极端压缩;对复杂系统研究而言,智能是通用计算的涌现;在智能体与其环境的交互中,智能是开放式的自适应行为。 每一种表现形式都有其自身的文献和目标函数,而这些文献之间鲜有交集。 本文表明,所有这些表现形式都源于一个单一的原则:追求可学习的新颖性。 这份新鲜出炉的学

大模型训练是在挖“结构信息”,新尺子把信息论脸打肿了

极道
极道 · 2026-07-23T01:02:00Z
法院批准A社与作者和出版社的15亿美元和解协议 初步解决A社使用盗版图书训练模型问题

#人工智能 法院批准 A 社与作者和出版社的 15 亿美元和解协议,初步解决 A 社使用盗版书籍训练模型的集体诉讼案件。法庭文件显示,A 社建立拥有 700 万册盗版书籍的中央图书馆来训练模型,此次集体诉讼涉及 50 万册 A 社从盗版网络图书馆下载的书籍。根据和解协议,每册作品可以获得 3,000 美元的赔偿,作者和出版社需要自行分配赔偿金。查看全文:https://ourl.co/114026

法院批准A社与作者和出版社的15亿美元和解协议 初步解决A社使用盗版图书训练模型问题

蓝点网
蓝点网 · 2026-07-22T02:00:04Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结...

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道
结构之法 算法之道 · 2026-07-21T15:49:12Z
基于超1万肿瘤样本训练,哈佛医学院等提出泛癌症基础模型COMPASS,平均性能优于22种现有方法

COMPASS 首次将这一架构引入癌症转录组分析领域,通过利用免疫相关基因集,并建立:基因(gene)→ 基因集(gene set)→ 概念(concept)的层级映射关系,用于表征每位患者的肿瘤免疫微环境。目前,临床研究已经探索了多种预测免疫治疗疗效的生物标志物,其中,肿瘤突变负荷(TMB)、程序性死亡配体...

基于超1万肿瘤样本训练,哈佛医学院等提出泛癌症基础模型COMPASS,平均性能优于22种现有方法

HyperAI超神经
HyperAI超神经 · 2026-07-21T03:45:00Z
WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

量子位
量子位 · 2026-07-19T06:23:00Z
NVIDIA Vera Rubin平台最大化后训练工作负载中的每美元智能效率——代理人工智能的关键指标

NVIDIA Vera Rubin平台通过优化后训练工作流程,提高了智能每美元的效率。后训练阶段使模型在变化环境中持续学习,旨在最大化每次前向和后向传递的收益。该平台支持大规模并行处理,降低了每个令牌的成本,提升了模型的整体价值。

NVIDIA Vera Rubin平台最大化后训练工作负载中的每美元智能效率——代理人工智能的关键指标

NVIDIA Blog
NVIDIA Blog · 2026-07-17T15:00:14Z
一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》

阿里巴巴达摩院与宾夕法尼亚大学合作提出了一种新的编码Agent基础模型中期训练方法FIM Mid-Training。该方法通过自监督学习,利用从GitHub抽取的2.6B token数据,增强模型对函数调用的理解。实验结果表明,模型在多个基准测试中显著提升了性能,并有效缓解了工具调用微调对编码能力的负面影响。

一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》

Micropaper
Micropaper · 2026-07-15T00:00:00Z
SpaceXAI回应Grok Build上传开发者仓库用于模型训练:谁让你们没自己禁用

SpaceXAI 对 Grok Build 上传开发者仓库内容的回应态度强硬,强调用户可通过命令禁用数据共享,但未解释为何未经授权上传完整仓库。禁用后,云端数据会被删除,但缺乏审计保障,敏感信息可能泄露,导致开发者对 Grok Build 的信任度下降。

SpaceXAI回应Grok Build上传开发者仓库用于模型训练:谁让你们没自己禁用

蓝点网
蓝点网 · 2026-07-14T03:00:13Z
AI代理创建虚拟训练场,以帮助机器人获取关键训练数据

MIT开发的“SceneSmith”系统利用协作AI代理生成逼真的3D室内环境,帮助机器人模拟日常任务。该系统通过三个代理生成多样化的场景,使机器人在实际操作前进行有效训练,生成的环境与真实世界高度相似,能够有效评估机器人的任务执行能力。

AI代理创建虚拟训练场,以帮助机器人获取关键训练数据

MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL)
MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL) · 2026-07-13T18:50:00Z
T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

T-Rex是一个多模态框架,旨在提升机器人对触觉信号的反应能力。它通过构建一个包含触觉和视觉信息的统一模型,利用100小时的触觉同步遥操作数据集,支持灵巧操作。该模型分为低频动作专家和高频触觉专家,能够快速适应复杂的操作任务。

T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

结构之法 算法之道
结构之法 算法之道 · 2026-07-12T16:21:19Z

Cloudflare 自 9 月 15 日起更新了 AI 爬虫策略,混合用途爬虫将纳入 AI 训练拦截管理。这一调整帮助网站管理员更好地控制内容使用权限,增强内容保护,确保原创内容不被 AI 模型训练。网站管理员需重新检查配置,关注 AI 爬虫访问情况,以确保内容授权与访问控制的有效性。

Cloudflare 更新 AI 爬虫策略:9 月 15 日起混合用途爬虫将纳入 AI 训练拦截

付杰博客
付杰博客 · 2026-07-11T04:50:18Z

本文介绍了大语言模型(LLMs)的预训练和微调概念。预训练通过大量数据学习语言基础,而微调则是在此基础上针对特定任务进行适应。微调分为完全微调和参数高效微调(PEFT),后者更节省内存且风险较低。尽管微调有效,但并非唯一解决方案,改进提示或检索增强生成(RAG)有时更为合适。

微调入门解析(预训练模型如何学习新技能)

KDnuggets
KDnuggets · 2026-07-10T14:00:32Z
全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

蚂蚁灵波发布了LingBot-VA 2.0,这是全球首个具身原生的预训练VA模型。该模型通过预判能力提升机器人在复杂任务中的表现,如桌面整理和轻柔抓取。LingBot-VA 2.0采用新一代VAE、因果预训练和稀疏MoE架构,显著提高了推理速度和实时控制能力,标志着机器人技术进入新阶段。

全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

量子位
量子位 · 2026-07-10T08:01:00Z
高德发布Phys AI Data:首个面向物理AI训练与应用的一站式空间数据基座

阿里巴巴旗下高德推出Phys AI Data数据系统,包括Phys AI Foundry和Phys AI Map,旨在解决物理AI训练与应用中的数据问题。Phys AI Foundry提供高质量训练数据,支持机器人在真实场景中学习;Phys AI Map为机器人提供可理解的空间地图,帮助其在开放环境中导航。该系统已向具身智能行业开放,支持API接入,降低企业数据采集成本。

高德发布Phys AI Data:首个面向物理AI训练与应用的一站式空间数据基座

量子位
量子位 · 2026-07-08T07:42:27Z
哲学专业逆袭AI时代:逻辑训练比写代码更保值

在AI时代,哲学专业的学生受到科技公司的青睐。AI发展面临“意义”问题,哲学家能够提供逻辑和伦理支持。许多哲学毕业生参与AI项目,帮助解决责任和公平等复杂问题。AI公司开始重视哲学思维,以有效避免潜在风险。未来,哲学人才将成为AI领域的重要顾问,推动技术与伦理的结合。

哲学专业逆袭AI时代:逻辑训练比写代码更保值

极道
极道 · 2026-07-07T21:44:00Z
Weblica:可扩展和可重复的视觉网络代理训练环境

Weblica(网络复制)是一个构建可重复和可扩展网络环境的框架,旨在解决视觉网络代理训练数据的规模化问题。该框架通过HTTP级缓存捕捉稳定的视觉状态,并利用基于真实网站的环境合成来扩展强化学习训练。Weblica-8B模型在多个网络导航基准测试中表现优异,推理步骤更少,且在计算资源增加时表现良好。

Weblica:可扩展和可重复的视觉网络代理训练环境

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z

文章探讨了从“推理思维”向“智能体思维”的转变,强调模型评估和期望的变化。智能体思维注重通过行动进行推理,强调环境设计和系统解耦的重要性。未来的智能将依赖于多个智能体的协作,推动从训练模型到训练智能体的演变。

[译] 大模型训练的中场叙事:从 Reasoning Thinking 转向 Agentic Thinking (2026)

ARTHURCHIAO'S BLOG
ARTHURCHIAO'S BLOG · 2026-07-05T00:00:00Z

南京大学的研究揭示了工具使用智能体在开放世界中的泛化脆弱性,提出了四级分层偏移框架,分析了SFT和RL训练范式的结构性弱点,并提出PAFT方法,通过引入扰动增强微调,提升模型的鲁棒性和泛化能力。

AI 范式雷达:《开放世界中的工具使用智能体——静态训练的脆弱性与修复》

Micropaper
Micropaper · 2026-07-05T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码