本文介绍9个数学推理数据集,涵盖竞赛级问题、多语言多模态、工具增强推理及知识依赖建模等方向,旨在提升大模型推理能力。包括Math-Graph定理依赖图、Nemotron-SFT-Math-v4、MathNet多模态基准、Nemotron-Math-v2、CHIMERA合成数据、Open-RL、GPT-5.4逐步推理、Sutra 10B预训练及VisCoR-55K视觉推理,助力模型训练与评测。
OvisOCR2是2026年7月推出的0.8B参数端到端文档解析模型,基于Qwen3.5-0.8B构建,能将文档图像转为结构化Markdown,精准解析文本、公式、表格等。在OmniDocBench v1.6评测中获96.58分,超越传统流水线方法,实现低部署成本与高性能统一。HyperAI官网已上线该模型,并提供在线使用。
TabFM 是 Google Research 发布的基础模型,专注于处理结构化表格数据,支持分类和回归任务。该模型通过上下文学习重塑表格预测,显著提升数据处理效率,并在零样本配置下超越多个传统基线模型。
训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。
AI Agent 正在从对话工具转变为任务执行者,广泛应用于自动化办公和代码生成等领域。与传统大语言模型不同,Agent 能够拆解任务并自主推进。为支持其能力,相关数据集强调过程能力,包括长程规划和多步推理。本文整理了10个关键数据集,涵盖长上下文理解、任务规划和工具调用等能力,推动 AI Agent 的研究与应用。
Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。
近年来,人工智能的发展逐渐从算法创新转向数据质量驱动。合成数据成为重要支撑,Meta的Autodata框架通过智能体模拟数据科学家,生成高质量训练数据,显著提升模型性能,展示了合成数据生成的新范式。
OpenAI在调试Rockset服务时发现了两个崩溃问题:一个是硬件故障导致的堆栈错位,另一个是GNU libunwind库中的竞争条件。通过构建高质量的数据集,团队成功识别并解决了这些问题,强调了数据在调试中的重要性。
NVIDIA 发布的 PiD 是一种新型潜空间解码范式,通过条件像素扩散生成取代传统 VAE 解码,解决了高分辨率图像生成的限制。PiD 利用轻量级噪声感知适配器和 DMD2 蒸馏技术,仅需 4 步去噪即可生成清晰的 4K 图像,显著提升了图像质量。
本文讨论了在亚马逊云科技上构建企业级智能体的评估框架,强调评估应贯穿开发全生命周期。提出六个关键问题,涵盖评估框架、指标体系、自动化流程、数据集、工程纪律及工具支持。亚马逊云科技的经验表明,评估需关注智能体各组件,以确保其在复杂环境中的稳定性和可优化性。通过持续监测和反馈,企业能更有效地实现智能体的生产级部署。
本文介绍了构建合成PHI生成管道的方法,以创建隐私安全的医疗影像AI训练和验证数据。通过生成虚拟患者身份并嵌入图像和DICOM元数据,团队能够创建可用于训练和评估去标识化系统的安全数据集,从而确保数据的可重复性和准确性,支持医疗AI系统的开发。
LongCat-Video-Avatar 1.5 是美团团队于2026年推出的开源音频驱动视频生成框架。用户只需提供静态图像和音频,即可生成口型同步的动态视频,适用于真实人像和动漫角色,具备高保真画面和长视频生成能力。
本文介绍了GitHub Copilot CLI的基本用法,包括使用斜杠命令控制终端AI代理,以及提高选择性和改进秘密扫描的可靠性,以减少误报并提升警报的可信度和可操作性。
全双工人机交互技术受到关注,ASLP实验室与上海元音矩阵科技公司联合开源了SmoothConv和DuplexConv两个中文长音频对话数据集。这些数据集包含真实对话场景,旨在支持语音大模型研发,提供高质量对话数据,涵盖教育和闲聊领域,助力全双工系统的中断与响应决策。
ChartNet是由麻省理工学院等机构开发的高质量多模态数据集,包含150万个图表样本,涵盖24种图表类型,旨在提升AI对图表的理解能力。该数据集支持图表重建、数据提取和摘要生成等任务。研究表明,微调模型在ChartNet上表现优于现有大型模型,推动了视觉语言模型在图表理解领域的进步。
TACK 是 AI Laboratory for Molecular Engineering 于 2026 年发布的一个标准化知识库数据集与基准测试集,旨在解决现有 PROTAC 机器学习基准中数据稀缺、缺乏严格评估及覆盖范围有限的问题,广泛应用于 PROTAC...
MIT和IBM研究人员开发了ChartNet数据集,包含超过一百万种多样化图表,旨在提升视觉语言模型对图表的理解能力。该数据集通过合成数据生成,帮助小型企业利用AI进行商业趋势分析和科学数据解读。研究表明,使用ChartNet训练的开源模型在图表提取和总结任务上优于大型商业模型。
Lance是字节跳动于2026年发布的多模态模型,具备图像与视频的理解、生成和编辑能力。该模型采用双流混合专家架构,提升了文本、图像和视频任务的生成质量和语义理解能力。
GR00T N1.6和N1.7是NVIDIA开发的视觉语言模型(VLM),用于机器人控制。N1.6改进了模型结构,支持灵活分辨率,并引入新数据集;N1.7在此基础上增强了模型的泛化能力,并在大量人类视频数据上进行预训练,提高了机器人控制的精确性和效率。
本文介绍了如何使用Mimesis库生成平衡的反事实数据集,以审计机器学习模型的偏见。通过创建具有相同收入但不同性别的贷款申请者,揭示模型在性别上的歧视。实验结果表明,男性申请者更容易获得贷款批准,而女性则常被拒绝。这一方法有助于识别和纠正模型中的偏见。
完成下面两步后,将自动完成登录并继续当前操作。