阿里旗下千问办公上线一个月用户破3000万,企业用户过半。产品高频迭代,推出国际版并开源MyContext技术,与钉钉深度打通。发布专属模型提升性能,单任务速度提升约100%,Token消耗降75%。长安汽车等头部企业接入,覆盖多行业核心场景,获杰富瑞实测第一。
OpenAI宣布GPT-5.6系列降价,Luna模型降80%,Terra降20%,Sol保持原价但推出加速模式。降价源于模型自我优化降低成本,旨在降低Agent工作流门槛,推动高频任务应用,形成效率与成本良性循环。
翁荔在博客中探讨了AI自进化的路径,提出“Harness”作为关键概念,强调模型如何优化自身的运行系统。她分析了递归自我改进(RSI)的工程化过程,指出自我改进不仅限于模型权重的修改,还包括优化训练和部署流程。通过上下文管理和工作流设计,模型能够更有效地执行任务并持续迭代,同时也提到评估器的局限性和负面结果的忽视。
在WAIC 2026大会上,丘成桐强调数学与人工智能的双向赋能,指出AI的进步依赖于数学基础,而数学研究也受益于AI技术。大会将探讨如何通过数学优化AI模型,提升可解释性和鲁棒性,并推动基础数学研究的创新。三大论坛将聚焦数学与AI的交叉应用,促进理论与产业结合,推动AI领域的精细化发展。
AI基础设施的快速发展给企业带来了新挑战。Jim Keller指出,优化现有模型的基础设施风险较大,因为未来模型可能会有所不同。企业开始关注构建可持续系统,而非仅追求最快的加速器。Nvidia和AMD等公司正转向系统级设计,以应对不断变化的AI工作负载,寻找适应未来AI需求的基础设施解决方案。
本文探讨了通过合成数据和微调提高视觉AI代理准确性的方法。随着边缘计算的发展,企业需要有效处理大量视频数据。NVIDIA提供的工具和蓝图帮助开发者生成训练数据、优化模型并快速部署视觉AI代理。通过合成缺陷图像和视频数据增强,企业能够在缺乏真实数据的情况下实现高效检测和操作。
麻省理工学院的研究人员对随机效用模型进行了重要升级,发现仅通过两两比较无法获取相关性信息,而对三个选项进行排序则能识别出相关性。这一发现为数据收集和模型优化提供了实用的路线图,尤其在人工智能和大语言模型的训练中具有重要意义。
文章讨论了AI语音成本的降本策略,强调消除浪费而非单纯降低单价。提出了针对LLM、TTS、ASR和RTC四个层面的具体降本措施,如优化模型路由、控制输出长度、选择合适的ASR版本等。同时建议利用一体化平台减少集成和维护成本,以确保在不牺牲用户体验的前提下实现降本。
训练AI客服机器人的关键在于高质量的语料。首先需获取真实业务数据,随后进行清洗和标注,确保数据准确。标注需统一标准,避免矛盾。训练后需持续迭代,利用真实对话优化模型。重视数据质量是提升机器人理解能力的根本。
本文讨论了机器学习模型训练中的可视化工具和方法,包括梯度、损失和嵌入的可视化。使用TensorBoard等工具,分析人员可以监控训练过程,识别过拟合和梯度消失等问题,并通过钩子和断点捕捉模型计算,以帮助调试和优化模型性能。
Midjourney因使用谷歌TPU导致研究进度延迟一年,后悔未坚持使用英伟达芯片。硬件切换引发的软件兼容性问题和调试困难,显示出英伟达CUDA生态的优势。研究人员应专注于模型优化,而非硬件兼容性。选择芯片时,稳定性和生态系统的重要性远超成本。
Apache TVM 更新至 0.21.0 版本,中文文档已同步。TVM 是一个深度学习编译框架,支持 CPU 和 GPU 等加速芯片。其图抽象用于表示模型结构并优化性能,Relax 是其图表示方法,具备符号形状、多层次抽象和可组合变换等特性,增强了模型优化能力。
美团龙猫LongCat推出新稀疏注意力机制LoZA,解码速度提升10倍,支持处理1M长文本。通过优化模型结构,降低计算复杂度,提高效率,同时保持稳定性能。该技术在长文本任务中优于同类模型,未来将支持动态稀疏比例,以适应不同场景需求。
科学研究的核心在于推理。GPT-5等模型在文献检索和复杂数学证明方面取得了显著进展。新推出的FrontierScience基准旨在评估模型的科学能力,包含高难度问题。初步评估显示,GPT-5.2在Olympiad和Research任务中表现优异,但开放式思维能力仍需改进。未来将继续优化模型,推动科学研究进展。
本文探讨了通过残差强化学习提升视觉-语言-动作模型的自我改进能力,提出了一种名为PLD的方法,包含在线专家获取、自动数据收集和监督微调三个阶段。该方法结合基础策略和强化学习专家,成功率超过99%。
决策树在实际应用中可能面临过拟合、欠拟合和特征冗余等问题。过拟合使模型过于复杂,导致新数据预测不佳;欠拟合则因模型过于简单,无法有效学习。为优化决策树模型,可以采用正则化、调整模型复杂度和特征选择等方法。
商汤科技在中国AI云市场中排名第一,其AI云服务深度融合AI技术,具备强大算力和模型优化能力,推动各行业智能化转型。通过创新技术和场景化服务,商汤满足个性化需求,助力企业高效应用AI。
Apache TVM 更新至 0.21.0 版本,中文文档已同步。TVM 是一个深度学习编译框架,支持 CPU 和 GPU 等加速芯片。教程涵盖模型构建、优化和部署流程,强调可组合的 IRModule 优化,展示如何使用 TVM 提升机器学习模型性能。
GitHub Copilot通过优化代码补全模型,提高了建议的相关性和接受率,减少了延迟,帮助开发者更高效地编写代码。
Muon(最速下降)和MuP(超参数迁移)在模型优化中有重要联系。本文探讨了模型稳定性的三个核心条件:前向稳定性、依赖稳定性和更新稳定性,为后续优化奠定基础。
完成下面两步后,将自动完成登录并继续当前操作。