该文推荐五门免费课程,构成从基础到实践的LLM学习路径:Karpathy的《Neural Networks: Zero to Hero》教构建神经网络和GPT;FSDL LLM Bootcamp讲生产架构;斯坦福CS336深入理论和扩展;Hugging Face课程练微调;DeepLearning.AI短课学部署和智能体。总计约80-120小时,建议按顺序或选择性学习,以实践为主。
本文介绍了在PyCharm中微调YOLO12、YOLO26和RF-DETR等SOTA目标检测模型的方法。作者先在COCO数据集上验证基线性能,再测试零样本在电缆损伤、骨折X光片和汽水瓶等专业数据集上的表现,结果接近零。经过10轮微调后,模型在电缆和汽水瓶任务上表现良好,但骨折检测仍具挑战。文章强调预训练模型不等于可直接部署,需根据任务选择合适模型。
本文介绍微软首席应用科学家Mariko Wakabayashi和高级应用科学家Zixiao Chen,他们专注于开发网络安全运营的智能体AI工作流,研究LLM驱动系统、智能体工作流及前沿AI应用,并涉及秘密检测、智能体安全系统及LLM微调,旨在提升AI效率、可扩展性和实际部署能力。
KTransformers v0.7.0发布,聚焦微调优化。支持直接加载原生FP8权重进行LoRA训练,将专家权重内存减半;新增AVX512 CPU后端,使AMD/x86平台可参与超大规模MoE微调;提供LoRA与全量微调选择,支持检查点保存恢复及CPU激活复用。附完整Cookbook指南,安装命令为pip install "ktransformers[sft]==0.7.0"。
本文探讨了提示缓存与微调在降低AI代理系统成本与延迟方面的差异及选择框架。提示缓存通过存储重复提示结果减少计算开销,适合静态文档和重复查询;微调通过LoRA等技术训练模型提升特定任务效率,适合格式一致性和个性化需求。混合策略可兼顾两者优势,实现高效架构。
本文介绍SmolLM3,一个3B参数的小型语言模型,强调其在特定任务上能以更低成本媲美70B模型。文章通过构建多语言客服工单路由器的实例,展示了SmolLM3的加载、推理、工具调用和微调方法,并指出其架构优势(如分组查询注意力、双模式推理)使其在资源受限环境下高效实用。
本教程介绍如何使用QLoRA对大型语言模型进行监督微调,以定制AI代理行为。通过Unsloth和Hugging Face工具,加载Qwen 1.5B模型,在本地用少量示例训练LoRA适配器,仅更新约4%参数,内存占用低。微调后模型响应更简洁、符合客服场景,适合资源有限环境。
研究显示,AI在回答文化问题时存在显著地域偏见,尤其偏爱日本和美国。通过分析八个大语言模型的三万道文化题,发现偏见主要源于微调阶段而非预训练。训练数据多的语言(如英语)回答多样性高,小语种则集中于少数国家。这种“日吹”现象反映了人类标注过程中的文化惯性,导致AI服务存在信息鸿沟。
本文系统介绍纯文本LLM监督微调(SFT)训练数据预处理全流程,涵盖数据收集、格式统一、清洗过滤、去重、分布评估、混合策略及打包管理。强调数据质量优于数量,提供多任务采样、语种比例、难度分布等实操建议,并结合客户案例说明,旨在提升模型微调效果。
本文介绍了大语言模型(LLMs)的预训练和微调概念。预训练通过大量数据学习语言基础,而微调则是在此基础上针对特定任务进行适应。微调分为完全微调和参数高效微调(PEFT),后者更节省内存且风险较低。尽管微调有效,但并非唯一解决方案,改进提示或检索增强生成(RAG)有时更为合适。
DynaMiCS是一种动态混合优化器,旨在多领域微调大型语言模型,提升目标领域性能的同时保持约束领域的性能。该方法通过短期领域特定探测估计交叉领域效应,并优化混合权重,以降低计算成本,实现更好的目标领域改进和约束满足。
本文探讨了通过合成数据和微调提高视觉AI代理准确性的方法。随着边缘计算的发展,企业需要有效处理大量视频数据。NVIDIA提供的工具和蓝图帮助开发者生成训练数据、优化模型并快速部署视觉AI代理。通过合成缺陷图像和视频数据增强,企业能够在缺乏真实数据的情况下实现高效检测和操作。
本文介绍了如何在苹果硅芯片的Mac上使用MLX框架进行本地微调语言模型,避免云计算费用。MLX是苹果机器学习团队开发的开源库,支持多种开放模型的文本生成和微调。用户需准备数据集并使用LoRA适配器进行训练,过程简单高效,最终可在本地测试和服务微调后的模型。
英伟达推出NeMo AutoModel,基于Transformers v5,提升MoE模型微调速度3.4-3.7倍,显存减少29%-32%。通过专家并行、DeepEP和TransformerEngine等技术,优化内存和计算效率。用户只需添加一行代码即可实现升级,支持更大批次和更长序列,相关代码已开源。
在具身智能领域,视觉-语言-动作(VLA)模型面临模仿学习导致的误差累积问题。华为云的HIL-ResRL方法通过人机协同和残差策略,提高了机器人在真实环境中的任务成功率,实验成功率超过95%。该方法无需重训练,适用于多种工业任务,并通过触觉反馈显著提高精度,展示了快速部署的潜力。
HIL-ResRL是一种即插即用的VLA工具,经过1小时微调后成功率超过95%。该技术在提升机器学习模型应用效率方面具有重要意义。
通过微调6亿参数的小模型Qwen 3 0.6B,家庭问题分类准确率从9.92%提升至91.6%。关键在于让模型学习无意义的代码,降低认知负担,提升分类效果。这一策略适用于特定领域的AI应用。
研究团队提出了一种名为“步骤拒绝微调”(SRFT)的方法,以提高大型语言模型(LLM)在复杂任务中的学习效率。SRFT通过“评论者”模型分析失败轨迹,标记有害步骤,保留有用的正确步骤,从而显著提升模型性能,证明失败的尝试也能为学习提供重要信息。
watchOS 27 更新了多个功能,包括改进的 Liquid Glass 设计、动态应用网格和智能叠放。新手势交互使操作更便捷,查找 app 整合了多个功能。Siri AI 进行了优化,支持自然对话。新增运动功能允许用户在没有 iPhone 的情况下使用 Workout Buddy,整体性能提升,但仅支持新款 Apple Watch。
本文讨论了微调和人类反馈强化学习(RLHF)在GPT模型训练中的应用。微调通过特定对话数据优化模型,RLHF则通过监督学习和人类偏好评分提升回答质量。作者分享了学习过程中的体会,强调AI辅助学习的高效性,并回顾了从N-Gram到GPT的技术演变。
完成下面两步后,将自动完成登录并继续当前操作。