小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文介绍了大语言模型(LLMs)的预训练和微调概念。预训练通过大量数据学习语言基础,而微调则是在此基础上针对特定任务进行适应。微调分为完全微调和参数高效微调(PEFT),后者更节省内存且风险较低。尽管微调有效,但并非唯一解决方案,改进提示或检索增强生成(RAG)有时更为合适。

微调入门解析(预训练模型如何学习新技能)

KDnuggets
KDnuggets · 2026-07-10T14:00:32Z
DynaMiCS:使用动态混合进行具有性能约束的大型语言模型微调

DynaMiCS是一种动态混合优化器,旨在多领域微调大型语言模型,提升目标领域性能的同时保持约束领域的性能。该方法通过短期领域特定探测估计交叉领域效应,并优化混合权重,以降低计算成本,实现更好的目标领域改进和约束满足。

DynaMiCS:使用动态混合进行具有性能约束的大型语言模型微调

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
进入全宇宙:通过合成数据和微调提高视觉AI代理准确性的三种工作流程

本文探讨了通过合成数据和微调提高视觉AI代理准确性的方法。随着边缘计算的发展,企业需要有效处理大量视频数据。NVIDIA提供的工具和蓝图帮助开发者生成训练数据、优化模型并快速部署视觉AI代理。通过合成缺陷图像和视频数据增强,企业能够在缺乏真实数据的情况下实现高效检测和操作。

进入全宇宙:通过合成数据和微调提高视觉AI代理准确性的三种工作流程

NVIDIA Blog
NVIDIA Blog · 2026-06-30T13:00:27Z

本文介绍了如何在苹果硅芯片的Mac上使用MLX框架进行本地微调语言模型,避免云计算费用。MLX是苹果机器学习团队开发的开源库,支持多种开放模型的文本生成和微调。用户需准备数据集并使用LoRA适配器进行训练,过程简单高效,最终可在本地测试和服务微调后的模型。

在苹果硅芯片上使用MLX进行语言模型的微调

KDnuggets
KDnuggets · 2026-06-26T15:00:17Z
英伟达MoE新开源:一行import,微调加速3.7倍

英伟达推出NeMo AutoModel,基于Transformers v5,提升MoE模型微调速度3.4-3.7倍,显存减少29%-32%。通过专家并行、DeepEP和TransformerEngine等技术,优化内存和计算效率。用户只需添加一行代码即可实现升级,支持更大批次和更长序列,相关代码已开源。

英伟达MoE新开源:一行import,微调加速3.7倍

量子位
量子位 · 2026-06-26T03:23:35Z
1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

HIL-ResRL是一种即插即用的VLA工具,经过1小时微调后成功率超过95%。该技术在提升机器学习模型应用效率方面具有重要意义。

1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

mongona news
mongona news · 2026-06-24T10:38:38Z
1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

在具身智能领域,视觉-语言-动作(VLA)模型面临模仿学习导致的误差累积问题。华为云的HIL-ResRL方法通过人机协同和残差策略,提高了机器人在真实环境中的任务成功率,实验成功率超过95%。该方法无需重训练,适用于多种工业任务,并通过触觉反馈显著提高精度,展示了快速部署的潜力。

1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

量子位
量子位 · 2026-06-24T10:38:38Z
微调6亿参数Qwen3 4B实现91.6%分类准确率

通过微调6亿参数的小模型Qwen 3 0.6B,家庭问题分类准确率从9.92%提升至91.6%。关键在于让模型学习无意义的代码,降低认知负担,提升分类效果。这一策略适用于特定领域的AI应用。

微调6亿参数Qwen3 4B实现91.6%分类准确率

极道
极道 · 2026-06-22T02:47:00Z
步骤拒绝微调:从嘈杂的智能体轨迹中提取更多信号

研究团队提出了一种名为“步骤拒绝微调”(SRFT)的方法,以提高大型语言模型(LLM)在复杂任务中的学习效率。SRFT通过“评论者”模型分析失败轨迹,标记有害步骤,保留有用的正确步骤,从而显著提升模型性能,证明失败的尝试也能为学习提供重要信息。

步骤拒绝微调:从嘈杂的智能体轨迹中提取更多信号

The JetBrains Blog
The JetBrains Blog · 2026-06-17T08:57:24Z

watchOS 27 更新了多个功能,包括改进的 Liquid Glass 设计、动态应用网格和智能叠放。新手势交互使操作更便捷,查找 app 整合了多个功能。Siri AI 进行了优化,支持自然对话。新增运动功能允许用户在没有 iPhone 的情况下使用 Workout Buddy,整体性能提升,但仅支持新款 Apple Watch。

具透 | 动态应用网格、Liquid Glass 微调,watchOS 27 首个开发者测试版一览

少数派
少数派 · 2026-06-17T07:00:00Z
《GPT 图解》笔记:微调与RLHF、总结

本文讨论了微调和人类反馈强化学习(RLHF)在GPT模型训练中的应用。微调通过特定对话数据优化模型,RLHF则通过监督学习和人类偏好评分提升回答质量。作者分享了学习过程中的体会,强调AI辅助学习的高效性,并回顾了从N-Gram到GPT的技术演变。

《GPT 图解》笔记:微调与RLHF、总结

Ying’s Blog
Ying’s Blog · 2026-06-14T06:08:17Z
给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

本文探讨了AI语音聊天机器人的人设与声线设计,强调了三种主要方法:prompt工程、模型微调和声音克隆。prompt工程适合探索阶段,成本低、迭代快;模型微调提高人设辨识度和一致性;声音克隆确保声线独特性。最佳实践是结合三者,根据项目阶段逐步引入,以提升用户体验和产品差异化。

给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

实时互动网
实时互动网 · 2026-06-12T07:53:14Z

DiffusionGemma是一种实验性文本生成模型,采用文本扩散技术,速度比传统模型快4倍,能够同时生成256个标记,适用于实时交互应用。尽管输出质量低于Gemma 4,但可通过微调提升特定任务性能。该模型优化了硬件利用率,适合低并发本地推理。开发者可在Hugging Face获取模型权重并进行集成。

DiffusionGemma:文本生成速度提升4倍

The Keyword
The Keyword · 2026-06-10T16:00:00Z

这篇文章讨论了监督微调(SFT)在语言模型训练中的重要性,强调数据质量、模板设计和损失函数的影响。SFT通过指令与回答对训练模型,确保模型能够有效生成助手回答。此外,SFT是后续强化学习(RLHF)的基础,强调样本去重、数据来源和模板一致性的重要性,以避免模型学习错误的行为模式。

【强化学习与大模型后训练】07|监督微调(SFT):指令数据、模板与训练细节

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-05-29T00:00:00Z
针对视频智能的多模态模型微调

2026年上半年,Mux推出了@mux/ai SDK,作为开源版本,允许用户自定义AI工作流。通过与Baseten集成,用户可以使用LoRA技术对模型进行微调,提升视频智能处理能力。@mux/ai为需要更高定制化的项目提供了更多控制和灵活性。

针对视频智能的多模态模型微调

Mux Blog - Video technology and more
Mux Blog - Video technology and more · 2026-05-28T16:22:16Z
GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)

GR00T N1.6和N1.7是NVIDIA开发的视觉语言模型(VLM),用于机器人控制。N1.6改进了模型结构,支持灵活分辨率,并引入新数据集;N1.7在此基础上增强了模型的泛化能力,并在大量人类视频数据上进行预训练,提高了机器人控制的精确性和效率。

GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)

结构之法 算法之道
结构之法 算法之道 · 2026-05-27T08:00:00Z
cli-trainer Skill 上线,在 AI Agent 里一键微调大模型

星河社区推出cli-trainer,简化大模型微调流程。用户在AI IDE中输入需求后,系统自动完成环境检测、数据上传和训练提交,无需编写代码。支持多种模型和数据格式,训练后可通过API调用模型,旨在提升用户体验,减少操作步骤。

cli-trainer Skill 上线,在 AI Agent 里一键微调大模型

百度大脑
百度大脑 · 2026-05-21T11:02:44Z
AI论文评审:通过生成预训练(GPT-1)提升语言理解

本文介绍了AI语言理解的进展,特别是生成预训练(GPT)模型的创新。通过在大量未标记文本上进行预训练,再利用小规模标记数据进行微调,模型能够适应多种任务。这种方法减少了对标记数据的依赖,提升了模型的通用性和性能,成为现代语言模型的基础。

AI论文评审:通过生成预训练(GPT-1)提升语言理解

freeCodeCamp.org
freeCodeCamp.org · 2026-05-06T18:13:01Z
LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环

本文讨论了在真实世界中部署通用机器人策略的挑战,提出了一种名为“部署中学习”(LWD)的框架,通过车队规模的离线到在线强化学习(RL)实现策略的持续改进。该方法结合离线数据和在线交互,利用多样化的部署经验,优化策略以适应新任务和环境。作者提出的分布式隐式价值学习(DIVL)和带有伴随匹配的Q学习(QAM)技术,旨在提高策略的稳定性和泛化能力,实现高效的后训练。

LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环

结构之法 算法之道
结构之法 算法之道 · 2026-04-30T14:53:08Z

自托管大型语言模型(LLM)面临硬件限制、延迟和模型行为不一致等挑战。运行7B参数模型至少需要16GB显存,量化虽然能节省资源,但会影响精度。自托管模型通常比API慢,影响开发效率。微调模型需要高质量数据,且过程复杂。总体而言,自托管LLM既可行又困难,需要耐心和反复试验。

现实世界中的自托管大型语言模型:限制、解决方案与深刻教训

KDnuggets
KDnuggets · 2026-04-29T12:00:48Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码