➡️
继续阅读
-
让炼丹更科学一些(八):多阶段训练的学习率
上篇文章《让炼丹更科学一些(七):步长调度与权重平均》我们简单介绍了无调度(Schedule-Free)学习率的工作,它试图通过某种权重平均来替代学习率调...
-
在真实世界数据集上微调SOTA目标检测模型
本文介绍了在PyCharm中微调YOLO12、YOLO26和RF-DETR等SOTA目标检测模型的方法。作者先在COCO数据集上验证基线性能,再测试零样本...
-
DeepSeek首款视觉模型对比Gemini 3.7 Flash:成本与速度的权衡
DeepSeek发布V4 Flash Vision Exp,支持图像输入,价格低于Gemini 3.7 Flash。测试显示两者在图表、发票和日志分析中准...
-
【vLLM 学习】Eagle
vLLM 是加速大语言模型推理的框架,实现KV缓存零浪费。文章提供Helm图表部署配置及EAGLE投机解码示例,通过离线推理脚本展示如何用vLLM加载模型...
-
从排行榜到模型画像:面向智能体编码的大语言模型深度评估
JetBrains研究团队提出一种超越“解决率”的编码智能体评估方法,从结果、效率、补丁质量和过程四个维度分析模型轨迹。对比Claude Opus 4.7...
-
索尼音乐与华纳联合起诉Anthropic 指控其未经授权盗用大量歌词训练AI模型
索尼音乐与华纳起诉AI公司Anthropic,指控其未经授权使用版权歌词训练Claude模型,要求每首侵权歌曲赔偿15万美元。此前Anthropic已因盗...