➡️
继续阅读
-
模型后训练别一上来就凭感觉打分:奖励顺序比阶段数量更重要
亚马逊团队公开Rufus-Air八阶段后训练配方:先用可自动验证的硬奖励建立能力,再引入主观软奖励,每阶段须通过回归门禁。难度过滤、奖励可靠性与基础设施同...
-
Hermes 提供 7 款免费模型,从安装到选择模型
Hermes 是一款 AI Agent 软件,提供七款免费模型,需登录 Nous Portal 并绑定信用卡使用。模型包括 Solar Pro 4、Lin...
-
从美团 MTFM 看推荐系统统一精排:省下模型,也多了运维账
美团将外卖多业务精排模型统一为MTFM推荐基座,可减少重复训练部署、清理工程债;但统一后发布影响面变大,需按场景降级、回滚和监控。作者认为有规模与平台能力...
-
使用LLM自动化归档新版macOS应用图标的过程
作者利用LLM自动归档新版macOS应用图标。以往手动操作需在“显示简介”中复制图标、经预览导出1024像素PNG并命名,处理75个以上应用十分繁琐。LL...
-
Vol. 175 GPT 6 Astra, Opus 5.5, Jev 诸模型混战
本期科技播客讨论近期AI动态:GPT 6 Astra、Opus 5.5、Jev等模型密集发布,Coding Agent工作流升级,多Agent团队开始自动...
-
杀死AI视频的,不是更好的AI视频模型 - 蝈蝈俊
AI视频生成正从扩散模型转向代码模型。Claude Opus 5.5用Three.js重做《桃花源记》3D交互版,不生成画面,而是写代码让浏览器渲染可交互...