GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费
内容提要
GPT-4o mini 已成为大型模型领域的顶级表现者,以更低的成本匹敌完整版。OpenAI 正逐步允许对 GPT-4o mini 进行微调,并在 9 月 23 日之前每天提供 200 万个免费训练代币。在 lmsys 排名中,GPT-4o mini 与完整版并列第一,仅落后 7 分。GPT-4o mini 的发布促使其他公司开发更小的模型。
延伸解读
lmsys竞技场:真实用户投票的含金量
lmsys大模型竞技场采用用户自出题、匿名1对1比拼的方式,避免了模型通过刷题获取虚高分数,因此成绩更接近真实用户体验。GPT-4o mini在此与满血版并列第一,仅差7分,且平均胜率0.6仅次于满血版,这为其性能提供了有力背书。但文章也提到,有观点认为lmsys方法的完善性开始瓦解,需改进才能保持有用性,读者需注意评测基准的局限性。
微调免费策略:开发者的短期红利
OpenAI宣布逐步开放GPT-4o mini的微调,目前已面向tier 4和tier 5用户,并将扩展范围。即日起至9月23日,每天提供200万免费训练token。这一举措降低了开发者尝试微调的门槛,但免费额度有时效性,且初期仅限高等级用户,普通开发者需关注后续开放进度。微调功能可能帮助用户在小模型上实现更定制化的应用。
小模型竞争:性价比与端侧潜力
GPT-4o mini的发布加剧了小模型领域的竞争,其每百万tokens价格远低于其他模型,甚至不到GPT-3.5 Turbo的一半。谷歌、Anthropic、Hugging Face、Mistral等也推出了小模型,苹果则开源了7B模型。小模型在满足使用需求的同时更经济,且更小规模意味着可能端侧运行,在隐私保护方面具有优势。但文章未具体说明端侧部署的实际案例,读者需理性看待其成熟度。
小模型优化大模型:OpenAI的新玩法
OpenAI在“超级对齐”团队的一篇遗作中,使用参数量为大模型千分之一或百分之一的小模型来优化大模型。实验中,大小模型相互博弈,大模型需不断调整输出让小模型相信其说真话,从而在精度无明显损失的情况下大幅提升可理解性。这一方法展示了小模型不仅可作为低成本替代,还能辅助大模型改进,但文章未透露该技术的具体应用时间表。
Q&A
GPT-4o mini的性能如何?
GPT-4o mini在lmsys大模型竞技场中与完整版并列第一,表现优异,仅落后7分。
OpenAI对GPT-4o mini的微调政策是什么?
OpenAI将逐步开放GPT-4o mini的微调,并在9月23日前每天提供200万个免费训练代币。
GPT-4o mini的性价比如何?
GPT-4o mini的每百万tokens价格远低于其他模型,性价比高,甚至不到3.5 Turbo的一半。
lmsys的评测方式有什么特点?
lmsys的评测方式是用户自出题目进行1对1比拼,避免了虚高分数的可能性,更接近真实用户体验。
小模型的推出对市场有什么影响?
小模型的推出促使其他公司开发更小的模型,竞争加剧,同时提供了更经济实惠的选择。
GPT-4o mini与其他模型相比有什么优势?
GPT-4o mini在性能和价格上超越了Claude 3.5和Gemini Flash等竞争对手,性价比极高。