李沐重返母校,上交大秒变追星现场,大模型趋势无保留分享

💡 原文中文,约3500字,阅读约需9分钟。
📝

内容提要

李沐回到上交大做演讲,分享了LLM趋势和个人职业选择,强调LLM的构成包括数据、算力和算法。他详细讲解了大模型的应用和挑战,分享了自己的职业经历和心得,鼓励学生们从动机出发去解决问题。

🔎

延伸解读

LLM的“炼丹”比喻:数据、算力与算法

李沐将LLM的构建比作炼丹,数据是找材料,算力是火候,算法是丹方。这一比喻形象地说明了三者的关系:数据是基础,算力决定规模,算法则不断演进。他特别指出,与以往深度学习不同,LLM的“炼丹”希望模型有“灵魂”,能解决复杂问题。这提示我们,大模型的成功不仅依赖资源堆砌,更需算法创新和对细节的把控。

硬件瓶颈:带宽与内存制约模型规模

李沐强调,LLM硬件中最关键的是带宽,因为分布式训练中机架间的延迟不可忽视。其次是内存,模型体量动辄数百GB,运行时中间变量也很大,内存不足会限制模型大小。他预测未来200G内存的芯片可能不够用。这提醒从业者,在追求更大模型时,需关注硬件瓶颈,尤其是带宽和内存的优化,否则模型规模将受限。

模型训练成本每年减半,但竞争决定价格

李沐分享了一个趋势:模型训练每年会以2倍速度变得更便宜、更快、更大,今年训练的模型到明年价值减半。但他也指出,算力翻倍时价格不一定不变,可能涨至1.4倍,长期看市场竞争足够才能价格不变。这意味着,尽管技术进步降低单位成本,但短期价格受供需影响,创业者需考虑成本动态,避免盲目投入。

多模态趋势与评测难题

李沐认为多模态是当前趋势,语言模型表现较好(80-85分),音频模型够用(70-80分),视频模型仍弱。他提到长文本人机交互将更流行。同时,他指出当前评测太简单,刷榜无法反映真实效果,评测虽重要但难做。这提示开发者和用户,应关注多模态应用的成熟度差异,并谨慎对待评测结果,重视实际使用体验。

❓

Q&A

李沐在演讲中分享了哪些关于LLM的趋势?

李沐分享了LLM的构成,包括数据、算力和算法,并强调了多模态是当前趋势。

李沐如何看待大模型的训练成本?

李沐认为模型训练每年会以2倍速度变得更便宜、更快、更大,未来的训练成本将显著降低。

李沐在演讲中提到的职业选择有哪些?

李沐提到在大公司要考虑升职加薪,博士阶段关注毕业,创业时则要考虑如何退出。

李沐对大模型的应用有什么看法?

李沐认为大模型应用可以为用户提供无限人力资源,只要数据足够,就可以实现自动化。

李沐在演讲中提到的LLM硬件难点是什么?

李沐指出LLM硬件的关键难点是带宽和内存,尤其是在分布式训练中,带宽瓶颈尤为明显。

李沐的创业经历对学生有什么启示?

李沐鼓励学生从动机出发解决问题,强调学术、商业和成长价值的选择。

🏷️

标签

➡️

继续阅读