内容提要
李沐在上海交大分享了关于语言模型和个人生涯的演讲,讲述了语言模型的算力、数据和算法三个方面,以及硬件、数据和算法未来的发展。他还提到了预训练和后训练的区别,以及垂直模型和评估的重要性。分享了自己的打工人、读博士和创业的经历,以及持续提升自己的方法。鼓励大家抓住当前技术带来的机会,付出更多努力。
延伸解读
技术趋势:内存与带宽成关键瓶颈
李沐指出,未来语言模型的发展将受限于内存和带宽,而非算力。内存大小直接制约模型规模,目前单芯片内存约192GB,未来几年可能难有大幅提升。带宽方面,分布式训练的瓶颈在于芯片间通信,英伟达GB200通过水冷和紧凑设计提升带宽,但光纤长度带来的纳秒级延迟仍影响性能。这些硬件限制意味着模型参数将集中在100B到500B,更大模型需依赖MoE架构。
应用落地:文科白领易自动化,蓝领最难
李沐将AI应用分为三类:文科白领、工科白领和蓝领。文科白领任务如个人助理、文本处理,AI能完成80-90%;工科白领如编程,AI尚不能取代人类一小时的工作;蓝领工作除自动驾驶等封闭场景外,因物理世界数据采集难,AI连简单任务都难以完成。他强调,数据采集是自动化的前提,传统企业需先积累数据,急不来。
创业心得:后训练是技术核心,评估至关重要
李沐分享创业一年半的体会:预训练已变为工程问题,后训练才是技术问题,高质量结构化数据能大幅提升效果。垂直模型并非伪命题,但通用能力不能差。评估是重中之重,好的评估能解决50%的问题,并带来数据。数据决定模型上限,算法决定下限。他建议创业公司聚焦后训练,避免与巨头在预训练上硬拼。
个人成长:动机与定期反思
李沐提出持续提升自我的方法:每周花30分钟总结,每季度回顾目标,每年或每五年审视动机。动机应源于深层的欲望或恐惧,并转化为积极向上的动力。选择比努力更重要,但前提是明确目标。他鼓励抓住当前技术变革的机会,但也要意识到需要比上一代付出更多努力。
Q&A
李沐在演讲中提到的语言模型的核心要素是什么?
语言模型的核心要素包括算力、数据和算法。
李沐如何看待未来算力和内存的发展?
未来几年,算力、内存和带宽将会有显著的发展,算力价格长期来看会逐渐降低。
李沐在演讲中分享了哪些个人经历?
李沐分享了自己在大公司、读博士和创业的经历,强调了不同阶段的目标和挑战。
李沐对创业的看法是什么?
李沐认为创业需要强烈的动机和对复杂社会的理解,同时也面临许多挑战。
李沐提到的持续提升自我的方法是什么?
李沐建议定期总结和反思个人目标,以持续提升自我。
李沐如何看待当前技术带来的机会?
李沐鼓励大家抓住当前技术带来的机会,付出更多努力以获得成功。