从GPT2到Kimi七年22580倍:Kimi k3怎么塞下2.8T参数?

从GPT2到Kimi七年22580倍:Kimi k3怎么塞下2.8T参数?

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

一台手机能塞下两万台电脑,那电脑会哭吗? GPT-2在2019年还是个大家伙,1.24亿个参数。到了2026年,Kimi K3塞进了2.8万亿个参数。两者一比,差了22580倍。七年时间,数字翻了这么多,中间到底发生了什么?不是简单地把模型做大。每一代架构都在解决同一个头疼的问题:记忆体塞满了怎么办。...

🏷️

标签

➡️

继续阅读