【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价
原文中文,约14300字,阅读约需34分钟。
📝
内容提要
BERT 的每个设计选择都有可核对的实测代价。本文钉住 BERT 这一条路线本身:80/10/10 掩码策略真正缓解了多少 pretrain-finetune mismatch、NSP 为什么被 RoBERTa 的受控实验指出可能是输入格式而非目标函数在起作用、BERT 为什么在数学上是一个可以生成文本的 Markov Random Field 却没人拿它做生成模型,以及 2024 年之后...
🏷️